Em setembro de 2025, Horace He e colegas do Thinking Machines Lab enviaram o prompt "Tell me about Richard Feynman" ao Qwen3-235B 1.000 vezes à temperatura 0, esperando respostas idênticas de 1.000 tokens. Eles obtiverem 80 finalizações únicas. Todas as execuções foram idênticas para os primeiros 102 tokens; no token 103, 992 continuaram com "Queens, New York" e 8 com "New York City". As inversões não são causadas por aleatoriedade de threads GPU, mas por kernels cuja ordem de redução muda com o tamanho do lote, fazendo as saídas dependerem de quantos outros estão solicitando naquele momento.
À temperatura 0, o modelo escolhe o token de maior logit, o que é determinístico em matemática, mas não em aritmética de ponto flutuante, onde a adição não é associativa. Uma rede neural realiza bilhões de somas, portanto a ordem do hardware importa. He et al. mostram que os passos diretos típicos não contêm adições atômicas e devolvem os mesmos bits na mesma entrada, mas muitos kernels não são invariantes por lote.
Matematicamente, sejam z₁ e z₂ os dois maiores logits com gap M = z₁ - z₂ >= 0. O ruído numérico altera o gap por um erro Δ, e o argmax inverte apenas se M + Δ < 0. Um gap de 8 logits nunca inverte; apenas quase-empates estão em risco. A probabilidade de inversão por token é p ≈ f(0) · E|Δ| / 2, onde f(0) é a densidade de quase-empates e E|Δ| é a magnitude esperada do ruído.
Com kernels invariantes por lote, as 1.000 finalizações de Feynman saíram idênticas. A correção custa desempenho: a versão determinística não otimizada levou 55 segundos versus 26 para vLLM padrão.
Fonte: Towards Data Science · Resumido por HeadlinesBriefing