HeadlinesBriefing HeadlinesBriefing.com

Température 0 : pourquoi non déterministe

Towards Data Science •
×

En septembre 2025, Horace He et ses collègues de Thinking Machines Lab ont envoyé l'invite "Tell me about Richard Feynman" à Qwen3-235B 1 000 fois à température 0, s'attendant à des réponses identiques de 1 000 tokens. Ils ont obtenu 80 finalisations uniques. Toutes les exécutions étaient identiques pour les 102 premiers tokens ; au token 103, 992 ont continué avec "Queens, New York" et 8 avec "New York City". Les basculations ne sont pas causées par l'aléatoire des threads GPU, mais par des noyaux dont l'ordre de réduction change avec la taille du lot, faisant dépendre les sorties de nombre d'autres demandes en cours.

À température 0, le modèle choisit le token au logit le plus haut, ce qui est déterministe en mathématiques mais pas en arithmétique à virgule flottante, où l'addition n'est pas associative. Un réseau neuronal effectue des milliards de telles sommes, donc l'ordre du hardware importe. He et al. montrent que les passages avant typiques ne contiennent pas d'ajouts atomiques et retournent les mêmes bits sur la même entrée, mais de nombreux noyaux ne sont pas invariants par lot.

Mathématiquement, soient z₁ et z₂ les deux plus grands logits avec un écart M = z₁ - z₂ >= 0. Le bruit numérique modifie l'écart d'une erreur Δ, et l'argmax bascule seulement si M + Δ < 0. Un écart de 8 logits ne bascule jamais ; seuls les quasi-égalités sont à risque. La probabilité de bascule par token est p ≈ f(0) · E|Δ| / 2, où f(0) est la densité des quasi-égalités et E|Δ| est l'amplitude attendue du bruit.

Avec des noyaux invariants par lot, les 1 000 finalisations Feynman sont venues identiques. Le fix coûte de la performance : la version déterministe non optimisée a pris 55 secondes contre 26 pour vLLM par défaut.

Source: Towards Data Science · Résumé par HeadlinesBriefing