HeadlinesBriefing HeadlinesBriefing.com

Temperatur 0: Warum nicht deterministisch

Towards Data Science •
×

Im September 2025 sandte Horace He und seine Kollegen von Thinking Machines Lab den Prompt "Tell me about Richard Feynman" 1000 Mal bei Temperatur 0 an Qwen3-235B, erwartend identische 1000-Token-Antworten. Sie erhielten 80 eindeutige Vervollständigungen. Alle Läufe waren für die ersten 102 Token identisch; bei Token 103 setzten 992 mit "Queens, New York" fort, 8 mit "New York City". Die Umkehrungen werden nicht durch GPU-Thread-Zufall verursacht, sondern durch Kerne, deren Reduktionsreihenfolge sich mit Batch-Größe ändert, wodurch Ausgaben davon abhängen, wie viele andere in diesem Moment anfragen.

Bei Temperatur 0 wählt das Modell das Token mit dem höchsten Logit, was in der Mathematik deterministisch ist, aber in der Fließkomma-Arithmetik nicht, da Addition nicht assoziativ ist. Ein neuronales Netz führt Milliarden solcher Summen aus, also mattered die Hardware-Reihenfolge. He et al. zeigten, typische Vorwärtsdurchläufe enthalten keine atomaren Adds und liefern gleiche Bits bei gleichem Input, aber viele Kerne sind nicht batch-invariant.

Mathematisch seien z₁ und z₂ die beiden größten Logits mit Gap M = z₁ - z₂ >= 0. Numerischer Lärm ändert das Gap um Fehler Δ, und argmax kehrt nur um, wenn M + Δ < 0. Ein Gap von 8 Logits kehrt nie um; nur near-ties sind gefährdet. Die Umkehrwahrscheinlichkeit pro Token ist p ≈ f(0) · E|Δ| / 2, wobei f(0) die Dichte der near-ties ist und E|Δ| die erwartete Rauschmagnitude.

Mit batch-invarianten Kernen kamen alle 1000 Feynman-Vervollständigungen identisch heraus. Die Fixierung kostet Leistung: die unoptimierte deterministische Version dauerte 55 Sekunden versus 26 für Standard-vLLM.

Quelle: Towards Data Science · Zusammengefasst von HeadlinesBriefing