HeadlinesBriefing HeadlinesBriefing.com

温度0 非決定的的理由

Towards Data Science •
×

2025年9月、Thinking Machines LabのHorace Heと同僚たは、Qwen3-235Bに「Tell me about Richard Feynman」を温度0で1000回送信し、同じ1000トーカンの回答を期待した。しかし、80つの異なる完了を得た。すべての実行は最初の102トーカンまで同一であり、103トーカン目で、992が「Queens, New York」を、8が「New York City」を継続した。この分岐はGPUスレッドのランダムネスではなく、バッチサイズに応じて削減順序が変わるカーネルが原因で、同時刻に他のリクエストが何件あるかによって出力が変わる。

温度0ではモデルが最高ロジットのトーカンを選ぶが、これは数学では決定的でも浮動小数点演算では非結合的でない。神経ネットワークは数十億回の加算を行うため、ハードウェアの順序が重要である。Heらは、通常の前方伝播には原子加算がなく、同じ入力で同じビットを返すが、多くのカーネルはバッチ不変でないことを示した。

数理的に、z₁とz₂を二つの最大ロジットとし、差M = z₁ - z₂ >= 0とする。数値ノイズはΔの誤差で差を変化させ、argmaxはM + Δ < 0のときのみ反転する。8ロジットの差は反転せず、 nearly-tieのみがリスクである。1トーカン目の反転確率は p ≈ f(0) · E|Δ| / 2 で、f(0)は nearly-tieの密度、E|Δ|は期待ノイズ大きさである。

バッチ不変カーネルを使用すると、1000つのFeynman完了はすべて同一になった。しかし、最適化されていない決定版には55秒かかかり、デフォルトvLLMの26秒に compared.

出典: Towards Data Science · 要約:HeadlinesBriefing