HeadlinesBriefing HeadlinesBriefing.com

Suhu 0: Mengapa Tidak Deterministik

Towards Data Science •
×

Di September 2025, Horace He dan rekan dari Thinking Machines Lab mengirim prompt "Tell me about Richard Feynman" ke Qwen3-235B 1.000 kali pada suhu 0, mengharapkan jawaban identis 1.000 token. Mereka mendapatkan 80 penyelesaian unik. Semua run identis untuk 102 token pertama; pada token 103, 992 melanjutkan dengan "Queens, New York" dan 8 dengan "New York City". Perubahan ini tidak disebabkan oleh keacakan thread GPU, tetapi oleh kernel yang urutan reduksinya berubah dengan ukuran batch, membuat output bergantung pada berapa banyak yang sedang meminta saat itu.

Pada suhu 0, model memilih token dengan logit tertinggi, yang deterministik dalam matematika tetapi tidak dalam aritmetika floating-point, di mana penjumlahan tidak asosiatif. Jaringan saraf melakukan miliaran penjumlahan, jadi urutan hardware penting. He et al. menunjukkan bahwa forward pass tipikal tidak mengandung atomic add dan mengembalikan bit yang sama pada input yang sama, tetapi banyak kernel tidak invariant batch.

Secara matematis, misalkan z₁ dan z₂ adalah dua logit terbesar dengan selisih M = z₁ - z₂ >= 0. Noise numerik mengubah selisih dengan error Δ, dan argmax flip hanya jika M + Δ < 0. Selisih 8 logit tidak pernah flip; hanya near-tie yang berisiko. Probabilitas flip per token adalah p ≈ f(0) · E|Δ| / 2, di mana f(0) adalah kerapatan near-tie dan E|Δ| adalah besarnya noise yang diharapkan.

Dengan kernel invariant batch, semua 1.000 penyelesaian Feynman keluar identis. Fix biaya performasi: versi deterministik tidak dioptimalkan mengambil 55 detik versus 26 untuk vLLM default.

Sumber: Towards Data Science · Diringkas oleh HeadlinesBriefing