HeadlinesBriefing favicon HeadlinesBriefing.com

Studi Prefill Reasoning: GPT-5.5 Pro

Hacker News •
×

v1.1 ini mengulangi eksperimen prefill reasoning menggunakan GPT-5.5 Pro sebagai guru. Untuk setiap 45 masalah (15 STEM, 15 non-STEM, 15 puzzle sintetis), dua respons digenerasi per model target: satu tanpa prefill dan satu dengan prefill 1% pertama dari reasoning tersembunyi GPT-5.5 Pro. Jawaban terlihat tetap digenerasi bebas. Skor mengukur berapa banyak jawaban terlihat guru muncul dalam 100 token pertama jawaban target, menggunakan recall rata-rata unigram, bigram, dan trigram.

Hasil menunjukkan Deep Seek V4 Flash memiliki delta -1,17 poin persent, turun dari 27% ke 26,13%. Inkling naik dari 19,99% ke 20,45% (+0,46 pp). Kimi K3 meningkat dari 31,11% ke 35,65% (+4,54 pp). Qwen3.8 A95B menunjukkan perubahan terbesar, dari 16,79% ke 34,97% (+18,18 pp).

Per kategori, peningkatan Qwen terkuat dalam puzzle sintetis (+26,99 pp, dari 19,26% ke 46,24%), kemudian non-STEM (+12,80 pp) dan STEM (+14,75 pp). Secara umum, Qwen hampir tidak bergerak ke arah Opus 4.8 dalam eksperimen sebelumnya, tetapi bergerak signifikan ke arah GPT-5.5 Pro di sini, menunjukkan bahwa ia mungkin belajar dari GPT-5.5 Pro atau model yang terkait erat. Kimi K3 memiliki overlap bruto tertinggi dengan GPT-5.5 Pro baik tanpa maupun dengan prefill, meski gain prefillnya modest.