HeadlinesBriefing favicon HeadlinesBriefing.com

Reasoning-Prefill-Studie: GPT-5.5 Pro

Hacker News •
×

Diese v1.1 führt ein Reasoning-Prefill-Experiment erneut durch, wobei GPT-5.5 Pro als Lehrer verwendet wird. Für jedes der 45 Probleme (15 STEM, 15 Nicht-STEM, 15 synthetische Rätsel) wurden pro Zielmodell zwei Antworten generiert: eine ohne Prefill und eine mit den ersten 1% des verborgenen Reasoning von GPT-5.5 Pro. Die sichtbare Antwort blieb frei generiert. Die Bewertungen maßen, wie viel der sichtbaren Antwort des Lehrers in den ersten 100 Tokens der Zielantwort erschien, unter Verwendung des mittleren Unigramm-, Bigramm- und Trigramm-Recalls.

Die Ergebnisse zeigen, dass Deep Seek V4 Flash ein Delta von -1,17 Prozentpunkten hatte und von 27% auf 26,13% fiel. Inkling stieg von 19,99% auf 20,45% (+0,46 pp). Kimi K3 erhöhte sich von 31,11% auf 35,65% (+4,54 pp). Qwen3.8 A95B zeigte die größte Verschiebung, von 16,79% auf 34,97% (+18,18 pp).

Nach Kategorie war Qwens Verbesserung bei synthetischen Rätseln am stärksten (+26,99 pp, von 19,26% auf 46,24%), gefolgt von Nicht-STEM (+12,80 pp) und STEM (+14,75 pp). Insgesamt bewegte sich Qwen in einem früheren Experiment kaum in Richtung Opus 4.8, aber hier deutlich in Richtung GPT-5.5 Pro, was darauf hindeutet, dass es möglicherweise von GPT-5.5 Pro oder einem eng verwandten Modell gelernt hat. Kimi K3 hatte die höchste rohe Überlappung mit GPT-5.5 Pro sowohl ohne als auch mit Prefill, obwohl sein Prefill-Gewinn bescheiden war.