HeadlinesBriefing favicon HeadlinesBriefing.com

推論プレフィル研究:GPT-5.5 Pro

Hacker News •
×

この v1.1 は、GPT-5.5 Pro を教師として使用した推論プレフィル実験を再実行します。45 問(STEM 15 問、非 STEM 15 問、合成パズル 15 問)のそれぞれについて、ターゲットモデルごとに 2 つの応答が生成されました:プレフィルなしと、GPT-5.5 Pro の隠れた推論の最初の 1% をプレフィルしたもの。可視の回答は自由に生成されたままでした。スコアは、教師の可視回答がターゲットの回答の最初の 100 トークンにどれだけ現れたかを、平均ユニグラム、バイグラム、トライグラム再現率を使用して測定しました。

結果は、Deep Seek V4 Flash のデルタが -1.17 パーセントポイントで、27% から 26.13% に低下したことを示しています。Inkling は 19.99% から 20.45%(+0.46 pp)に上昇しました。Kimi K3 は 31.11% から 35.65%(+4.54 pp)に増加しました。Qwen3.8 A95B は最大のシフトを示し、16.79% から 34.97%(+18.18 pp)になりました。

カテゴリ別では、Qwen の改善は合成パズルで最も強く(+26.99 pp、19.26% から 46.24%)、次いで非 STEM(+12.80 pp)、STEM(+14.75 pp)でした。全体として、Qwen は以前の実験では Opus 4.8 に向かってほとんど動きませんでしたが、ここでは GPT-5.5 Pro に向かって大幅に動き、GPT-5.5 Pro または密接に関連するモデルから学習した可能性を示唆しています。Kimi K3 は、プレフィルなしとありの両方で GPT-5.5 Pro との生の重複が最も高かったですが、そのプレフィルによる利得は控えめでした。