HeadlinesBriefing favicon HeadlinesBriefing.com

推理预填充研究:GPT-5.5 Pro 影响

Hacker News •
×

此 v1.1 版本使用 GPT-5.5 Pro 作为教师,重新运行推理预填充实验。对于 45 个问题(15 个 STEM、15 个非 STEM、15 个合成谜题),每个目标模型生成两个响应:一个未预填充,另一个预填充了 GPT-5.5 Pro 隐藏推理的前 1%。可见答案仍自由生成。分数衡量目标答案前 100 个 token 中教师可见答案的出现程度,使用平均一元、二元和三元召回率。

结果显示,Deep Seek V4 Flash 的 delta 为 -1.17 个百分点,从 27% 降至 26.13%。Inkling 从 19.99% 升至 20.45%(+0.46 个百分点)。Kimi K3 从 31.11% 升至 35.65%(+4.54 个百分点)。Qwen3.8 A95B 变化最大,从 16.79% 升至 34.97%(+18.18 个百分点)。

按类别划分,Qwen 在合成谜题中的提升最强(+26.99 个百分点,从 19.26% 升至 46.24%),其次是非 STEM(+12.80 个百分点)和 STEM(+14.75 个百分点)。总体而言,Qwen 在之前的实验中几乎未向 Opus 4.8 移动,但在此处向 GPT-5.5 Pro 显著移动,表明它可能从 GPT-5.5 Pro 或密切相关模型学习。Kimi K3 在无预填充和有预填充情况下与 GPT-5.5 Pro 的原始重叠度最高,但其预填充增益不大。