HeadlinesBriefing favicon HeadlinesBriefing.com

Исследование предзаполнения: GPT-5.5 Pro

Hacker News •
×

Эта v1.1 повторяет эксперимент с предварительным заполнением рассуждений, используя GPT-5.5 Pro в качестве учителя. Для каждой из 45 задач (15 STEM, 15 не-STEM, 15 синтетических головоломок) для каждой целевой модели было сгенерировано два ответа: один без предзаполнения и один с предзаполнением первыми 1% скрытых рассуждений GPT-5.5 Pro. Видимый ответ оставался свободно генерируемым. Оценки измеряли, сколько видимого ответа учителя появлялось в первых 100 токенах ответа цели, используя средний recall униграмм, биграмм и триграмм.

Результаты показывают, что Deep Seek V4 Flash имел дельту -1,17 процентного пункта, упав с 27% до 26,13%. Inkling вырос с 19,99% до 20,45% (+0,46 п.п.). Kimi K3 увеличился с 31,11% до 35,65% (+4,54 п.п.). Qwen3.8 A95B показал наибольший сдвиг, с 16,79% до 34,97% (+18,18 п.п.).

По категориям улучшение Qwen было самым сильным в синтетических головоломках (+26,99 п.п., с 19,26% до 46,24%), за которыми следуют не-STEM (+12,80 п.п.) и STEM (+14,75 п.п.). В целом, Qwen едва сдвинулся в сторону Opus 4.8 в предыдущем эксперименте, но значительно сдвинулся в сторону GPT-5.5 Pro здесь, что предполагает, что он мог учиться у GPT-5.5 Pro или тесно связанной модели. Kimi K3 имел самый высокий сырой перекрытие с GPT-5.5 Pro как без, так и с предзаполнением, хотя его выигрыш от предзаполнения был скромным.