HeadlinesBriefing favicon HeadlinesBriefing.com

Estudo de Prefill de Raciocínio: GPT-5.5 Pro

Hacker News •
×

Esta v1.1 repete um experimento de prefill de raciocinio usando GPT-5.5 Pro como professor. Para cada um dos 45 problemas (15 STEM, 15 não-STEM, 15 quebra-cabeças sintéticos), foram geradas duas respostas por modelo alvo: uma sem prefill e outra prefillada com os primeiros 1% do raciocinio oculto de GPT-5.5 Pro. A resposta visível permanecía generada livremente. As pontuações mediam quanto da resposta visível do professor aparecia nos primeiros 100 tokens da resposta alvo, usando recall médio de unigramas, bigramas e trigramas.

Os resultados mostram que Deep Seek V4 Flash teve um delta de -1,17 pontos percentuais, caindo de 27% a 26,13%. Inkling subiu de 19,99% a 20,45% (+0,46 pp). Kimi K3 aumentou de 31,11% a 35,65% (+4,54 pp). Qwen3.8 A95B mostrou o maior cambio, de 16,79% a 34,97% (+18,18 pp).

Por categoria, a melhora de Qwen foi mais forte em quebra-cabeças sintéticos (+26,99 pp, de 19,26% a 46,24%), seguido por não-STEM (+12,80 pp) e STEM (+14,75 pp). Em geral, Qwen quase não se moveu em direção a Opus 4.8 em um experimento anterior, mas se moveu significativamente em direção a GPT-5.5 Pro aqui, sugerindo que pode ter aprendido de GPT-5.5 Pro ou de um modelo estreitamente relacionado. Kimi K3 teve a maior superposição bruta com GPT-5.5 Pro tanto sem como com prefill, embora seu ganho por prefill fosse modesto.