HeadlinesBriefing favicon HeadlinesBriefing.com

Estudio de Prefill de Razonamiento: GPT-5.5 Pro

Hacker News •
×

Esta v1.1 repite un experimento de prefill de razonamiento usando GPT-5.5 Pro como maestro. Para cada uno de los 45 problemas (15 STEM, 15 no STEM, 15 rompecabezas sintéticos), se generaron dos respuestas por modelo objetivo: una sin prefill y otra con el primer 1% del razonamiento oculto de GPT-5.5 Pro. La respuesta visible permaneció generada libremente. Las puntuaciones midieron cuánto de la respuesta visible del maestro aparecía en los primeros 100 tokens de la respuesta del objetivo, usando recall medio de unigramas, bigramas y trigramas.

Los resultados muestran que Deep Seek V4 Flash tuvo un delta de -1.17 puntos porcentuales, cayendo de 27% a 26.13%. Inkling subió de 19.99% a 20.45% (+0.46 pp). Kimi K3 aumentó de 31.11% a 35.65% (+4.54 pp). Qwen3.8 A95B mostró el mayor cambio, de 16.79% a 34.97% (+18.18 pp).

Por categoría, la mejora de Qwen fue más fuerte en rompecabezas sintéticos (+26.99 pp, de 19.26% a 46.24%), seguido de no STEM (+12.80 pp) y STEM (+14.75 pp). En general, Qwen apenas se movió hacia Opus 4.8 en un experimento anterior, pero se movió significativamente hacia GPT-5.5 Pro aquí, sugiriendo que puede haber aprendido de GPT-5.5 Pro o un modelo estrechamente relacionado. Kimi K3 tuvo el mayor solapamiento bruto con GPT-5.5 Pro tanto sin como con prefill, aunque su ganancia por prefill fue modesta.