HeadlinesBriefing favicon HeadlinesBriefing.com

Étude de Pré-remplissage : GPT-5.5 Pro

Hacker News •
×

Cette v1.1 relance une expérience de pré-remplissage de raisonnement utilisant GPT-5.5 Pro comme enseignant. Pour chacun des 45 problèmes (15 STEM, 15 non-STEM, 15 énigmes synthétiques), deux réponses ont été générées par modèle cible : une sans pré-remplissage et une pré-remplie avec les 1% initiaux du raisonnement caché de GPT-5.5 Pro. La réponse visible restait générée librement. Les scores mesuraient combien de la réponse visible de l'enseignant apparaissait dans les 100 premiers tokens de la réponse cible, en utilisant le rappel moyen d'unigrammes, de bigrammes et de trigrammes.

Les résultats montrent que Deep Seek V4 Flash a eu un delta de -1,17 point de pourcentage, passant de 27% à 26,13%. Inkling est passé de 19,99% à 20,45% (+0,46 pp). Kimi K3 a augmenté de 31,11% à 35,65% (+4,54 pp). Qwen3.8 A95B a montré le plus grand changement, de 16,79% à 34,97% (+18,18 pp).

Par catégorie, l'amélioration de Qwen était la plus forte dans les énigmes synthétiques (+26,99 pp, de 19,26% à 46,24%), suivie par non-STEM (+12,80 pp) et STEM (+14,75 pp). Globalement, Qwen a à peine bougé vers Opus 4.8 dans une expérience précédente, mais a bougé significativement vers GPT-5.5 Pro ici, suggérant qu'il a peut-être appris de GPT-5.5 Pro ou d'un modèle étroitement lié. Kimi K3 avait le chevauchement brut le plus élevé avec GPT-5.5 Pro à la fois sans et avec pré-remplissage, bien que son gain de pré-remplissage fût modeste.