HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE : IA sur des bases de code privées

Hacker News •
×

Le benchmark Real-SWE de septembre 2026 évalue les modèles d’IA de pointe sur des bases de code d’entreprise privées issues du monde réel. Chaque tâche provient d’une base de code de production privée concédée sous licence par une entreprise réelle, présentant aux ingénieurs des systèmes propriétaires et des problèmes essentiels pour l’activité. Les résultats révèlent d’importants écarts de performance entre les modèles leaders, Claude Code obtenant le taux de résolution le plus élevé, à 38,8 %, suivi de GPT-6 Astra Codex CLI à 33,8 % et de Gemini 3.8 Flash à 31,2 %.

L’évaluation mesure des combinaisons modèle et harnais, exigeant des agents qu’ils naviguent dans des conventions propriétaires et mettent en œuvre des changements affectant les opérations commerciales sur plusieurs services. Les tâches de sociétés réelles exigent un contexte spécifique, par exemple une facturation correcte dépendant de règles métier et de services fiscaux externes. Les tâches consistent à corriger la facturation des factures afin que chaque entreprise applique la bonne taxe tandis que les clients exonérés restent non imposés.

Le benchmark souligne que les tâches générées par des experts ou synthétiques diffèrent du travail réel des ingénieurs, car l’artefact de codage sous-jacent et la spécificité des instructions ajoutent toutes deux une complexité qui met au défi les modèles de pointe actuels.