HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE: IA en bases de código privadas

Hacker News •
×

El benchmark Real-SWE de septiembre de 2026 evalúa modelos de IA de vanguardia en bases de código empresariales privadas del mundo real. Cada tarea procede de una base de código de producción privada con licencia de una empresa real, y presenta a los ingenieros sistemas propietarios y problemas críticos para el negocio. Los resultados revelan brechas significativas de rendimiento entre los modelos líderes, con Claude Code logrando la tasa de resolución más alta, del 38,8 %, seguido de GPT-6 Astra Codex CLI con un 33,8 % y Gemini 3.8 Flash con un 31,2 %.

La evaluación mide combinaciones de modelo y arnés, y exige a los agentes navegar por convenciones propietarias e implementar cambios que afecten a las operaciones del negocio en varios servicios. Las tareas de empresas reales exigen un contexto específico, como que la facturación correcta dependa de reglas comerciales y servicios fiscales externos. Las tareas consisten en corregir la facturación de facturas para que cada empresa cobre el impuesto correcto mientras los clientes exentos siguen sin tributar.

El benchmark destaca que las tareas generadas por expertos o sintéticas difieren del trabajo real de los ingenieros, ya que tanto el artefacto de código subyacente como la especificidad de las instrucciones añaden complejidad que desafía a los modelos de vanguardia actuales.