HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE: IA em bases de código privadas

Hacker News •
×

O benchmark Real-SWE de setembro de 2026 avalia modelos de IA de ponta em bases de código empresariais privadas do mundo real. Cada tarefa se origina de uma base de código de produção privada licenciada por uma empresa real, apresentando aos engenheiros sistemas proprietários e problemas críticos para os negócios. Os resultados revelam lacunas significativas de desempenho entre os modelos líderes, com o Claude Code alcançando a maior taxa de resolução, de 38,8%, seguido pelo GPT-6 Astra Codex CLI com 33,8% e pelo Gemini 3.8 Flash com 31,2%.

A avaliação mede combinações de modelo e harness, exigindo que os agentes naveguem por convenções proprietárias e implementem mudanças que afetem as operações de negócios em vários serviços. As tarefas de empresas reais exigem contexto específico, como uma cobrança correta que dependa de regras de negócios e serviços fiscais externos. As tarefas envolvem corrigir a cobrança de faturas para que cada negócio cobre o imposto correto, enquanto clientes isentos permanecem sem tributação.

O benchmark destaca que tarefas geradas por especialistas ou sintéticas diferem do trabalho real de engenheiros, pois tanto o artefato de codificação subjacente quanto a especificidade das instruções acrescentam complexidade que desafia os modelos de ponta atuais.