HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE: KI auf privaten Codebasen

Hacker News •
×

Das Real-SWE-Benchmarking vom September 2026 bewertet führende KI-Modelle auf privaten, realen Unternehmens-Codebasen. Jede Aufgabe stammt aus einer privaten Produktions-Codebase, die von einem realen Unternehmen lizenziert wurde, und stellt Ingenieure vor proprietäre Systeme und geschäftskritische Probleme. Die Ergebnisse zeigen erhebliche Leistungsunterschiede zwischen den führenden Modellen: Claude Code erzielte mit 38,8 % die höchste Lösungsrate, gefolgt von GPT-6 Astra Codex CLI mit 33,8 % und Gemini 3.8 Flash mit 31,2 %.

Die Evaluierung misst Modell-und-Harness-Kombinationen und verlangt von den Agenten, proprietäre Konventionen zu navigieren und Änderungen umzusetzen, die die Geschäftsabläufe über mehrere Dienste hinweg beeinflussen. Aufgaben realer Unternehmen erfordern spezifischen Kontext, etwa dass die korrekte Abrechnung von Geschäftsregeln und externen Steuerservices abhängt. Die Aufgaben umfassen die Korrektur der Rechnungsabrechnung, sodass jedes Unternehmen die richtige Steuer erhebt, während befreite Kunden steuerfrei bleiben.

Der Benchmark hebt hervor, dass expertengenerierte oder synthetische Aufgaben von der tatsächlichen Arbeit von Ingenieuren abweichen, da sowohl das zugrunde liegende Codierungsartefakt als auch die Spezifität der Instruktionen Komplexität hinzufügen, die die heutigen führenden Modelle vor Herausforderungen stellt.