HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE:AI 在私有代码库上的表现

Hacker News •
×

2026 年 9 月 Real-SWE 基准测试在私有的真实世界企业代码库上评估前沿 AI 模型。每项任务都源自从真实公司获得许可的私有生产代码库,让工程师面对专有系统和业务关键问题。结果揭示了领先模型之间显著的性能差距,其中 Claude Code 以 38.8% 的最高解决率位居首位,其次是 GPT-6 Astra Codex CLI,为 33.8%,Gemini 3.8 Flash 为 31.2%。该评估衡量模型与框架的组合,要求智能体理解专有惯例,并实施会影响跨多个服务的业务运营的变更。真实公司的任务需要特定上下文,例如正确计费取决于业务规则和外部税务服务。任务涉及修复发票计费,使每家企业都征收正确的税款,同时免税客户仍无需纳税。该基准测试强调,专家生成或合成的任务与实际工程师的工作不同,因为底层编码产物和指令的具体性都会增加复杂性,从而对当今的前沿模型构成挑战。