HeadlinesBriefing HeadlinesBriefing.com

Ornith-1.5:自我改进基础模型

Hacker News •
×

Ornith-1.5代表了迈向端到端自我改进基础模型的重大进步。在Ornith-1.0的自搭架框架基础上,Ornith-1.5建立了一个完整的自我改进循环,其中模型提出新任务、生成特定于任务的脚手架,并为强化学习生成解决方案 rollouts。这种连续循环创造新的学习经验,推动持续的能力提升。

该系统涵盖三个模型规模:397B MoE、35B MoE和9B Dense。旗舰型号Ornith-1.5-397B在同等规模的开源模型中实现了最先进的性能,在Terminal-Bench 2.1上得分为86.1,在Deep SWE上得分为56.0。这些结果与Claude Opus 4.8(85.0和59.0)相匹配,并优于诸如GLM-5.2和Deep Seek-V4-Flash-0731等领先的开源模型。

在较小端,Ornith-1.5-9B凭借其出色的性能表现,实现了Terminal-Bench 2.1上47.0分和SWE-Bench Verified上70.6分。其量化版Ornith-1.5-9B-Mobile可以直接部署在iPhone和Android设备上,同时显著优于更大的模型,如Gemma 4-31B和Qwen 3.6-35B。

与依赖静态训练分布或手动设计的代理设计不同,Ornith-1.5不断扩展自己的课程并通过闭环自我改进(包括任务生成、脚手架构建和解决方案 rollouts)适应问题解决策略。

关键实体:公司:Anthropic、Google、Meta、Zhipu AI、DeepSeek

来源: Hacker News · 由HeadlinesBriefing整理摘要