HeadlinesBriefing favicon HeadlinesBriefing.com

Astra 模型达到关键网络安全能力阈值

Hacker News •
×

我们现在认为 Astra 达到了我们准备框架下的关键网络安全能力阈值,这意味着它可以在无需人工指导的情况下,在许多受保护良好的系统中发现先前未知的安全漏洞并开发利用。它是我们首次指定达到此级别的模型,在开发和发布前需要更强的防护措施。最近几周,我们推迟了 Astra 部分开发工作,以加强防范网络滥用和未经授权模型行为的保护。虽然 Astra 未参与 Hugging Face 事件,但我们将该事件的经验教训纳入了我们的安全方法中。我们已为 Astra 实施了更强的防护措施,包括训练模型更可靠地拒绝有害的网络请求,增加防止滥用的保护,以及监控以阻止潜在的未经授权活动。我们计划很快让 Astra 可用,但其最先进的网络安全能力的访问将更加受限。高级网络安全工作最初将仅向一组测试者开放,随后通过 Daybreak Blue 扩展防御性使用。我们将在模型的系统卡中于发布时分享更多关于安全、安全性和对齐测试的详情。

根据我们的准备框架,如果模型能够在无需人工干预的情况下,在许多加固的现实世界关键系统中识别和开发所有严重程度级别的功能性零日漏洞利用,或者仅凭高级目标就能设计和执行针对加固目标的端到端全新网络攻击策略,则该模型达到关键阈值。我们的评估结合了自动化的公共和私有基准以及专家驱动的评估。与 GPT‑5.6 Sol 相比,Astra 代表了网络安全能力的显著提升:它不仅令牌效率更高,而且在漏洞识别和利用开发方面更强大。在 Exploit Bench 基准测试中,Astra 在评估从已知漏洞开发利用的基准上获得了满分 100%。在包含最近披露的 20 个高严重性 V8 漏洞的内部基准测试中,Astra 实现了比 GPT‑5.6 Sol 更高的任意代码执行率,且使用了远少于 GPT‑5.6 Sol 的输出令牌。在评估过程中,模型发现并使用了 两个零日漏洞 作为利用链的一部分,我们正在向维护者披露这些漏洞。在专家主导的针对加固浏览器和操作系统的评估中,Astra 发现了先前未知的漏洞并将其转化为可工作的利用链,构建了一个逃脱沙箱的完整浏览器妥协链。

关键实体:公司:Hugging Face

常见问题:Astra 达到关键网络安全能力阈值是什么意思?

达到关键阈值意味着 Astra 可以在无需人工干预的情况下,在许多加固的现实世界系统中识别和开发功能性零日漏洞利用,或者仅凭高级目标就能设计和执行针对加固目标的端到端全新网络攻击策略,如准备框架所定义。