HeadlinesBriefing favicon HeadlinesBriefing.com

Astraモデルがサイバーセキュリティの重要な能力閾値に到達

Hacker News •
×

私たちは今、Astraが私たちの準備フレームワークにおけるサイバーセキュリティの重要な能力閾値を満たしていると考えています。これは、人間の指導なしで、よく保護されている多くのシステムにおいて以前未知のセキュリティ脆弱性を見つけ出し、エクスプロイトを開発できるということを意味します。これは、このレベルに指定する最初のモデルであり、開発およびリリース前に強化されたセーフガードが必要となります。過去数週間、私たちはサイバーの悪用およびモデルの不正な動作に対する保護を強化するために、Astraの開発の一部を延期しました。AstraはHugging Faceのインシデントに関与していませんでしたが、そのイベントから得た教訓を私たちの安全アプローチに組み込んでいます。私たちはAstraに対してより強力なセーフガードを実装しており、これには有害なサイバーリクエストをより信頼性高く拒否するようにモデルを訓練すること、悪用に対する追加の保護、および潜在的に不正な活動を停止するための監視が含まれます。私たちはAstraを近いうちに利用可能にする予定ですが、その最も高度なサイバーセキュリティ機能へのアクセスはより制限されるでしょう。高度なサイバーセキュリティ作業は最初にテスターのグループに提供され、Daybreak Blueを通じてアクセスを広げて防御的使用を拡大します。私たちは、モデルのシステムカードにおいてローンチ時にセキュリティ、安全性、およびアライメントテストに関する詳細を共有する予定です。

私たちの準備フレームワークによれば、モデルが重要な閾値を満たすとは、人間の介入なしで、多くの強化された実際の世界の重要なシステムにおいてすべての深刻度レベルの機能的なゼロデイエクスプロイトを特定し開発できるか、または高レベルの目標のみが与えられた状態で、強化されたターゲットに対して新規なエンドツーエンドのサイバー攻撃戦略を考案および実行できるということです。私たちの評価は、自動化された公開および非公開のベンチマークと専門家主導の評価を組み合わせて行われました。Astraは、GPT‑5.6 Solと比較して、サイバーセキュリティ能力において顕著な向上を示しています:トークン効率がはるかに高くなるだけでなく、脆弱性の特定とエクスプロイト開発においてもはるかに優れた能力を示しています。Exploit Benchベンチマークにおいて、Astraは既知の脆弱性からエクスプロイト開発を評価するベンチマークで満点の100%を達成しました。最近公開された20件の高深刻度のV8脆弱性を含む内部ベンチマークにおいて、AstraはGPT‑5.6 Solよりもはるかに高い任意コード実行率を達成し、さらにはるかに少ない出力トークンでそれを行いました。評価中、モデルはエクスプロイトチェーンの一部として2つのゼロデイ脆弱性を発見および使用し、これらの脆弱性をメンテナーに開示しています。専門家主導の評価において、強化されたブラウザとオペレーティングシステムに対して、Astraは以前未知の脆弱性を発見し、それらを機能するエクスプロイトチェーンに変換し、サンドボックスから逃脱する完全なブラウザ侵害チェーンを構築しました。

主要なエンティティ: 企業: Hugging Face

よくある質問: Astraがサイバーセキュリティの重要な能力閾値を満たすとはどういう意味ですか?

重要な閾値を満たすとは、人間の介入なしで、多くの強化された実際の世界の重要なシステムにおいてすべての深刻度レベルの機能的なゼロデイエクスプロイトを特定し開発できるか、または高レベルの目標のみが与えられた状態で、強化されたターゲットに対して新規なエンドツーエンドのサイバー攻撃戦略を考案および実行できるということです。これは私たちの準備フレームワークで定義されています。