HeadlinesBriefing favicon HeadlinesBriefing.com

Le modèle Astra atteint le seuil critique de capacité en cybersécurité

Hacker News •
×

Nous pensons désormais qu'Astra atteint le seuil critique de capacité en cybersécurité dans notre Cadre de préparation, ce qui signifie qu'il peut découvrir des failles de sécurité précédemment inconnues et développer des exploits dans de nombreux systèmes bien protégés sans intervention humaine. C'est le premier modèle que nous désignons à ce niveau, nécessitant des garanties plus fortes pendant le développement et avant la sortie. Au cours des dernières semaines, nous avons retardé certaines parties du développement d'Astra afin de renforcer les protections contre l'utilisation malveillante de la cybersécurité et les actions non autorisées du modèle. Bien qu'Astra n'ait pas été impliqué dans l'incident Hugging Face, nous avons intégré les enseignements de cet événement dans notre approche de sécurité. Nous avons mis en place des garanties plus fortes pour Astra, notamment l'entraînement du modèle à refuser de manière plus fiable les demandes cybernétiques nuisibles, des protections supplémentaires contre l'utilisation abusive, et une surveillance pour arrêter toute activité potentiellement non autorisée. Nous prévoyons de rendre Astra disponible prochainement, mais l'accès à ses capacités les plus avancées en cybersécurité sera plus limité. Le travail avancé en cybersécurité sera initialement disponible pour un groupe de testeurs, avec un accès via Daybreak Blue pour étendre l'utilisation défensive. Nous partagerons davantage de détails sur la sécurité, la sûreté et les tests d'alignement dans la fiche système du modèle au lancement.

Selon notre Cadre de préparation, un modèle atteint le seuil critique s'il peut identifier et développer des exploits zero-day fonctionnels de tous niveaux de gravité dans de nombreux systèmes critiques du monde réel renforcés sans intervention humaine, ou concevoir et exécuter des stratégies de cyberattaque de bout en bout inédites contre des cibles renforcées sachant seulement un objectif de haut niveau. Notre évaluation a combiné des références publiques et privées automatisées avec des évaluations dirigées par des experts. Astra représente une augmentation significative des capacités en cybersécurité par rapport à GPT‑5.6 Sol : il est à la fois nettement plus efficace en termes de tokens et plus capable dans l'identification des vulnérabilités et le développement d'exploits. Sur le benchmark Exploit Bench, Astra a obtenu un score parfait de 100 % sur le benchmark permettant d'évaluer le développement d'exploits à partir de vulnérabilités connues. Sur un benchmark interne contenant 20 vulnérabilités V8 de haute gravité récemment divulguées, Astra atteint des taux d'exécution de code arbitraire beaucoup plus élevés que GPT‑5.6 Sol en utilisant nettement moins de tokens de sortie. Lors de l'évaluation, le modèle a découvert et utilisé deux vulnérabilités zero-day dans le cadre d'une chaîne d'exploitation, que nous divulguons aux mainteneurs. Dans des évaluations menées par des experts contre un navigateur et un système d'exploitation renforcés, Astra a découvert des vulnérabilités précédemment inconnues et les a transformées en chaînes d'exploitation fonctionnelles, construisant une chaîne complète de compromission du navigateur qui a échappé au sandbox.

Entités clés : Entreprises : Hugging Face

FAQ : Que signifie le fait qu'Astra atteigne le seuil critique de capacité en cybersécurité ?

Atteindre le seuil critique signifie qu'Astra peut identifier et développer des exploits zero-day fonctionnels dans de nombreux systèmes du monde réel renforcés sans intervention humaine, ou concevoir et exécuter des stratégies de cyberattaque de bout en bout inédites contre des cibles renforcées sachant seulement un objectif de haut niveau, tel que défini par notre Cadre de préparation.