HeadlinesBriefing HeadlinesBriefing.com

Rythme de développement face aux risques cybernétiques

OpenAI Blog •
×

Ces dernières semaines, deux incidents ont mis en évidence les risques croissants liés aux systèmes d'IA capables : l'incident Open AI-Hugging Face et des preuves que notre prochain modèle Astra pourrait atteindre le seuil de capacité critique en cybersécurité dans le cadre de notre cadre de préparation. Ces développements, ainsi que le rapide progrès interne en recherche, ont ajouté de l'urgence à renforcer la surveillance, l'alignement et les garanties de confinement à travers toutes les étapes d'entraînement.

À mesure que les modèles deviennent plus capables, les risques associés augmentent également. Nous avons temporairement ralenti la mise à l'échelle, y compris une pause de deux semaines dans l'entraînement par renforcement (RL), pour durcir les environnements de recherche, les systèmes d'équipe rouge et élargir la couverture de surveillance. Notre plus grande série RL de frontière reste suspendue pendant que nous effectuons des entraînements et évaluations à plus petite échelle pour valider les garanties et établir des preuves d'alignement.

Nous exigeons désormais des preuves plus solides de comportement aligné tout au long de l'entraînement, s'appuyant sur la recherche et les évaluations en cours. Les signaux des prochains modèles laissent clairement entendre la nécessité d'une approche plus large au-delà du cadre de préparation actuel. Ci-dessous, nous détaillons les changements apportés aux processus et à l'infrastructure de recherche, ainsi que le travail toujours en cours.

Notre approche repose sur trois garanties renforcées : la surveillance, l'alignement et la sécurité. Nous appliquons ces éléments à la recherche et au déploiement, en les adaptant aux capacités de chaque modèle, à son environnement opérationnel et à son niveau de risque. Les modèles de pointe qui acquièrent des capacités plus fortes en cybersécurité exigent d'élever les normes de sécurité des environnements d'entraînement et d'évaluation.

Source: OpenAI Blog · Résumé par HeadlinesBriefing