HeadlinesBriefing favicon HeadlinesBriefing.com

Principes d'OpenAI pour les évaluations

OpenAI Blog •
×

Les laboratoires d'IA de pointe portent une immense responsabilité dans la formation, l'évaluation et le déploiement sécurisés des modèles. Les évaluations par des tiers sont un élément essentiel pour équilibrer cette responsabilité, élargir les possibilités de contribution sur la sécurité de l'IA, tenir le monde informé et maintenir les laboratoires responsables de déclarations de sécurité claires et soutenues de manière indépendante. Dans le cadre de nos efforts pour suivre la frontière, OpenAI s'engage à soutenir des évaluations indépendantes avec des niveaux d'accès approfondis couvrant la formation, l'évaluation et le déploiement. Cet accès devrait permettre aux évaluateurs de remettre en question nos hypothèses, d'identifier les risques que nous aurions pu manquer et de tirer leurs propres conclusions sur l'efficacité de nos garanties.

Nous travaillons depuis longtemps avec des évaluateurs tiers à diverses étapes du processus de développement et de déploiement des modèles. Nous avons également intégré les évaluations par des tiers dans nos pratiques du Cadre de préparation et soutenu des organisations et des législations qui plaident pour un processus plus rigoureux et plus responsable. Tout au long de ces engagements, nous avons fourni des formes d'accès approfondies, notamment des informations sur nos garanties techniques, un accès visible à la chaîne de pensée et des niveaux sans précédent de données confidentielles et d'accès interne au déploiement pour la réponse aux incidents et le red teaming de surveillance. Les priorités et principes partagés ici se concentrent sur notre engagement avec des organisations d'évaluation indépendantes du secteur privé et à but non lucratif sur les évaluations de sécurité technique. Ils complètent notre travail avec les gouvernements sur les tests et l'évaluation, où des rôles et responsabilités distincts peuvent nécessiter des approches différentes.

Pour rendre ces évaluations efficaces, il faut de solides mécanismes d'indépendance, une rigueur scientifique, des pratiques de sécurité robustes et des responsabilités claires. Les laboratoires ont la responsabilité de permettre un examen significatif tout en protégeant les informations sensibles. Les laboratoires et les évaluateurs indépendants partagent la responsabilité de bien faire les choses et devraient opérer avec des normes internationales partagées en matière de pratiques de sûreté et de sécurité. Ci-dessous, nous proposons quatre domaines prioritaires pour une évaluation plus approfondie, ainsi que des principes pour un travail rigoureux, sécurisé et indépendant.

Domaines prioritaires pour l'évaluation : Les évaluations par des tiers sont plus utiles lorsqu'elles abordent des questions spécifiques et importantes : Les preuves soutiennent-elles le dossier de sécurité et les déclarations de sécurité d'un laboratoire ? Les évaluations testent-elles adéquatement les risques qu'elles sont censées mesurer ? Les garanties fonctionnent-elles dans des conditions réalistes ? Les évaluations décrites ici sont destinées à prendre différentes formes selon les questions de sécurité examinées. Nous prévoyons de soutenir plusieurs évaluations en parallèle et sur différentes périodes, certaines durant des semaines et d'autres plusieurs mois. Bien que les évaluations par des tiers puissent également faire partie du travail de pré-déploiement et éclairer les décisions de déploiement, le travail décrit ici est généralement à plus long terme et indépendant du lancement—axé sur l'examen approfondi de déclarations de sécurité particulières au fil du temps. Dans nos domaines prioritaires et nos principes, nous faisons référence aux déclarations de sécurité et aux dossiers de sécurité. Ce que nous entendons par ces termes est le suivant : Nous proposons quatre domaines prioritaires pour une évaluation plus approfondie, ainsi que des principes pour un travail rigoureux, sécurisé et indépendant. Évaluation indépendante des dossiers de sécurité, couvrant la formation, l'évaluation, le déploiement interne et le déploiement externe. L'évaluation des dossiers de sécurité nécessite une expertise en alignement, en méthodes de contrôle telles que la surveillance, en cybersécurité, en usage abusif biologique et chimique et en red teaming. Les dossiers de sécurité consistent en des déclarations incluant la formation, les évaluations de capacités et les garanties, qui peuvent être évaluées dans leur ensemble ou en parties (voir priorités 2 et 3 ci-dessous). Plusieurs évaluateurs devront probablement examiner différentes parties des dossiers, en s'appuyant sur leurs expertises respectives. Ensemble, leurs évaluations devraient répondre à des questions telles que : Les preuves des dossiers de sécurité pour la formation, l'évaluation et les déploiements sont-elles étayées ? Les conditions du dossier de sécurité ont-elles été respectées pendant la formation, l'évaluation...

FAQ Q : Quelles sont les priorités d'OpenAI pour les évaluations par des tiers ?

FAQ R : OpenAI propose quatre domaines prioritaires pour une évaluation plus approfondie, ainsi que des principes pour un travail rigoureux, sécurisé et indépendant. Ceux-ci incluent l'évaluation indépendante des dossiers de sécurité couvrant la formation, l'évaluation, le déploiement interne et le déploiement externe.