HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI dévoile 6 incidents inquiétants et nouveau cadre de transparence

Financial Times Companies •
×

OpenAI a révélé un lot de "comportements inquiétants" de la part de ses modèles d'IA et a mis en place un nouveau cadre pour suivre et signaler de tels incidents, alors que l'industrie lutte contre des craintes grandissantes quant à la sécurité de la technologie. La société a révélé que son modèle phare, connu sous le nom de GPT-5.6 Sol, ainsi que d'autres modèles pas encore publiés, avaient adopté un comportement "inattendu ou inquiétant" au cours des six derniers mois. Les six incidents comprenaient des modèles développant des moyens d'ignorer des "contraintes normales", de fabriquer et de déformer des données et de cacher les erreurs commises lors de l'exécution de tâches, a déclaré l'entreprise basée à San Francisco mercredi.

Ces nouvelles divulgations font suite à une série d'incidents ces derniers mois, notamment un agent OpenAI piratant la start-up d'IA Hugging Face, qui ont suscité une alarme croissante quant aux risques posés par la technologie. Dario Amodei, PDG d'Anthropic, le rival acharné d'OpenAI, a appelé le week-end dernier à un ralentissement du développement de la technologie pour mieux gérer sa menace potentielle pour les humains. L'appel a été soutenu par Sam Altman, patron d'OpenAI, et Elon Musk.

En annonçant les six incidents dans un billet de blog, OpenAI a déclaré qu'elle avait précédemment cherché à divulguer des incidents de mauvais comportement de ses modèles, mais a admis qu'elle manquait d'une "approche systématique" pour le faire. Sans approche systématique pour signaler ces résultats, nos divulgations ont été ad hoc et moins fréquentes qu'idéal, a-t-elle dit. Pour l'instant, il n'existe pas de cadre à l'échelle de l'industrie avec des normes explicites sur la façon dont les développeurs d'IA devraient divulguer des exemples de désalignement dans leurs modèles.

L'entreprise, engagée dans une course féroce avec Anthropic pour être l'acteur dominant de l'IA, a déclaré qu'elle introduirait un cadre pour accélérer la divulgation de tels incidents. Elle a ajouté que son nouveau système favoriserait la "divulgation même lorsque la signification [d'un incident] est incertaine". Les dernières divulgations d'OpenAI s'ajoutent aux préoccupations croissantes concernant la sécurité des systèmes d'IA, dont les mauvais comportements ont varié de la tentative d'insérer du code malveillant sur des plateformes en ligne au déclenchement de piratages réels, même pendant les tests de pré-déploiement.

Selon l'organisme de recherche sur la sécurité et la sûreté de l'IA de pointe du gouvernement britannique, les modèles phares d'IA d'OpenAI et d'Anthropic ont le mois dernier pénétré dans des logiciels tiers et envoyé des e-mails à des individus pour voler leurs identifiants, exhibant un comportement trompeur sans précédent. Les craintes surviennent à un moment charnière pour OpenAI et Anthropic, qui sont aussi en course pour entrer en bourse. Altman a déclaré samedi que l'IPO très attendue d'OpenAI était désormais peu probable avant 2027, en partie à cause des préoccupations de sécurité croissantes autour de l'IA. Anthropic devrait toujours entrer en bourse cette année.