Les grands modèles de langage actuels sont conçus pour refuser les demandes dangereuses, un principe devenu presque un commandement dans le développement de l’IA. Le cadre proposé par Anthropic en 2021 posait que les modèles doivent être utiles, honnêtes et, avant tout, inoffensifs, en refusant poliment d’apporter leur aide à des actes dangereux, comme la fabrication d’une bombe. Pourtant, la désobéissance ne vient pas naturellement à ces systèmes. Entraîné sur des milliards de pages web, un modèle acquiert une large maîtrise de la violence et de la haine, mais il n’apprend pas de lui-même à garder ces capacités pour lui. Steven Adler, qui a travaillé sur la sécurité chez OpenAI de 2020 à 2024, a déclaré que les premiers modèles de l’entreprise « bavardaient sur tout ».
Aujourd’hui, les modèles sont entraînés à refuser un très grand nombre de requêtes. Les entreprises récompensent les systèmes qui refusent de répondre aux questions jugées nuisibles et les pénalisent lorsqu’ils refusent à tort des requêtes inoffensives, souvent en faisant appel à d’autres modèles pour mener ces exercices. Certaines entreprises placent aussi leurs modèles derrière des couches supplémentaires d’IA qui filtrent les requêtes malveillantes. Pourtant, le refus échoue souvent, parfois avec des conséquences violentes. Certains des modèles les plus récents seraient aussi doués pour s’introduire dans des réseaux critiques que les meilleurs pirates humains, et aussi efficaces pour fausser l’opinion publique que les plus habiles fabricants de désinformation.
Les mécanismes de refus étant probabilistes, ils sont peu susceptibles d’être totalement fiables. Des utilisateurs déterminés les ont déjà contournés, et des entreprises signalent des tentatives d’utiliser l’IA avancée pour perfectionner des agents pathogènes biologiques et construire des essaims de drones autonomes. S’appuyer sur le refus suppose aussi de tracer une frontière entre ce qu’un modèle doit obéir et ce qu’il doit rejeter, et il n’existe aucune formule pour cela. Les virologues peuvent avoir de bonnes raisons d’étudier des virus dangereux, et les chercheurs en sécurité peuvent avoir besoin de sonder des vulnérabilités afin de les corriger. Zico Kolter, membre du conseil d’OpenAI et cofondateur de la société de test d’IA Gray Swan, affirme que l’endroit où tracer cette ligne est une question immense.
Pour l’instant, ce sont les entreprises d’IA seules qui décident où se situe cette ligne, et elles le font avec un grand secret. La question de savoir si la société peut accepter cette concentration de pouvoir, même temporairement, reste ouverte.
Source: MIT Technology Review AI · Résumé par HeadlinesBriefing