Nous avons récemment identifié et perturbé une campagne coordonnée conçue pour extraire le raisonnement protégé de nos modèles, la première activité observée datant de la première semaine de juillet. Cette activité est cohérente avec la distillation antagoniste : l'utilisation systématique et non autorisée des sorties ou du raisonnement d'un modèle pour aider à entraîner, reproduire ou améliorer un autre modèle. Les opérateurs ont manipulé les interactions du modèle afin que le raisonnement protégé puisse être reproduit sous des formes visibles pour le demandeur de manière coordonnée et à grande échelle, en violation de nos conditions d'utilisation.
Nous avons observé que les opérateurs tentaient d'extraire le raisonnement protégé de manière inédite, notamment en copiant le raisonnement crypté d'une conversation et en demandant à un modèle d'une autre conversation de déchiffrer et de transcrire le contenu du raisonnement caché. L'activité a débuté le 1er juillet, avec des pics de volume élevé les 24 et 25 juillet consistant en 16 000 requêtes provenant de plus de 4 000 utilisateurs. Une enquête plus approfondie a identifié une activité de modèle d'invite connexe au sein d'un groupe de plus de 15 000 utilisateurs, que nous avons complètement perturbée d'ici le 28 juillet.
Nous attribuons un noyau d'activité à des individus associés à Moonshot AI, le développeur de Kimi. La distillation antagoniste présente des risques pour la sécurité et la sûreté nationale. Le raisonnement extrait pourrait être utilisé pour entraîner un autre modèle sans préserver les garanties appliquées aux sorties orientées utilisateur du modèle original.
Nous avons atténué cette campagne de distillation récente grâce à une combinaison de mesures d'application des comptes, de contrôles techniques et de coordination avec les partenaires. Nous avons également renforcé les protections pour le raisonnement caché à travers les utilisateurs, les espaces de travail, les organisations et les familles de modèles.
Source: OpenAI Blog · Résumé par HeadlinesBriefing