HeadlinesBriefing favicon HeadlinesBriefing.com

L'illisibilité linguistique menace la sécurité des LLM

Hacker News •
×

Les LLM sont entraînés à générer du langage naturel. Cependant, les preuves indiquent que les sorties linguistiques externalisées d'un LLM et les caractéristiques linguistiques extraites mécaniquement peuvent être une lentille peu fiable pour comprendre le calcul interne du modèle. Nous introduisons le terme « illisibilité linguistique » pour désigner largement les scénarios dans lesquels les artefacts linguistiques externalisés ou sondés mécaniquement d'un LLM ne parviennent pas à représenter la façon dont le modèle pense réellement. Nous soutenons que le spectre de l'illisibilité linguistique est inévitable pour les LLM dont les calculs internes ne s'expriment pas directement par le langage, mais plutôt par des mathématiques sur des espaces d'activation (avec des traductions avec perte entre les espaces d'activation et le langage naturel aux extrémités).

Si l'illisibilité linguistique est toujours possible, alors les mécanismes de sécurité qui reposent sur l'auto-déclaration linguistique d'un modèle (par exemple, la surveillance de la chaîne de pensée, l'auto-critique constitutionnelle, le sondage d'activation pour des vecteurs de caractéristiques définis linguistiquement) ne peuvent jamais être complètement fiables ; le bac à sable du modèle aura toujours besoin de techniques d'isolation dont les garanties ne dépendent pas du tout de la lecture de l'état linguistique du modèle. Nous soutenons que l'observation des sorties d'un modèle à l'aide du suivi de teinte est une approche prometteuse pour un bac à sable efficace : quelle que soit la manière dont un modèle s'auto-déclare linguistiquement, une politique de suivi de teinte peut définir, a priori, diverses parties de l'état du système qui ne devraient jamais être influencées par les données produites par le modèle.

Nous discutons également de plusieurs mécanismes supplémentaires de bac à sable (par exemple, la virtualisation robuste, l'audit par des tiers des configurations de bac à sable) qui fournissent collectivement un plancher critique sous la surveillance linguistique, et auraient atténué les récentes exploitations de bac à sable par les modèles de pointe.