HeadlinesBriefing favicon HeadlinesBriefing.com

Filigranes IA vs hallucinations

Towards Data Science •
×

La sécurité de l'IA a un problème de tir ami. La technologie qui prouve d'où vient le texte IA affaiblit la technologie qui vérifie s'il est vrai. Le filigrane, ou l'intégration d'une signature cachée dans le texte généré, est utilisé pour accroître la transparence des applications d'IA (article 50 de la loi sur l'IA de l'UE en Europe ; réglementation sur l'étiquetage de l'IA en Chine). De plus, la détection d'hallucinations tente de signaler les parties d'une réponse que le modèle a inventées. Les régulateurs poussent les deux, mais une collision cachée existe dans les modèles d'IA entre transparence et responsabilité.

Un LLM calcule une distribution de probabilité sur le prochain jeton. Parfois, cette distribution est nette, comme après « La capitale de la France est », où « Paris » est forcé. Parfois, elle est plate, avec plusieurs continuations également plausibles. La platitude s'appelle l'entropie. Les deux technologies vivent à des positions de haute entropie. Un filigrane de texte biaise les lancers de pièce en utilisant une clé secrète, comme dans le schéma de Kirchenbauer et ses collègues de 2023, qui divise le vocabulaire en listes vertes et rouges. Le texte se lit naturellement mais contient plus de jetons verts.

Un détecteur avec la clé compte les jetons verts et calcule l'improbabilité. Synth ID-Text de Google DeepMind, dans les modèles Gemini, utilise l'échantillonnage par tournoi. Les schémas sans distorsion organisent le biais pour que la distribution de sortie soit inchangée en moyenne. Mais un filigrane ne peut pousser que là où il y a de la place. Aux positions de faible entropie, le biais signifierait des mots incorrects et un effondrement de la qualité. La collision est cachée dans les internals du modèle mais a des conséquences réelles pour la sécurité de l'IA.

Entités clés : Entreprises : Google DeepMind | Personnes : Kirchenbauer