HeadlinesBriefing favicon HeadlinesBriefing.com

Marcas de agua de IA vs. alucinaciones

Towards Data Science •
×

La seguridad de la IA tiene un problema de fuego amigo. La tecnología que demuestra de dónde proviene el texto de IA está debilitando la tecnología que verifica si es verdadero. El marcado de agua, o incrustar una firma oculta en el texto generado, se utiliza para aumentar la transparencia en las aplicaciones de IA (Artículo 50 de la Ley de IA de la UE en Europa; regulación de etiquetado de IA en China). Además, la detección de alucinaciones intenta marcar partes de una respuesta que el modelo inventó. Los reguladores están impulsando ambas, pero existe una colisión oculta dentro de los modelos de IA entre transparencia y responsabilidad.

Un LLM calcula una distribución de probabilidad sobre el siguiente token. A veces esa distribución es nítida, como después de "La capital de Francia es", donde "París" es forzado. A veces es plana, con múltiples continuaciones igualmente plausibles. La planitud se llama entropía. Ambas tecnologías viven en posiciones de alta entropía. Una marca de agua de texto sesga los lanzamientos de moneda usando una clave secreta, como en el esquema de 2023 de Kirchenbauer y colegas, que divide el vocabulario en listas verdes y rojas. El texto se lee naturalmente pero contiene más tokens verdes.

Un detector con la clave cuenta los tokens verdes y calcula la improbabilidad. Synth ID-Text de Google DeepMind, en los modelos Gemini, utiliza muestreo por torneo. Los esquemas sin distorsión organizan el sesgo para que la distribución de salida no cambie en promedio. Pero una marca de agua solo puede empujar donde hay espacio. En posiciones de baja entropía, el sesgo significaría palabras incorrectas y colapso de calidad. La colisión está oculta en los internals del modelo pero tiene consecuencias reales para la seguridad de la IA.

Entidades clave: Empresas: Google DeepMind | Personas: Kirchenbauer