HeadlinesBriefing favicon HeadlinesBriefing.com

Impacto del Marcado de Agua en Agentes de IA

Hacker News •
×

Anunció que los modelos futuros de Claude incrustarán una marca de agua invisible basada en Synth ID-Text de Google DeepMind. Esta marca de agua, requerida por el artículo 50(2) de la Ley de IA de la UE para texto sintético, altera el proceso de generación de tokens del modelo. A nivel de modelo, esto puede cambiar los comportamientos de seguridad, como rechazar solicitudes peligrosas, y hacerlos vulnerables a la inyección de indicaciones.

A nivel de agente, los mismos tokens muestreados determinan qué herramienta se llama y qué argumentos se pasan. Este efecto comportamental, denominado deriva de muestreo, se confirma tanto en el comportamiento de rechazo del modelo como en la llamada de herramientas del agente. El efecto depende del modelo y la clave y puede ser oculto por las puntuaciones agregadas.

El artículo discute las implicaciones para la seguridad y seguridad de la IA y lo que deben hacer los desarrolladores. La implementación de Anthropic aplica la marca de agua a nivel de modelo, cubriendo los modelos admitidos accedidos a través de la API de la Plataforma Claude y los proveedores de nube, haciendo que los efectos comportamentales a nivel de modelo sean relevantes para los agentes construidos alrededor de estos modelos. El muestreo de torneos, utilizado por Synth ID-Text, tiene más oportunidades de alterar la selección de tokens donde el modelo está incierto, potencialmente alterando los argumentos que ejecuta un agente.