HeadlinesBriefing favicon HeadlinesBriefing.com

Ilegibilidad lingüística amenaza seguridad LLM

Hacker News •
×

Los LLM están entrenados para generar lenguaje natural. Sin embargo, la evidencia indica que las salidas lingüísticas externalizadas de un LLM y las características lingüísticas extraídas mecanicistamente pueden ser una lente poco fiable para comprender la computación interna del modelo. Introducimos el término "ilegibilidad lingüística" para referirnos ampliamente a escenarios en los que los artefactos lingüísticos externalizados o sondeados mecanicistamente de un LLM no logran representar cómo piensa realmente el modelo. Sostenemos que el espectro de la ilegibilidad lingüística es inevitable para los LLM cuyas computaciones internas no se expresan directamente mediante lenguaje, sino mediante matemáticas sobre espacios de activación (con traducciones con pérdida entre espacios de activación y lenguaje natural en los extremos).

Si la ilegibilidad lingüística siempre es posible, entonces los mecanismos de seguridad que dependen del autorreporte lingüístico de un modelo (p. ej., monitoreo de cadena de pensamiento, autocrítica constitucional, sondeo de activaciones para vectores de características definidos lingüísticamente) nunca pueden ser completamente sólidos; la sandbox del modelo siempre necesitará técnicas de aislamiento cuyas garantías no dependan en absoluto de leer el estado lingüístico del modelo. Sostenemos que observar las salidas de un modelo mediante seguimiento de contaminación es un enfoque prometedor para una sandbox efectiva: independientemente de cómo se autorreporte lingüísticamente un modelo, una política de seguimiento de contaminación puede definir, a priori, diversas piezas de estado del sistema que nunca deberían verse influidas por datos producidos por el modelo.

También discutimos varios mecanismos adicionales de sandboxing (p. ej., virtualización robusta, auditoría de terceros de configuraciones de sandboxing) que colectivamente proporcionan un piso crítico bajo el monitoreo lingüístico, y habrían mitigado recientes exploits de sandbox por modelos frontera.