HeadlinesBriefing favicon HeadlinesBriefing.com

Лингвистическая нечитаемость угрожает безопасности LLM

Hacker News •
×

LLM обучаются генерировать естественный язык. Однако свидетельства указывают на то, что внешние языковые выходы LLM и механистически извлечённые языковые признаки могут быть ненадёжной линзой для понимания внутренних вычислений модели. Мы вводим термин «лингвистическая нечитаемость», чтобы широко обозначить сценарии, в которых внешние или механистически зондированные языковые артефакты LLM не отражают то, как модель на самом деле думает. Мы утверждаем, что призрак лингвистической нечитаемости неизбежен для LLM, внутренние вычисления которых выражаются не напрямую через язык, а через математику над пространствами активаций (с потерями при переводах между пространствами активаций и естественным языком на обоих концах).

Если лингвистическая нечитаемость всегда возможна, то механизмы безопасности, полагающиеся на языковую самоотчётность модели (например, мониторинг цепочки рассуждений, конституционная самокритика, зондирование активаций для лингвистически определённых векторов признаков), никогда не могут быть полностью надёжными; песочница модели всегда будет нуждаться в методах изоляции, гарантии которых вообще не зависят от чтения языкового состояния модели. Мы утверждаем, что наблюдение за выходами модели с помощью отслеживания загрязнения (taint tracking) является многообещающим подходом для эффективной песочницы: независимо от того, как модель языково самоотчитывается, политика отслеживания загрязнения может априори определить различные части состояния системы, на которые никогда не должны влиять данные, созданные моделью.

Мы также обсуждаем несколько дополнительных механизмов песочницы (например, надёжная виртуализация, сторонний аудит конфигураций песочницы), которые в совокупности обеспечивают критический фундамент под языковым мониторингом и смогли бы смягчить недавние эксплойты песочницы передовых моделей.