HeadlinesBriefing favicon HeadlinesBriefing.com

Водяные знаки ИИ против галлюцинаций

Towards Data Science •
×

Безопасность ИИ имеет проблему дружественного огня. Технология, которая доказывает, откуда взялся текст ИИ, ослабляет технологию, которая проверяет, является ли он истинным. Водяные знаки, или встраивание скрытой подписи в сгенерированный текст, используются для повышения прозрачности приложений ИИ (статья 50 Закона ЕС об ИИ в Европе; регулирование маркировки ИИ в Китае). Кроме того, обнаружение галлюцинаций пытается пометить части ответа, которые модель выдумала. Регуляторы продвигают оба, но внутри моделей ИИ существует скрытое столкновение между прозрачностью и ответственностью.

LLM вычисляет распределение вероятностей по следующему токену. Иногда это распределение резкое, как после «Столица Франции —», где «Париж» принудительно. Иногда оно плоское, с несколькими одинаково правдоподобными продолжениями. Плоскость называется энтропией. Обе технологии живут в позициях с высокой энтропией. Текстовый водяной знак смещает подбрасывание монеты с помощью секретного ключа, как в схеме Kirchenbauer и его коллег 2023 года, которая делит словарь на зеленые и красные списки. Текст читается естественно, но содержит больше зеленых токенов.

Детектор с ключом подсчитывает зеленые токены и вычисляет невероятность. Synth ID-Text от Google DeepMind в моделях Gemini использует турнирную выборку. Схемы без искажений организуют смещение так, чтобы распределение вывода в среднем не менялось. Но водяной знак может толкать только там, где есть место. В позициях с низкой энтропией смещение означало бы неправильные слова и крах качества. Столкновение скрыто во внутренностях модели, но имеет реальные последствия для безопасности ИИ.

Ключевые сущности: Компании: Google DeepMind | Люди: Kirchenbauer