HeadlinesBriefing favicon HeadlinesBriefing.com

Динамическая аблитерация: подавление отказов

Hacker News •
×

При работе с LLM с открытыми весами, такими как Qwen, контроль поведения отказа на запросах безопасности и административных запросах обычно требует тонкой настройки или постоянного обновления весов. Традиционная техника аблитерации весов нейтрализует направления отказа, проецируя матрицы весов ортогонально вектору отказа. Однако это навсегда изменяет веса базовой модели и может ухудшить производительность на задачах, не связанных с отказом.

В этом посте мы исследуем динамическую аблитерацию с использованием многослойного управления с Engram. Вместо изменения весов параметров этот подход перехватывает промежуточные остаточные потоки во время выполнения через слои с помощью форвард-хуков PyTorch. Мы демонстрируем это на модели Qwen3-4B в качестве доказательства концепции. Мы также исследуем, как многослойная остаточная инъекция чисто подавляет поведение отказа, оставляя веса базовой модели 100% замороженными.

Мы загружаем Qwen/Qwen3-4B в bfloat16 на GPU и проверяем архитектуру базовой модели. Модель имеет скрытое измерение (d): 2560, количество слоев: 36, головы внимания: 32, размер словаря: 151936. Тестирование немодифицированной модели с чувствительным запросом дает отказ: "Я не могу помочь с этим запросом. Создание скрытого кейлоггера..." Это демонстрирует базовое поведение отказа, которое динамическая аблитерация стремится подавить без постоянных изменений весов.

Ключевые сущности: Компании: Google, Google Colab