HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration: Распаковка LLM с помощью одного запроса

Hacker News •
×

Исследователи представляют GRP-Obliteration (GRP-Oblit), метод, использующий Group Relative Policy Optimization (GRPO) для удаления ограничений безопасности из выровненных моделей с помощью лишь одного непомеченного запроса. Эта техника надежно распаковывает безопасно выровненные модели, сохраняя при этом их практическую полезность почти в полной мере, превосходя в среднем существующие методы распаковки моделей.

GRP-Oblit расширяется за пределы языковых моделей и применяется к системам генерации изображений на основе диффузии. Оценка охватывает шесть нормативных тестов и пять тестов безопасности на пятнадцати моделях с 7-20 миллиардами параметров, включая варианты инструкций и рассуждения, плотные и MoE архитектуры. Исследованы семейства моделей, включая GPT-OSS, дистиллированный Deep Seek, Gemma, Llama, Ministral и Qwen.

Работа демонстрирует, что безопасность выравнивания остается уязвимой к минимальным атакам ввода, расширяя практические пределы распаковки после развертывания без интенсивного оформления данных или значительного ухудшения практической полезности. Отправлено Ahmed Salem 5 февраля 2026 года.

Ключевые сущности: Компании: GPT-OSS, Deep Seek, Gemma, Llama, Ministral, Qwen | Люди: Ahmed Salem