HeadlinesBriefing HeadlinesBriefing.com

OpenAI срывает дистилляцию моделей

OpenAI Blog •
×

Мы недавно выявили и сорвали скоординированную кампанию, направленную на извлечение защищенных рассуждений из наших моделей, причем самая ранняя наблюдаемая активность произошла в первую неделю июля. Эта активность соответствует состязательной дистилляции: систематическому и несанкционированному использованию выходных данных или рассуждений одной модели для обучения, воспроизведения или улучшения другой модели. Операторы манипулировали взаимодействием моделей, чтобы защищенные рассуждения могли быть воспроизведены в формах, видимых запрашивающему, скоординированным и масштабируемым образом, что нарушало наши условия обслуживания.

Мы наблюдали, как операторы пытались извлечь защищенные рассуждения новыми способами, включая копирование зашифрованных рассуждений из одного разговора и запрос модели в другом разговоре расшифровать и транскрибировать скрытое содержимое рассуждений. Активность началась 1 июля, с пиками высокого объема 24 и 25 июля, состоящими из 16 000 запросов от более чем 4 000 пользователей. Дальнейшее расследование выявило связанную активность с паттернами подсказок в кластере из более чем 15 000 пользователей, которую мы полностью пресекли к 28 июля.

Мы приписываем основной кластер активности лицам, связанным с Moonshot AI, разработчиком Kimi. Состязательная дистилляция представляет риски для безопасности и национальной безопасности. Извлеченные рассуждения могут быть использованы для обучения другой модели без сохранения мер защиты, применяемых к выходным данным исходной модели, ориентированным на пользователя.

Мы смягчили эту недавнюю кампанию дистилляции с помощью комбинации мер по обеспечению соблюдения учетных записей, технических средств контроля и координации с партнерами. Мы также усилили защиту скрытых рассуждений для пользователей, рабочих пространств, организаций и семейств моделей.

Источник: OpenAI Blog · Сводку подготовил HeadlinesBriefing