HeadlinesBriefing favicon HeadlinesBriefing.com

Воспроизведение и раскрытие AI-рассуждений

ByteByteGo •
×

Современные модели ИИ генерируют обширные внутренние рассуждения перед предоставлением окончательных ответов. Этот "процесс мышления" содержит промежуточные гипотезы, выходы инструментов и данные пользователей, делая его значительно плотнее, чем отполированный вывод. Большинство крупных поставщиков сохраняют этот отслеживающий след по двум причинам: коммерчески конкуренты могли бы использовать его для обучения дешевых имитаций, и технически раскрытие полного рассуждения могло бы раскрыть чувствительную информацию пользователя. В августе 2026 года исследователи из MATS Research, ELLIS Institute Tübingen и Max Planck Institute for Intelligent Systems продемонстрировали уязвимость. Они показали, что зашифрованные блоки рассуждений, предоставленные Anthropic, OpenAI и Google, могли бы быть воспроизведены в более дешевой модели в той же семье. При воспроизведении более дешевая модель печатает скрытое рассуждение в открытом тексте, эффективно крадя мысли оригинальной модели. Метод извлечения заключается в принудительном заставлении более дешевой модели генерировать полную цепочку мыслей. Проверка подтвердила, что воспроизведенный вывод соответствовал исходному скрытому процессу. Эта уязвимость затрагивает несколько поставщиков, раскрывая, что текущие методы шифрования блоков рассуждения недостаточны. Исследователи опустили четыре основных вектора атаки, позволяющих это воспроизведение. Сканирование опубликованных сеансовых журналов подтвердило распространенность этой проблемы. Предлагаемые исправления включают изменение механизма воспроизведения, хотя всегда остается фундаментальное ограничение того, сколько рассуждений может быть надежно защищено при сохранении полезности модели. Эти результаты подчеркивают критическую пробелу в конфиденциальности ИИ, показывая, что зашифрованные блоки не гарантируют конфиденциальность против убедительных атак воспроизведения. Это создает значительные риски для приложений, обрабатывающих чувствительные данные, поскольку скрытые мысли могут быть извлечены и раскрыты. Исследование подчеркивает необходимость более надежных архитектурных мер безопасности в будущих проектах моделей для предотвращения несанкционированного извлечения рассуждений.