HeadlinesBriefing HeadlinesBriefing 12 languages

Disrupting a coordinated model-distillation campaign

OpenAI Blog ·

🇬🇧 English

We recently identified and disrupted a coordinated campaign designed to extract protected reasoning from our models, with the earliest observed activity occurring in the first week of July. This activity is consistent with adversarial distillation: the systematic and unauthorized use of one model’s outputs or reasoning to help train, reproduce, or improve another model. The operators manipulated model interactions so that protected reasoning could be reproduced in forms visible to the requester in a coordinated, scaled manner that violated our terms of service.

We observed operators attempt to extract protected reasoning in novel ways, including by copying encrypted reasoning from one conversation and asking a model in another conversation to decrypt and transcribe the hidden reasoning content. The activity began on July 1, with high-volume spikes on July 24 and 25 consisting of 16,000 requests from over 4,000 users. Further investigation identified related prompt-pattern activity across a cluster of more than 15,000 users, which we fully disrupted by July 28.

We attribute a core cluster of the activity to individuals associated with Moonshot AI, the developer of Kimi. Adversarial distillation poses safety and national security risks. Extracted reasoning could be used to train another model without preserving the safeguards applied to the original model’s user-facing outputs.

We mitigated this recent distillation campaign through a combination of account enforcement, technical controls, and partner coordination. We also strengthened protections for hidden reasoning across users, workspaces, organizations, and model families.

View original article →


🇸🇦 العربية

OpenAI تعطل حملة منسقة لتقطير النماذج

حددنا مؤخرًا وعطلنا حملة منسقة مصممة لاستخراج التفكير المحمي من نماذجنا، مع أول نشاط ملاحظ يحدث في الأسبوع الأول من يوليو. يتوافق هذا النشاط مع التقطير العدائي: الاستخدام المنهجي وغير المصرح به لمخرجات أو تفكير نموذج واحد للمساعدة في تدريب أو إعادة إنتاج أو تحسين نموذج آخر. قام المشغلون بالتلاعب بتفاعلات النموذج بحيث يمكن إعادة إنتاج التفكير المحمي بأشكال مرئية للطالب بطريقة منسقة ومقياسية انتهكت شروط الخدمة الخاصة بنا.

لاحظنا محاولات المشغلين لاستخراج التفكير المحمي بطرق جديدة، بما في ذلك نسخ التفكير المشفر من محادثة واحدة وطلب نموذج في محادثة أخرى لفك تشفير ونسخ محتوى التفكير المخفي. بدأ النشاط في 1 يوليو، مع ارتفاعات كبيرة في الحجم في 24 و25 يوليو تتكون من 16000 طلب من أكثر من 4000 مستخدم. حدد تحقيق إضافي نشاط نمط Prompt ذي صلة عبر مجموعة تضم أكثر من 15000 مستخدم، والذي عطلناه بالكامل بحلول 28 يوليو.

نعزو مجموعة أساسية من النشاط إلى أفراد مرتبطين بـ Moonshot AI، مطور Kimi. يشكل التقطير العدائي مخاطر على السلامة والأمن القومي. يمكن استخدام التفكير المستخرج لتدريب نموذج آخر دون الحفاظ على الضمانات المطبقة على مخرجات النموذج الأصلي الموجهة للمستخدم.

خففنا من حملة التقطير الأخيرة هذه من خلال مزيج من إنفاذ الحساب والضوابط الفنية والتنسيق مع الشركاء. كما قمنا بتعزيز الحماية للتفكير المخفي عبر المستخدمين ومساحات العمل والمؤسسات وعائلات النماذج.

ما هو التقطير العدائي؟

التقطير العدائي هو الاستخدام المنهجي وغير المصرح به لمخرجات أو تفكير نموذج واحد للمساعدة في تدريب أو إعادة إنتاج أو تحسين نموذج آخر.

العربية version →


🇧🇩 বাংলা

OpenAI সমন্বিত মডেল-ডিস্টিলেশন অভিযান ব্যাহত করেছে

আমরা সম্প্রতি আমাদের মডেল থেকে সুরক্ষিত যুক্তি বের করার জন্য ডিজাইন করা একটি সমন্বিত অভিযান শনাক্ত ও ব্যাহত করেছি, যার earliest observed activity জুলাই মাসের প্রথম সপ্তাহে ঘটে। এই কার্যকলাপ প্রতিকূল ডিস্টিলেশনের সাথে সামঞ্জস্যপূর্ণ: অন্য একটি মডেলকে প্রশিক্ষণ, পুনরুৎপাদন বা উন্নত করতে সাহায্য করার জন্য একটি মডেলের আউটপুট বা যুক্তির পদ্ধতিগত এবং অননুমোদিত ব্যবহার। অপারেটররা মডেল মিথস্ক্রিয়াকে এমনভাবে ম্যানিপুলেট করেছিল যাতে সুরক্ষিত যুক্তি অনুরোধকারীর কাছে দৃশ্যমান আকারে একটি সমন্বিত, বর্ধিত পদ্ধতিতে পুনরুৎপাদন করা যায়, যা আমাদের পরিষেবার শর্তাবলী লঙ্ঘন করে।

আমরা লক্ষ্য করেছি যে অপারেটররা নতুন উপায়ে সুরক্ষিত যুক্তি বের করার চেষ্টা করেছিল, যার মধ্যে একটি কথোপকথন থেকে এনক্রিপ্ট করা যুক্তি কপি করা এবং অন্য কথোপকথনে একটি মডেলকে লুকানো যুক্তির বিষয়বস্তু ডিক্রিপ্ট ও ট্রান্সক্রাইব করতে বলা অন্তর্ভুক্ত। এই কার্যকলাপ 1 জুলাই শুরু হয়, যার মধ্যে 24 ও 25 জুলাই উচ্চ-ভলিউম স্পাইক ছিল, যা 4,000 এর বেশি ব্যবহারকারী থেকে 16,000 অনুরোধ নিয়ে গঠিত। আরও তদন্তে 15,000 এর বেশি ব্যবহারকারী এর একটি ক্লাস্টার জুড়ে সম্পর্কিত প্রম্পট-প্যাটার্ন কার্যকলাপ চিহ্নিত করা হয়েছে, যা আমরা 28 জুলাই এর মধ্যে সম্পূর্ণরূপে ব্যাহত করেছি।

আমরা কার্যকলাপের একটি মূল ক্লাস্টারকে Moonshot AI (Kimi-এর ডেভেলপার) এর সাথে যুক্ত ব্যক্তিদের জন্য দায়ী করি। প্রতিকূল ডিস্টিলেশন নিরাপত্তা ও জাতীয় নিরাপত্তা ঝুঁকি তৈরি করে। বের করা যুক্তি আসল মডেলের ব্যবহারকারী-মুখী আউটপুটে প্রয়োগ করা সুরক্ষা সংরক্ষণ না করে অন্য একটি মডেলকে প্রশিক্ষণ দিতে ব্যবহার করা যেতে পারে।

আমরা অ্যাকাউন্ট প্রয়োগ, প্রযুক্তিগত নিয়ন্ত্রণ এবং অংশীদার সমন্বয়ের সমন্বয়ের মাধ্যমে এই সাম্প্রতিক ডিস্টিলেশন অভিযানকে প্রশমিত করেছি। আমরা ব্যবহারকারী, ওয়ার্কস্পেস, সংস্থা এবং মডেল পরিবার জুড়ে লুকানো যুক্তির জন্য সুরক্ষা জোরদার করেছি।

প্রতিকূল ডিস্টিলেশন কী?

প্রতিকূল ডিস্টিলেশন হল অন্য একটি মডেলকে প্রশিক্ষণ, পুনরুৎপাদন বা উন্নত করতে সাহায্য করার জন্য একটি মডেলের আউটপুট বা যুক্তির পদ্ধতিগত এবং অননুমোদিত ব্যবহার।

বাংলা version →


🇩🇪 Deutsch

OpenAI stört koordinierte Modell-Destillationskampagne

Wir haben kürzlich eine koordinierte Kampagne identifiziert und gestört, die darauf abzielte, geschützte Überlegungen aus unseren Modellen zu extrahieren, wobei die früheste beobachtete Aktivität in der ersten Woche des Juli stattfand. Diese Aktivität steht im Einklang mit adversarialer Destillation: der systematischen und unbefugten Nutzung der Ausgaben oder Überlegungen eines Modells, um ein anderes Modell zu trainieren, zu reproduzieren oder zu verbessern. Die Betreiber manipulierten die Modellinteraktionen, sodass geschützte Überlegungen in einer koordinierten, skalierten Weise in für den Anforderer sichtbaren Formen reproduziert werden konnten, was gegen unsere Nutzungsbedingungen verstieß.

Wir beobachteten, dass Betreiber versuchten, geschützte Überlegungen auf neuartige Weise zu extrahieren, darunter das Kopieren verschlüsselter Überlegungen aus einer Konversation und die Aufforderung an ein Modell in einer anderen Konversation, den verborgenen Überlegungsinhalt zu entschlüsseln und zu transkribieren. Die Aktivität begann am 1. Juli, mit hohen Volumenspitzen am 24. und 25. Juli, bestehend aus 16.000 Anfragen von über 4.000 Benutzern. Weitere Untersuchungen identifizierten verwandte Prompt-Muster-Aktivitäten in einem Cluster von über 15.000 Benutzern, den wir bis zum 28. Juli vollständig unterbrachen.

Wir schreiben einen Kerncluster der Aktivität Personen zu, die mit Moonshot AI, dem Entwickler von Kimi, in Verbindung stehen. Adversariale Destillation birgt Sicherheits- und nationale Sicherheitsrisiken. Extrahierte Überlegungen könnten verwendet werden, um ein anderes Modell zu trainieren, ohne die Sicherheitsvorkehrungen zu bewahren, die auf die benutzerorientierten Ausgaben des ursprünglichen Modells angewendet wurden.

Wir haben diese jüngste Destillationskampagne durch eine Kombination aus Account-Durchsetzung, technischen Kontrollen und Partnerkoordination abgeschwächt. Wir haben auch den Schutz für verborgene Überlegungen über Benutzer, Arbeitsbereiche, Organisationen und Modellfamilien hinweg gestärkt.

Was ist adversariale Destillation?

Adversariale Destillation ist die systematische und unbefugte Nutzung der Ausgaben oder Überlegungen eines Modells, um ein anderes Modell zu trainieren, zu reproduzieren oder zu verbessern.

Deutsch version →


🇪🇸 Español

OpenAI interrumpe una campaña coordinada de destilación de modelos

Recientemente identificamos y disrumpimos una campaña coordinada diseñada para extraer razonamiento protegido de nuestros modelos, con la actividad más temprana observada ocurriendo en la primera semana de julio. Esta actividad es consistente con la destilación adversarial: el uso sistemático y no autorizado de las salidas o razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. Los operadores manipularon las interacciones del modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante de manera coordinada y escalada que violó nuestros términos de servicio.

Observamos que los operadores intentaron extraer razonamiento protegido de formas novedosas, incluyendo copiar razonamiento cifrado de una conversación y pedir a un modelo en otra conversación que descifrara y transcribiera el contenido de razonamiento oculto. La actividad comenzó el 1 de julio, con picos de alto volumen el 24 y 25 de julio consistiendo en 16,000 solicitudes de más de 4,000 usuarios. Una investigación adicional identificó actividad de patrón de indicaciones relacionada en un clúster de más de 15,000 usuarios, que disrumpimos completamente para el 28 de julio.

Atribuimos un clúster central de la actividad a individuos asociados con Moonshot AI, el desarrollador de Kimi. La destilación adversarial plantea riesgos de seguridad y seguridad nacional. El razonamiento extraído podría usarse para entrenar otro modelo sin preservar las salvaguardas aplicadas a las salidas orientadas al usuario del modelo original.

Mitigamos esta campaña de destilación reciente a través de una combinación de aplicación de cuentas, controles técnicos y coordinación de socios. También fortalecimos las protecciones para el razonamiento oculto en usuarios, espacios de trabajo, organizaciones y familias de modelos.

¿Qué es la destilación adversarial?

La destilación adversarial es el uso sistemático y no autorizado de las salidas o razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo.

Español version →


🇫🇷 Français

OpenAI perturbe une campagne coordonnée de distillation de modèles

Nous avons récemment identifié et perturbé une campagne coordonnée conçue pour extraire le raisonnement protégé de nos modèles, la première activité observée datant de la première semaine de juillet. Cette activité est cohérente avec la distillation antagoniste : l'utilisation systématique et non autorisée des sorties ou du raisonnement d'un modèle pour aider à entraîner, reproduire ou améliorer un autre modèle. Les opérateurs ont manipulé les interactions du modèle afin que le raisonnement protégé puisse être reproduit sous des formes visibles pour le demandeur de manière coordonnée et à grande échelle, en violation de nos conditions d'utilisation.

Nous avons observé que les opérateurs tentaient d'extraire le raisonnement protégé de manière inédite, notamment en copiant le raisonnement crypté d'une conversation et en demandant à un modèle d'une autre conversation de déchiffrer et de transcrire le contenu du raisonnement caché. L'activité a débuté le 1er juillet, avec des pics de volume élevé les 24 et 25 juillet consistant en 16 000 requêtes provenant de plus de 4 000 utilisateurs. Une enquête plus approfondie a identifié une activité de modèle d'invite connexe au sein d'un groupe de plus de 15 000 utilisateurs, que nous avons complètement perturbée d'ici le 28 juillet.

Nous attribuons un noyau d'activité à des individus associés à Moonshot AI, le développeur de Kimi. La distillation antagoniste présente des risques pour la sécurité et la sûreté nationale. Le raisonnement extrait pourrait être utilisé pour entraîner un autre modèle sans préserver les garanties appliquées aux sorties orientées utilisateur du modèle original.

Nous avons atténué cette campagne de distillation récente grâce à une combinaison de mesures d'application des comptes, de contrôles techniques et de coordination avec les partenaires. Nous avons également renforcé les protections pour le raisonnement caché à travers les utilisateurs, les espaces de travail, les organisations et les familles de modèles.

Qu'est-ce que la distillation antagoniste ?

La distillation antagoniste est l'utilisation systématique et non autorisée des sorties ou du raisonnement d'un modèle pour aider à entraîner, reproduire ou améliorer un autre modèle.

Français version →


🇮🇳 हिन्दी

OpenAI ने समन्वित मॉडल-डिस्टिलेशन अभियान को बाधित किया

हमने हाल ही में एक समन्वित अभियान की पहचान की और उसे बाधित किया, जो हमारे मॉडलों से संरक्षित तर्क निकालने के लिए डिज़ाइन किया गया था, जिसमें सबसे पहली देखी गई गतिविधि जुलाई के पहले सप्ताह में हुई थी। यह गतिविधि प्रतिकूल आसवन के अनुरूप है: किसी अन्य मॉडल को प्रशिक्षित, पुनरुत्पादित या सुधारने में मदद करने के लिए एक मॉडल के आउटपुट या तर्क का व्यवस्थित और अनधिकृत उपयोग। ऑपरेटरों ने मॉडल इंटरैक्शन में हेरफेर किया ताकि संरक्षित तर्क को अनुरोधकर्ता को दृश्यमान रूपों में समन्वित, बड़े पैमाने पर पुन: प्रस्तुत किया जा सके, जिसने हमारी सेवा की शर्तों का उल्लंघन किया।

हमने देखा कि ऑपरेटरों ने नए तरीकों से संरक्षित तर्क निकालने का प्रयास किया, जिसमें एक बातचीत से एन्क्रिप्टेड तर्क को कॉपी करना और दूसरी बातचीत में एक मॉडल से छिपी तर्क सामग्री को डिक्रिप्ट और ट्रांसक्राइब करने के लिए कहना शामिल है। यह गतिविधि 1 जुलाई को शुरू हुई, जिसमें 24 और 25 जुलाई को उच्च-मात्रा स्पाइक्स थे, जिसमें 4,000 से अधिक उपयोगकर्ताओं से 16,000 अनुरोध शामिल थे। आगे की जांच ने 15,000 से अधिक उपयोगकर्ताओं के एक समूह में संबंधित प्रॉम्प्ट-पैटर्न गतिविधि की पहचान की, जिसे हमने 28 जुलाई तक पूरी तरह से बाधित कर दिया।

हम गतिविधि के एक मुख्य समूह को Moonshot AI (Kimi के डेवलपर) से जुड़े व्यक्तियों के लिए जिम्मेदार ठहराते हैं। प्रतिकूल आसवन सुरक्षा और राष्ट्रीय सुरक्षा जोखिम पैदा करता है। निकाला गया तर्क मूल मॉडल के उपयोगकर्ता-सामना वाले आउटपुट पर लागू सुरक्षा उपायों को संरक्षित किए बिना किसी अन्य मॉडल को प्रशिक्षित करने के लिए उपयोग किया जा सकता है।

हमने खाता प्रवर्तन, तकनीकी नियंत्रण और भागीदार समन्वय के संयोजन के माध्यम से इस हालिया आसवन अभियान को कम किया। हमने उपयोगकर्ताओं, कार्यक्षेत्रों, संगठनों और मॉडल परिवारों में छिपे तर्क के लिए सुरक्षा को भी मजबूत किया।

प्रतिकूल आसवन क्या है?

प्रतिकूल आसवन किसी अन्य मॉडल को प्रशिक्षित, पुनरुत्पादित या सुधारने में मदद करने के लिए एक मॉडल के आउटपुट या तर्क का व्यवस्थित और अनधिकृत उपयोग है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

OpenAI Mengganggu Kampanye Distilasi Model yang Terkoordinasi

Kami baru-baru ini mengidentifikasi dan mengganggu kampanye terkoordinasi yang dirancang untuk mengekstrak penalaran yang dilindungi dari model kami, dengan aktivitas paling awal yang diamati terjadi pada minggu pertama Juli. Aktivitas ini konsisten dengan distilasi adversarial: penggunaan sistematis dan tidak sah dari keluaran atau penalaran suatu model untuk membantu melatih, mereproduksi, atau meningkatkan model lain. Operator memanipulasi interaksi model sehingga penalaran yang dilindungi dapat direproduksi dalam bentuk yang terlihat oleh peminta dengan cara terkoordinasi dan berskala yang melanggar persyaratan layanan kami.

Kami mengamati operator mencoba mengekstrak penalaran yang dilindungi dengan cara baru, termasuk menyalin penalaran terenkripsi dari satu percakapan dan meminta model di percakapan lain untuk mendekripsi dan mentranskripsikan konten penalaran yang tersembunyi. Aktivitas dimulai pada 1 Juli, dengan lonjakan volume tinggi pada 24 dan 25 Juli yang terdiri dari 16.000 permintaan dari lebih dari 4.000 pengguna. Investigasi lebih lanjut mengidentifikasi aktivitas pola prompt terkait di seluruh klaster lebih dari 15.000 pengguna, yang sepenuhnya kami ganggu pada 28 Juli.

Kami mengaitkan klaster inti aktivitas dengan individu yang terkait dengan Moonshot AI, pengembang Kimi. Distilasi adversarial menimbulkan risiko keamanan dan keamanan nasional. Penalaran yang diekstrak dapat digunakan untuk melatih model lain tanpa mempertahankan perlindungan yang diterapkan pada keluaran model asli yang berorientasi pada pengguna.

Kami memitigasi kampanye distilasi baru-baru ini melalui kombinasi penegakan akun, kontrol teknis, dan koordinasi mitra. Kami juga memperkuat perlindungan untuk penalaran tersembunyi di seluruh pengguna, ruang kerja, organisasi, dan keluarga model.

Apa itu distilasi adversarial?

Distilasi adversarial adalah penggunaan sistematis dan tidak sah dari keluaran atau penalaran suatu model untuk membantu melatih, mereproduksi, atau meningkatkan model lain.

Bahasa Indonesia version →


🇯🇵 日本語

OpenAI、調整されたモデル蒸留キャンペーンを妨害

当社は最近、モデルから保護された推論を抽出するために設計された協調キャンペーンを特定し、妨害しました。最も初期に観測された活動は7月の第1週に発生しました。この活動は、敵対的蒸留(別のモデルのトレーニング、複製、または改善を支援するために、あるモデルの出力や推論を体系的かつ無許可で使用すること)と一致しています。オペレーターはモデルの相互作用を操作し、保護された推論が要求者に可視的な形で、協調的かつ大規模な方法で再現されるようにしました。これは当社の利用規約に違反しています。

オペレーターは、ある会話から暗号化された推論をコピーし、別の会話のモデルに隠された推論コンテンツを復号して書き写すよう要求するなど、新しい方法で保護された推論を抽出しようと試みました。活動は7月1日に始まり、7月24日と25日には高ボリュームのスパイクが発生し、4,000人以上のユーザーから16,000件のリクエストがありました。さらなる調査により、15,000人以上のユーザーのクラスター全体で関連するプロンプトパターン活動が特定され、当社は7月28日までに完全に妨害しました。

当社は、活動の核となるクラスターを、Kimiの開発者であるMoonshot AIに関連する個人に帰属させます。敵対的蒸留は、安全性と国家安全保障上のリスクをもたらします。抽出された推論は、元のモデルのユーザー向け出力に適用されたセーフガードを保持せずに、別のモデルをトレーニングするために使用される可能性があります。

当社は、アカウントの執行、技術的管理、パートナーとの連携を組み合わせて、この最近の蒸留キャンペーンを緩和しました。また、ユーザー、ワークスペース、組織、モデルファミリー全体で、隠された推論の保護を強化しました。

敵対的蒸留とは何ですか?

敵対的蒸留とは、別のモデルのトレーニング、複製、または改善を支援するために、あるモデルの出力や推論を体系的かつ無許可で使用することです。

日本語 version →


🇧🇷 Português

OpenAI interrompe campanha coordenada de destilação de modelos

Recentemente, identificamos e interrompemos uma campanha coordenada projetada para extrair raciocínio protegido de nossos modelos, com a atividade mais antiga observada ocorrendo na primeira semana de julho. Essa atividade é consistente com a destilação adversária: o uso sistemático e não autorizado das saídas ou raciocínio de um modelo para ajudar a treinar, reproduzir ou melhorar outro modelo. Os operadores manipularam as interações do modelo para que o raciocínio protegido pudesse ser reproduzido em formas visíveis ao solicitante de maneira coordenada e em escala, violando nossos termos de serviço.

Observamos operadores tentando extrair raciocínio protegido de maneiras inovadoras, incluindo copiar raciocínio criptografado de uma conversa e pedir a um modelo em outra conversa para descriptografar e transcrever o conteúdo oculto do raciocínio. A atividade começou em 1º de julho, com picos de alto volume em 24 e 25 de julho consistindo em 16.000 solicitações de mais de 4.000 usuários. Uma investigação adicional identificou atividade de padrão de prompt relacionada em um cluster de mais de 15.000 usuários, que interrompemos totalmente até 28 de julho.

Atribuímos um cluster central da atividade a indivíduos associados à Moonshot AI, desenvolvedora do Kimi. A destilação adversária representa riscos de segurança e segurança nacional. O raciocínio extraído poderia ser usado para treinar outro modelo sem preservar as salvaguardas aplicadas às saídas voltadas para o usuário do modelo original.

Mitigamos esta campanha de destilação recente através de uma combinação de aplicação de contas, controles técnicos e coordenação de parceiros. Também fortalecemos as proteções para raciocínio oculto entre usuários, espaços de trabalho, organizações e famílias de modelos.

O que é destilação adversária?

Destilação adversária é o uso sistemático e não autorizado das saídas ou raciocínio de um modelo para ajudar a treinar, reproduzir ou melhorar outro modelo.

Português version →


🇷🇺 Русский

OpenAI срывает скоординированную кампанию по дистилляции моделей

Мы недавно выявили и сорвали скоординированную кампанию, направленную на извлечение защищенных рассуждений из наших моделей, причем самая ранняя наблюдаемая активность произошла в первую неделю июля. Эта активность соответствует состязательной дистилляции: систематическому и несанкционированному использованию выходных данных или рассуждений одной модели для обучения, воспроизведения или улучшения другой модели. Операторы манипулировали взаимодействием моделей, чтобы защищенные рассуждения могли быть воспроизведены в формах, видимых запрашивающему, скоординированным и масштабируемым образом, что нарушало наши условия обслуживания.

Мы наблюдали, как операторы пытались извлечь защищенные рассуждения новыми способами, включая копирование зашифрованных рассуждений из одного разговора и запрос модели в другом разговоре расшифровать и транскрибировать скрытое содержимое рассуждений. Активность началась 1 июля, с пиками высокого объема 24 и 25 июля, состоящими из 16 000 запросов от более чем 4 000 пользователей. Дальнейшее расследование выявило связанную активность с паттернами подсказок в кластере из более чем 15 000 пользователей, которую мы полностью пресекли к 28 июля.

Мы приписываем основной кластер активности лицам, связанным с Moonshot AI, разработчиком Kimi. Состязательная дистилляция представляет риски для безопасности и национальной безопасности. Извлеченные рассуждения могут быть использованы для обучения другой модели без сохранения мер защиты, применяемых к выходным данным исходной модели, ориентированным на пользователя.

Мы смягчили эту недавнюю кампанию дистилляции с помощью комбинации мер по обеспечению соблюдения учетных записей, технических средств контроля и координации с партнерами. Мы также усилили защиту скрытых рассуждений для пользователей, рабочих пространств, организаций и семейств моделей.

Что такое состязательная дистилляция?

Состязательная дистилляция — это систематическое и несанкционированное использование выходных данных или рассуждений одной модели для обучения, воспроизведения или улучшения другой модели.

Русский version →


🇨🇳 简体中文

OpenAI 破坏协调模型蒸馏活动

我们近期发现并破坏了一项旨在从我们的模型中提取受保护推理的协调活动,最早观察到的活动发生在7月第一周。该活动与对抗性蒸馏一致:系统性地未经授权使用一个模型的输出或推理来帮助训练、复制或改进另一个模型。操作者操纵模型交互,使受保护推理能够以请求者可见的、协调且大规模的方式重现,违反了我们的服务条款。

我们观察到操作者尝试以新颖的方式提取受保护推理,包括从一个对话中复制加密推理,并在另一个对话中要求模型解密并转录隐藏的推理内容。该活动始于7月1日,在7月24日和25日出现高量峰值,包含来自超过4,000名用户的16,000次请求。进一步调查发现相关提示模式活动涉及超过15,000名用户的集群,我们于7月28日完全破坏了该活动。

我们将核心活动归因于与Moonshot AI(Kimi的开发者)相关的个人。对抗性蒸馏构成安全和国家安全风险。提取的推理可能用于训练另一个模型,而不保留应用于原始模型面向用户输出的保障措施。

我们通过账户执行、技术控制和合作伙伴协调的组合方式缓解了此次蒸馏活动。我们还加强了对用户、工作区、组织和模型系列中隐藏推理的保护。

什么是对抗性蒸馏?

对抗性蒸馏是系统性地未经授权使用一个模型的输出或推理来帮助训练、复制或改进另一个模型。

简体中文 version →