HeadlinesBriefing HeadlinesBriefing 12 languages

How to Steal an AI Model’s Private Thoughts

ByteByteGo ·

🇬🇧 English

Modern AI models generate extensive internal reasoning before providing final answers. This "thinking" process contains intermediate hypotheses, tool outputs, and user data, making it significantly denser than the polished output. Most major providers withhold this trace for two reasons: commercially, competitors could use it to train cheaper imitations, and technically, exposing full reasoning could reveal sensitive user information.

In August 2026, researchers from MATS Research, the ELLIS Institute Tübingen, and the Max Planck Institute for Intelligent Systems demonstrated a vulnerability. They showed that encrypted reasoning blocks provided by Anthropic, OpenAI, and Google could be replayed into a cheaper model within the same family. When replayed, the cheaper model prints the hidden reasoning in plaintext, effectively stealing the original model's thoughts.

The extraction method involves forcing the cheaper model to generate the full chain of thought. Verification confirmed that the replayed output matched the original hidden process. This vulnerability impacts multiple providers, revealing that current encryption methods for reasoning blocks are insufficient.

The researchers identified four primary attack vectors enabling this replay. A scan of published session logs confirmed the prevalence of this issue. Proposed fixes involve modifying the replay mechanism, though a fundamental limit remains regarding how much reasoning can be truly protected while maintaining model utility.

The findings highlight a critical gap in AI privacy, showing that encrypted blocks do not guarantee confidentiality against determined replay attacks. This poses significant risks for applications handling sensitive data, as hidden thoughts can be extracted and exposed. The research underscores the need for stronger architectural safeguards in future model designs to prevent unauthorized reasoning extraction.

View original article →


🇸🇦 العربية

كيف يمكن إعادة تشغيل وكشف استنتاجات الذكاء الاصطناعي

تولد النماذج الحديثة للذكاء الاصطناعي استنتاجات داخلية منتشرة قبل تقديم الإجابات النهائية. يحتوي هذا "التفكير" على فرضيات وسطى، ومخرجات الأدوات، والبيانات من المستخدمين، مما يجعله أكثر كثافة من المخرج المنضبط. معظم المزودين الرئيسيين يحتفظون بهذا التتبع لسببين: تجاريًا، قد يستخدمه المنافسون لتدريب نسخ أرخص من المقلدين؛ وتقنيًا، قد يكشف الكشف الكامل عن الاستنتاج عن معلومات المستخدم الحساسة. في أغسطس 2026، أظهر باحثون من MATS Research، ومركز ELLIS توبنينغ، ومركز Max Planck للذكاء الاصطناعي الديناميكي، ثغرة. أظهروا أن كتل الاستنتاج المشفرة التي قدمتها Anthropic وOpenAI وGoogle يمكن إعادة تشغيلها في نموذج أرخص ضمن نفس العائلة. عند إعادة التشغيل، يطبع النموذج الأرخص الأفكار المخفية كنص عادي، في الواقع سرقة لأفكار النموذج الأصلي. يتضمن طريقة الاستخراج إجبار النموذج الأرخص على توليد سلسلة التفكير الكاملة. تأكد التحقق من أن المخرج المُعاد تشغيله يتطابق مع العملية المخفية الأصلية. تؤثر هذه الثغرة على عدة مزودين، مكشفة أن أساليب التشفير الحالية لكتل الاستنتاج غير كافية. حدد الباحثون أربعة متسارعات رئيسية ممكنة لتمكين هذا الإعادة التشغيل. أظهرت مسح سجلات الجلسات المنشورة شيوع هذه المشكلة. تتضمن الإصلاحات المقترحة تعديل آلية إعادة التشغيل، على الرغم من وجود حد أساسي ما يزال يبقى حول كمية الاستنتاج التي يمكن حمايتها حقًا مع الحفاظ على فائدة النموذج. تسلط النتائج الضوء على فجوة حيوية في خصوصية الذكاء الاصطناعي، مُظهرة أن كتل التشفير لا تضمن السرية ضد هجمات إعادة التشغيل المحددة. يطرح هذا مخاطرًا كبيرة للتطبيقات التي تتعامل مع البيانات الحساسة، حيث يمكن استخراج الأفكار المخفية وكشفها. تُبرز البحث الحاجة إلى تدابير أمان هيكلية أقوى في تصاميم النماذج المستقبلية لمنع استخراج الاستنتاج غير المصرح به.

كيف يمكن إعادة تشغيل كتل الاستنتاج المشفرة لكشف الأفكار المخفية؟

تتضمن طريقة الاستخراج إجبار النموذج الأرخص على إعادة تشغيل كتل الاستنتاج المشفرة. تأكد التحقق من أن المخرج المُعاد تشغيله يتطابق مع العملية المخفية الأصلية، مؤكدًا أن الثغرة تسمح باستخراج المعلومات التي يجب أن تبقى خاصة.

العربية version →


🇧🇩 বাংলা

কীভাবে AI যুক্তি পুনরায় চালানো এবং উন্মোচন করা যায়

আধুনিক AI মডেলগুলি চূড়ান্ত উত্তর প্রদানের আগে বিস্তৃত অন্তর্ণদেহী যুক্তি উত্পন্ন করে। এই "ভাবনা" প্রক্রিয়াটি মধ্যগ্রহীয় অনুমানগুলি, টুল আউটপুট এবং ব্যবহারকারী ডেটা ধারণ করে, যা এটিকে পরস্পরে পরিশোধিত আউটপুটের তুলনায় উল্লেখযোগ্যভাবে ঘন হয়। অধিকাংশ প্রধান প্রদানকারীরা এই ট্রেসটি রাখে, কারণ দুটি কারণে: বাণিজ্যিকভাবে, প্রতিযোগীরা এটি ব্যবহার করে সস্তা অনুকরণীয় প্রশিক্ষণ করতে পারে, এবং প্রযুক্তিগতভাবে, পুরো যুক্তি উন্মোচন করা ব্যবহারকারীর সংবেদনশীল তথ্য উন্মোচন করতে পারে। ২০২৬ মাসের আগস্টে, MATS Research, ELLIS Institute Tübingen এবং Max Planck Institute for Intelligent Systems এর গবেষকরা একটি Vulnerability প্রমাণ করেছেন। তারা দেখিয়েছেন যে Anthropic, OpenAI এবং Google দ্বারা প্রদান করা এনক্রিপ্টেড যুক্তি ব্লকগুলি একই পরিবারের একটি সস্তা মডেলে পুনরায় চালানো যায়। যখন পুনরায় চালানো হয়, সেই সস্তা মডেলটি লুকানো যুক্তি টেক্সট-প্লেইন হিসেবে প্রিন্ট করে, প্রত্যক্ষভাবে মূল মডেলের চিন্তাগুলি চুরি খেয়ে যায়। এই ব্যাহতির পদ্ধতি মসৃণ মডেলকে সম্পূর্ণ থ্রি চেইন জেনারেট করতে বাধ্য করে। যাচাই প্রমাণ করেছে যে পুনরায় চালানো আউটপুট মূল লুকানো প্রক্রিয়ার সাথে মেলে। এই ব্যাহতি কয়েকটি প্রদানকারীকে প্রভাবিত করে, যা বর্তমানে যুক্তি ব্লকগুলির জন্য এনক্রিপশনের পদ্ধতিগুলি পর্যাপ্ত নয় বলে প্রকাশ করে। গবেষকরা এই পুনরায় চালানোকে সক্ষম করার জন্য চারটি প্রধান আক্রমণ ভেক্টর চিহ্নিত করেছেন। সমগ্রিক সেশন লগগুলির একটি স্ক্যান এই সমস্যার প্রচলিততা নিশ্চিত করেছে। প্রস্তাবিত ঠিক করার উপায় রিপ্লে মেকানিজম সম্পাদন করা অন্তর্ভুক্ত করে, যা এখনও একটি মৌলিক সীমা রয়ে গেছে যে মডেলের উপযোগ বজায় রেখে সত্যিকারের মত যুক্তি কত পর্যন্ত সুরক্ষিত রাখা যায়। এই ফলাফলগুলি AI-এর গোপনীয়তায় একটি আলোকিত কমান হাইলাইট করে, যা দেখায় যে এনক্রিপ্টেড ব্লকগুলি নির্ধারিত রিপ্লে আক্রমণের বিরুদ্ধে গোপনীয়তা নিশ্চিত করে না। এটি সংবেদনশীল ডেটা হ্যান্ডল করে এমন এপ্লিকেশনগুলির জন্য এক বড় ঝুঁকি তৈরি করে, কারণ গোপন চিন্তাগুলি বের করা এবং উন্মোচন করা সম্ভব। গবেষণা ভবিষ্যৎ মডেল ডিজাইনে অানুগ্রহিক সুরক্ষা ব্যবস্থা প্রয়োজনীয়তা উজ্জীবিত করে যাতে স্বয়ংক্রিয় যুক্তি বের করা রোধ করা যায়।

কীভাবে এনক্রিপ্টেড যুক্তি ব্লকগুলি পুনরায় চালায়ে গোপন চিন্তাগুলি উন্মোচন করা যায়?

ব্যাহতির পদ্ধতি মসৃণ মডেলকে সম্পূর্ণ থ্রি চেইন জেনারেট করতে বাধ্য করে। যাচাই প্রমাণ করেছে যে পুনরায় চালানো আউটপুট মূল লুকানো প্রক্রিয়ার সাথে মেলে, যা দেখায় যে এই ব্যাহতি সংরক্ষিত হওয়া উচিত না এমন তথ্যের বেরাছাড়া সুবিধা প্রদান করে।

বাংলা version →


🇩🇪 Deutsch

Wie AI-Überlegungen wiederhergestellt und offengelegt werden können

Moderne KI-Modelle generieren umfangreiche interne Überlegungen vor dem Liefern finaler Antworten. Dieser "Denkprozess" enthält Zwischenhypothesen, Tool-Ausgaben und Benutzerdaten, wodurch er deutlich dicker als der polierte Output wird. Die meisten großen Anbieter behalten diese Spur aus zwei Gründen: Kommerziell könnten Mitbewerber sie verwenden, um günstigere Imitationen zu trainieren, und Technisch könnte die Offenlegung des vollständigen Denkens sensible Benutzerinformationen enthalten.

Im August 2026 demonstrierten Forscher aus MATS Research, dem ELLIS Institute Tübingen und dem Max Planck Institute for Intelligent Systems eine Schwachstelle. Sie zeigten, dass verschlüsselte Überlegungsblöcke von Anthropic, OpenAI und Google wiederhergestellt werden können in ein günstigeres Modell innerhalb desselben Modellfamilie. Bei Wiederherstellung gibt das günstigere Modell die versteckten Überlegungen im Klartext aus, wodurch die Gedanken des Originalmodells effektiv gestohlen werden.

Die Extraktionsmethode erfordert, dass das günstigere Modell die vollständige Denk-Kette generiert. die Verifizierung bestätigte, dass die wiederhergestellte Ausgabe mit dem ursprünglichen versteckten Prozess übereinstimmte. Diese Schwachstelle beeinflusst mehrere Anbieter und offenbart, dass die aktuellen Verschlüsselungsmethoden für Überlegungsblöcke unzureichend sind. Die Forscher identifizierten vier Hauptangriffsvektoren, die diese Wiederherstellung ermöglichen.

Eine Überprüfung der veröffentlichten Sitzungsprotokolle bestätigte die Verbreitung dieses Problems. Die vorgeschlagenen Korrekturen beinhalten die Änderung des Wiederherstellungsmechanismus, wobei ein grundlegendes Limit dennoch besteht, was an Überlegungen wirklich geschützt werden kann, während die Modellnutzbarkeit erhalten bleibt. Die Ergebnisse hervorheben eine kritische Lücke in der KI-Privatsphäre und zeigen, dass verschlüsselte Blöcke keine Vertraulichkeit gegen abgeklärte Wiederherstellungsangriffe garantieren.

Dies stellt erhebliche Risiken für Anwendungen dar, die sensible Daten verarbeiten, da versteckte Gedanken extrahiert und offengelegt werden können. Die Forschung betont die Notwendigkeit robuster architektonischer Sicherheitsvorkehrungen in zukünftigen Modelldesigns, um eine unautorisierte Extraktion von Überlegungen zu verhindern.

Wie können verschlüsselte Überlegungsblöcke wiederhergestellt werden, um versteckte Gedanken zu offenlegen?

Die Extraktionsmethode erfordert, dass das günstigere Modell die vollständige Denk-Kette generiert. Die Verifizierung bestätigte, dass die wiederhergestellte Ausgabe mit dem ursprünglich versteckten Prozess übereinstimmte und damit bewies, dass die Schwachstelle die Extraktion von Informationen ermöglicht, die privat bleiben sollten.

Deutsch version →


🇪🇸 Español

Cómo se puede reproducir y exponer el razonamiento de la IA

Los modelos de IA modernos generan extensos razonamiento interno antes de proporcionar respuestas finales. Este proceso de "pensamiento" contiene hipótesis intermedias, salidas de herramientas y datos de usuarios, lo que lo hace significativamente más denso que la salida pulida. La mayoría de los principales proveedores retienen este rastro por dos razones: comercialmente, los competidores podrían usarlo para entrenar imitaciones más económicas, y técnicamente, exponer el razonamiento completo podría revelar información de usuario sensible.

En agosto de 2026, investigadores de MATS Research, el ELLIS Institute Tübingen y el Max Planck Institute for Intelligent Systems demostraron una vulnerabilidad. Mostraron que los bloques de razonamiento encriptados proporcionados por Anthropic, OpenAI y Google podían ser reproducidos en un modelo más económico dentro de la misma familia. Cuando se reproduce, el modelo más económico imprime el razonamiento oculto en texto plano, robando efectivamente los pensamientos del modelo original.

El método de extracción implica forzar al modelo más económico a generar la cadena de pensamiento completa. La verificación confirmó que la salida reproducida coincidía con el proceso de razonamiento oculto original. Esta vulnerabilidad afecta a múltiples proveedores, revelando que los métodos actuales de encriptación de bloques de razonamiento son insuficientes.

Los investigadores identificaron cuatro vectores de ataque principales que habilitan esta reproducción. Una exploración de registros de sesiones publicados confirmó la prevalencia de este problema. Las soluciones propuestas implican modificar el mecanismo de reproducción, aunque aún persiste un límite fundamental sobre cuánto razonamiento puede protegerse verdaderamente mientras se mantiene la utilidad del modelo.

Los resultados destacan una brecha crítica en la privacidad de la IA, mostrando que los bloques encriptados no garantizan confidencialidad frente a ataques de reproducción determinados. Esto plantea riesgos significativos para aplicaciones que manejan datos sensibles, ya que los pensamientos ocultos pueden ser extraídos y exponerse. La investigación subraya la necesidad de medidas de seguridad arquitectónicas más robustas en los diseños futuros de modelos para prevenir la extracción no autorizada de razonamiento.

¿Cómo se pueden reproducir los bloques de razonamiento encriptados para exponer pensamientos ocultos?

El método de extracción implica forzar al modelo más económico a reproducir el bloque de razonamiento encriptado. La verificación confirmó que la salida reproducida coincidía con el proceso de razonamiento oculto original, demostrando que la vulnerabilidad permite la extracción de información que debería permanecer privada.

Español version →


🇫🇷 Français

Comment la logique d'IA peut être rejouée et exposée

Les modèles d'IA modernes génèrent une réflexion interne extensive avant de fournir des réponses finales. Ce processus de "pensée" contient des hypothèses intermédiaires, des sorties d'outils et des données utilisateur, le rendant significativement plus dense que la sortie polie. La plupart des grands fournisseurs conservent cette trace pour deux raisons: commercialement, les concurrents pourraient l'utiliser pour entraîner des imitations moins coûteuses, et techniquement, exposer la réflexion complète pourrait révéler des informations utilisateur sensibles.

En août 2026, des chercheurs de MATS Research, de l'ELLIS Institute Tübingen et du Max Planck Institute for Intelligent Systems ont démontré une vulnérabilité. Ils ont montré que les blocs de raisonnement cryptés fournis par Anthropic, OpenAI et Google pouvaient être rejoués dans un modèle moins coûteux de la même famille. Lorsqu'ils sont rejoués, le modèle moins coûteux imprime la réflexion cachée en texte clair, volant efficacement les pensées du modèle original.

La méthode d'extraction implique de forcer le modèle moins coûteux à générer la chaîne de raisonnement complète. La vérification a confirmé que la sortie rejouée correspondait au processus de réflexion caché original. Cette vulnérabilité affecte plusieurs fournisseurs, révélant que les méthodes de chiffrement actuelles des blocs de raisonnement sont insuffisantes.

Les chercheurs ont identifié quatre vecteurs d'attaque principaux permettant cette relecture. Une enquête sur les journaux de session publiés a confirmé la prévalence de ce problème. Les correctifs proposés impliquent de modifier le mécanisme de relecture, bien qu'une limite fondamentale subsiste concernant la quantité de raisonnement qui peut être réellement protégée tout en maintenant l'utilité du modèle.

Les résultats soulignent une lacune critique dans la confidentialité de l'IA, montrant que les blocs chiffrés ne garantissent pas la confidentialité contre les attaques de relecture déterminées. Cela pose des risques significatifs pour les applications traitant des données sensibles, car les pensées cachées peuvent être extraites et exposées. La recherche souligne la nécessité de mesures de sécurité architecturales plus robustes dans les conçus futurs des modèles pour prévenir l'extraction de raisonnement non autorisée.

Comment les blocs de raisonnement cryptés peuvent-ils être rejoués pour exposer des pensées cachées?

La méthode d'extraction implique de forcer le modèle moins coûteux à rejouer le bloc de raisonnement crypté. La vérification a confirmé que la sortie rejouée correspondait au processus de réflexion caché original, démontrant que la vulnérabilité permet l'extraction d'informations qui devraient rester privées.

Français version →


🇮🇳 हिन्दी

कैसे AI तर्क को पुनरावृत्ति और उजागर किया जा सकता है

आधुनिक AI मॉडल अंतिम उत्तर प्रदान करने से पहले विस्तृत आंतरिक तर्क उत्पन्न करते हैं। यह "विचार" प्रक्रिया मध्यवर्ती अनुमानाओं, उपकरण आउटपुट और उपयोगकर्ता डेटा सодерж содержит, जिससे यह प्रशोधित आउटपुट की तुलना में धेरै समृद्ध होता है। अधिकांश प्रमुख प्रदाता इस ट्रेस को रखते हैं क्योंकि दो कारणों के लिए: वाणिज्यिक रूप से, प्रतियोगी इसे उपयोग करके किफायती नकली बनाये सकते हैं, और तकनीकी रूप से, पूरी तरह से तर्क को सार्वजनिक करने से संवेदनशील उपयोगकर्ता जानकारी को उजागर किया जा सकता है। 2026 के अगस्त में, MATS Research, ELLIS Institute Tübingen और Max Planck Institute for Intelligent Systems के शोधकर्णियों ने एक विधि प्रदर्शित की। उन्होंने दिखाया कि Anthropic, OpenAI और Google द्वारा प्रदान किए गए एन्क्रिप्टेड तर्क ब्लॉक्स को समान परिवार के एक किफायती मॉडल में पुनरावृत्ति किया जा सकता है। जब यह पुनरावृत्ति किया जाता है, तो किफायती मॉडल गुप्त तर्क को ग्राहक-मुक्त रूप में प्रिंट करता है, वास्तव में मूल मॉडल के विचारों को चुरा लेता है। इंतजाम की विधि महंगा मॉडल को पूरी श्रृंखला के विचार को उत्पन्न करने के लिए मजबूत करना सम्मिलित करता है। पुष्टि ने पुनरावृत्ति किए गए आउटपुट को मूल गुप्त प्रक्रिया के साथ मेल खाते हैं। यह विधि कई प्रदाताओं को प्रभावित करती है, जिससे प्रस्तुत एन्क्रिप्शन तरीकों की पर्याप्तता का प्रश्न उठता है। शोधकर्णी ने इस पुनरावृत्ति को सक्षम बनाने वाले चार प्रमुख हमला मार्ग पहचान किए। प्रकाशित सत्र लॉग की स्कैन ने इस समस्या की प्रकार को पुष्टि किया। प्रस्तावित ठीक करने के उपाय मॉडल रिप्ले मैकेनिज़्म को बदलना शामिल है, जबकि एक मूल सीमा अभी भी रहती है कि मॉडल उपयोगिता को बनाए रखते हुए वास्तव में कितना तर्क सुरक्षित किया जा सकता है। ये निष्कर्ष AI की गोपनीयता में एक आपत्तिजनक खालीपन को उजागर करते हैं, दिखाते हैं कि एन्क्रिप्टेड ब्लॉक्स परिभाषा में प्रतिबंधित रीप्ले अटैक्स के खिलाफ गोपनीयता को नहीं गारंटी देते हैं। यह संवेदनशील डेटा संभालने वाले एप्लिकेशन्स के लिए एक ठोस जोखिम उत्पन्न करता है, क्योंकि छिपे विचार निकाले और उजागर किए जा सकते हैं। शोध भविष्य में मॉडल डिज़ाइन के लिए अधिक मजबूत आर्किटेक्चरल सुरक्षा उपायों की आवश्यकता को उजागर करता है ताकि अनधिकृत तर्क निकाली न जा सके।

कैसे एन्क्रिप्टेड तर्क ब्लॉक्स को पुनरावृत्ति के साथ छिपे विचारों को उजागर किया जा सकता है?

इंतजाम की विधि महंगा मॉडल को पूरी श्रृंखला के विचार को उत्पन्न करने के लिए मजबूत करना सम्मिलित करता है। पुष्टि ने पुनरावृत्ति किए गए आउटपुट को मूल गुप्त प्रक्रिया के साथ मेल खाते हैं। यह विधि वह गोपनीय जानकारी की निकाली की सुविधा प्रदर्शित करता है जो प्राइवेसी को कमाना चाहिए।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Bagaimana Penyelidikan AI dapat Ddireplay dan Dibongkar

Model AI moderna menghasilkan pemikiran internal yang luas sebelum memberikan jawaban akhir. Proses "pemikiran" ini berisi hipotesis menengah, output alat, dan data pengguna, membuatnya jauh lebih padat daripada output yang sudah ditolong. Kebanyakan penyedia utama tetap menyimpan jejak ini untuk dua alasan: secara komersial, kompetitor mungkin dapat menggunakannya untuk melatih imitasi yang lebih murah, dan secara teknis, mengekspos pemikiran lengkap dapat mengungkapkan informasi pengguna yang sensitif.

Pada Agustus 2026, peneliti dari MATS Research, ELLIS Institute Tübingen, dan Max Planck Institute for Intelligent Systems menunjukkan kerentanan. Mereka menunjukkan bahwa blok pemikiran terenkripsi yang disediakan oleh Anthropic, OpenAI, dan Google dapat direplay ke dalam model yang lebih murah dalam famili yang sama. Saat direplay, model yang lebih murah mencetak pemikiran yang tersembunyi dalam teks biasa, secara efektif mencuri pikiran dari model asli.

Metode ekstraksi melibatkan memaksa model yang lebih murah untuk menghasilkan rantai pemikiran lengkap. Verifikasi mengonfirmasi bahwa output yang direplay cocok dengan proses pemikiran tersembunyi yang asli. Kerentanan ini memengaruhi beberapa penyedia, mengungkapkan bahwa metode enkripsi saat ini untuk blok pemikiran tidak cukup.

Peneliti mengidentifikasi empat vektor serangan utama yang memungkinkan replay ini. Pemindaian log sesi yang dipublikasikan mengonfirmasi prevalensi masalah ini. Perbaikan yang diusulkan melibatkan modifikasi mekanisme replay, meskipun batas fundamental tetap ada mengenai berapa banyak pemikiran yang dapat benar-benar dilindungi sambil mempertahankan kegunaan model.

Temuan menyoroti celah kritis dalam privasi AI, menunjukkan bahwa blok terenkripsi tidak menjamin kerahasiaan melawan serangan replay yang ditentukan. Ini menyajikan risiko yang signifikan untuk aplikasi yang menangani data sensitif, karena pikiran yang tersembunyi dapat diekstrak dan dibongkar. Penelitian menekankan kebutuhan akan langkah keamanan arsitektural yang lebih kuat dalam desain model masa depan untuk mencegah ekstraksi pemikiran yang tidak diotorisasi.

Bahasa Indonesia version →


🇯🇵 日本語

AI推論を再生して暴露する方法

現代のAIモデルは最終的な答えを提供する前に包括的な内部推論を生成します。この「思考」プロセスには、中間仮説、ツール出力、ユーザーデータが含まれ、 polished output(精緻な出力)と比べてはるかに密度が高い。主要なプロバイダーの多くは、このトレースを保持しています。その理由は2つあります:商業的には、競争相手がこれを使用してより安価な模倣品をトレーニングする可能性があるため、技術的には、完全な推論を公開することで、機密ユーザー情報が明らかになる可能性があるためです。2026年8月、MATS Research、ELLIS Institute Tübingen、およびMax Planck Institute for Intelligent Systemsの研究者たちは、脆弱性を示しました。彼らは、Anthropic、OpenAI、およびGoogleが提供する暗号化された推論ブロックが、同じファミリー内のより安価なモデルに再生できることを示しました。再生されると、より安価なモデルは隠された推論をプレーンテキストで印刷し、実質的に元のモデルの思考を盗んでいます。抽出方法とは、より安価なモデルをフルチェーン・オブ・サステンスを生成させることです。検証により、再生された出力が元の隠されたプロセスと一致することが確認されました。この脆弱性は複数のプロバイダーに影響を与え、暗号化推論ブロックの現在の暗号化方法が不十分であることを明らかにします。研究者たちは、この再生を可能にする4つの主要な攻撃ベクターを特定しました。公開されたセッションログのスキャンにより、この問題の広範な有無が確認されました。提案された修正は、リプレイメカニズムの変更を含みますが、モデルの実用性を維持しながら、本当に保護できる推論の量については根本的な限界が残ります。この findings( findings は日本語では「研究成果」や「結果」の意味です)は、AIプライバシーにおける重要なギャップを浮き彫りにし、暗号化ブロックが確定したリプレイ攻撃に対して機密性を保証しないことを示しています。これは、機密データを処理するアプリケーションにとって重大なリスクをもたらし、隠された思考が抽出され、明らかになる可能性があります。この研究は、将来のモデルデザインにおいて、不正の推論抽出を防ぐためのより強力なアーキテクチャ的セキュリティ対策の必要性を強調しています。

暗号化された推論ブロックを再生して隠された思考を明らかにするには?

抽出方法とは、より安価なモデルをフルチェーン・オブ・サステンスを生成させることです。検証により、再生された出力が元の隠されたプロセスと一致することが確認されました。これは、機密であるべき情報の抽出を可能にする脆弱性を示しています。

日本語 version →


🇧🇷 Português

Como o raciocínio de IA pode ser reproduzido e exposto

Os modelos de IA modernos geram extensos raciocínios internos antes de fornecer respostas finais. Esse processo de "pensamento" contém hipóteses intermediárias, saídas de ferramentas e dados do usuário, tornando-o significativamente mais denso que a saída polida. A maioria dos principais provedores retém esse rastreamento por dois motivos: comercialmente, os concorrentes poderiam usá-lo para treinar imitações mais baratas, e tecnicamente, expor o raciocínio completo poderia revelar informações sensíveis de usuários.

Em agosto de 2026, pesquisadores de MATS Research, ELLIS Institute Tübingen e Max Planck Institute for Intelligent Systems demonstraram uma vulnerabilidade. Eles mostraram que blocos de raciocínio criptografados fornecidos por Anthropic, OpenAI e Google poderiam ser reproduzidos em um modelo mais barato dentro da mesma família. Quando reproduzidos, o modelo mais barato imprime o raciocínio oculto em texto legível, roubando efetivamente os pensamentos do modelo original.

O método de extração envolve forçar o modelo mais barato a gerar a cadeia completa de pensamento. A verificação confirmou que a saída reproduzida correspondia ao processo de raciocínio oculto original. Essa vulnerabilidade afeta múltiplos provedores, revelando que os métodos atuais de criptografia de blocos de raciocínio são insuficientes.

Os pesquisadores identificaram quatro vetores de ataque principais que permitem essa reprodução. Uma varredura de registros de sessões publicados confirmou a prevalência desse problema. As correções propostas envolvem modificar o mecanismo de reprodução, embora ainda exista um limite fundamental sobre quanto raciocínio pode ser verdadeiramente protegido enquanto se mantém a utilidade do modelo.

Os resultados destacam uma lacuna crítica na privacidade da IA, mostrando que blocos criptografados não garantem confidencialidade contra ataques de reprodução determinados. Isso apresenta riscos significativos para aplicações que lidam com dados sensíveis, pois pensamentos ocultos podem ser extraídos e expostos. A pesquisa enfatiza a necessidade de medidas de segurança arquitetônicas mais robustas nos projetos futuros de modelos para prevenir a extração não autorizada de raciocínio.

Como blocos de raciocínio criptografados podem ser reproduzidos para expor pensamentos ocultos?

O método de extração envolve forçar o modelo mais barato a reproduzir o bloco de raciocínio criptografado. A verificação confirmou que a saída reproduzida correspondia ao processo de raciocínio oculto original, provando que a vulnerabilidade permite a extração de informações que deveriam permanecer privadas.

Português version →


🇷🇺 Русский

Как AI-рассуждения можно воспроизвести и раскрыть

Современные модели ИИ генерируют обширные внутренние рассуждения перед предоставлением окончательных ответов. Этот "процесс мышления" содержит промежуточные гипотезы, выходы инструментов и данные пользователей, делая его значительно плотнее, чем отполированный вывод. Большинство крупных поставщиков сохраняют этот отслеживающий след по двум причинам: коммерчески конкуренты могли бы использовать его для обучения дешевых имитаций, и технически раскрытие полного рассуждения могло бы раскрыть чувствительную информацию пользователя. В августе 2026 года исследователи из MATS Research, ELLIS Institute Tübingen и Max Planck Institute for Intelligent Systems продемонстрировали уязвимость. Они показали, что зашифрованные блоки рассуждений, предоставленные Anthropic, OpenAI и Google, могли бы быть воспроизведены в более дешевой модели в той же семье. При воспроизведении более дешевая модель печатает скрытое рассуждение в открытом тексте, эффективно крадя мысли оригинальной модели. Метод извлечения заключается в принудительном заставлении более дешевой модели генерировать полную цепочку мыслей. Проверка подтвердила, что воспроизведенный вывод соответствовал исходному скрытому процессу. Эта уязвимость затрагивает несколько поставщиков, раскрывая, что текущие методы шифрования блоков рассуждения недостаточны. Исследователи опустили четыре основных вектора атаки, позволяющих это воспроизведение. Сканирование опубликованных сеансовых журналов подтвердило распространенность этой проблемы. Предлагаемые исправления включают изменение механизма воспроизведения, хотя всегда остается фундаментальное ограничение того, сколько рассуждений может быть надежно защищено при сохранении полезности модели. Эти результаты подчеркивают критическую пробелу в конфиденциальности ИИ, показывая, что зашифрованные блоки не гарантируют конфиденциальность против убедительных атак воспроизведения. Это создает значительные риски для приложений, обрабатывающих чувствительные данные, поскольку скрытые мысли могут быть извлечены и раскрыты. Исследование подчеркивает необходимость более надежных архитектурных мер безопасности в будущих проектах моделей для предотвращения несанкционированного извлечения рассуждений.

Как зашифрованные блоки рассуждений можно воспроизвести для раскрытия скрытых мыслей?

Метод извлечения заключается в принудительном заставлении более дешевой модели воспроизводить зашифрованный блок рассуждений. Проверка подтвердила, что воспроизведенный вывод соответствовал исходному скрытому процессу, доказывая, что уязвимость позволяет извлечь информацию, которая должна оставаться конфиденциальной.

Русский version →


🇨🇳 简体中文

如何重放和揭露AI推理

现代AI模型在提供最终答案之前会进行大量内部推理。这一“思考”过程包含中间假设、工具输出和用户数据,使其远超精炼输出的密度。大多数主要提供商会保留这一轨迹,原因有二:商业上,竞争对手可能利用它训练更便宜的模仿品;技术上,公开完整推理可能揭露敏感用户信息。2026年8月,来自MATS Research、ELLIS Institute Tübingen和Max Planck Institute for Intelligent Systems的研究人员展示了一个漏洞。他们表明,Anthropic、OpenAI和Google提供的加密推理块可被重放到同一系列中更便宜的模型内。一旦重放,较便宜的模型会以明文形式打印出隐藏的推理,实际上窃取了原始模型的思想。提取方法涉及强制较便宜的模型生成完整的思维链。验证确认,重放的输出与原始隐藏过程相匹配。这一漏洞影响多个提供商,揭示当前对推理块的加密方法不足。研究人员识别了四个主要攻击向量,使其能够实现重放。对已发布会话日志的扫描确认了此问题的普遍性。提议的修复措施涉及修改重放机制,尽管仍存在一个根本限制,即在维持模型实用性的前提下,究竟能保护多少推理。这些发现凸显了AI隐私方面的关键缺口,表明加密块并不保证在面对确定性重放攻击时保密性。这对处理敏感数据的应用构成重大风险,因而可以提取和暴露隐藏的思想。研究强调了未来模型设计中需要更强大的体系结构安全措施,以防止未经授权的推理提取。

加密推理块如何被重放以暴露隐藏思想?

提取方法涉及强制较便宜的模型重放加密推理块。验证确认,重放的输出与原始隐藏推理过程相匹配,证明该漏洞允许提取本应保持私有的Information。

简体中文 version →