HeadlinesBriefing HeadlinesBriefing 11 languages

UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvement

Hacker News ·

🇬🇧 English

Modern multimodal models integrate generation and understanding into a unified system, enabling learning from self-generated feedback. Introducing Uni Evo-VL, a self-evolving framework that leverages self-critiques as privileged information during test-time compute. Instead of relying on a separate, often larger teacher model, a single multimodal model acts as both teacher and student with different contexts.

The student only sees the vanilla question, while the teacher conditions on the privileged critique. Training minimizes the per-state divergence between their denoising diffusion distributions over the student's sampling trajectories. Experiments demonstrate that Uni Evo-VL improves image generation capabilities while maintaining sensitivity to reflection information.

Building on the open-source Qwen-image-2512, performance gains were observed from 0.747 to 0.808 on Gen Eval and from 32.97 to 35.53 on Gen Eval2 Soft-TIFA. Attempts with more powerful external critics, such as GPT5.6-Luna, show that multimodal models with strong judge capabilities can anticipate a higher self-evolving ceiling. Mixed text-rendering outcomes indicate that self-improvements may not be uniform across different tasks.

The study aims to enhance user experience when using multimodal models without external supervision or guidance. It sheds light on the current hot recursive self-improvement research line.

View original article →


🇸🇦 العربية

يزده UniEvo-VL يحسن أداء نماذج الوسائط المتعددة من خلال التنبؤ الذاتي

تدمج النماذج الوسائط المتعددة الحديثة توليدًا وفهمًا في نظام موحد، مما يتيح التعلم من التعليقات التي تم إنشاؤها تلقائيًا. نقدّم UniEvo-VL، إطارًا للتطوير الذاتي يستفيد من التعليقات الذاتية كمعلومات متميّزة أثناء احتساب الاختبار. بدلاً من الاعتماد على نموذج معلم منفصل، غالبًا أكبر، يعمل نموذج واحد متعدد الوسائط كمعلم وطالب باستخدام سياقات مختلفة. يرى الطالب فقط السؤال البسيط، بينما يشروط المعلم على التعليق المتميّز. يهدف التدريب إلى التقليل من الفرق بين التوزيعات التي تُنظّف الموجات ضمن مسارات العينة الخاصة بالطالب. تُظهر التجارب أن UniEvo-VL يحسّن قدرات توليد الصور بينما يحافظ على الحساسية لمعلومات الانعكاس. بناءً على Qwen-image-2512 المفتوح المصدر، لاحظت تحسينات من 0.747 إلى 0.808 في Gen Eval ومن 32.97 إلى 35.53 في Gen Eval2 Soft-TIFA. تُظهر المحاولات باستخدام منتقدين خارجيين أقوى، مثل GPT5.6-Luna، أن النماذج الوسائطية المتعددة ذات قدرات قضاء قوية يمكنها توقع سقف أعلى للتطوير الذاتي. تشير النتائج المختلطة لتقديم النصوص إلى أن التحسينات الذاتية قد لا تكون متساوية عبر مهام مختلفة. يهدف الدراسة إلى تحسين تجربة المستخدم عند استخدام النماذج الوسائطية المتعددة دون إشراف أو إرشاد خارجي. وتسلط الضوء على مسار البحث الحالي الاحترافي للتحسين الذاتي المتكرر.

ما هو UniEvo-VL وكيف يحسن النماذج الوسائطية المتعددة؟

UniEvo-VL هو إطار للتطوير الذاتي للنماذج الوسائطية المتعددة يتعلم من تعليقات التصحيح الذاتية الإيجابية أثناء احتساب الاختبار. يتيح مزيحًا واحدًا أن يعمل كمعلم وطالب، مستفيدًا من التعليقات الذاتية كمعلومات متميّزة لتقليل الفرق بين توزيعات تنظيف الموجات، مما يؤدي إلى تحسين قدرات توليد الصور دون إشراف خارجي.

العربية version →


🇧🇩 বাংলা

UniEvo-VL নিজে-নিজে পুনর্বিন্যাস করে মল্টিমোডাল মডেলের পারফরম্যান্স বাড়ায়

আধুনিক মল্টিমোডাল মডেলগুলি জেনারেশন এবং আচরণকে একটি একীভূত ব্যবস্থায় একীকৃত করে, যা তাদের নিজের দ্বারা তৈরি করা ফিডব্যাক থেকে শিখতে সক্ষম করে। আমরা UniEvo-VL প্রস্তাবনা করি, একটি স্ব-বিকাশী ফ্রেমওয়ার্ক যা পরীক্ষার সময়ে স্ব-নির্ণয়কে প্রাধান্যপূর্ণ তথ্য হিসেবে ব্যবহার করে। এটি একটি আলাদা, কখনও কখনও বড় শিক্ষক মডেলের ওপর নয় নির্ভর করে, বরং একক মল্টিমোডাল মডেলটি ভিন্ন প্রসঙ্গের সাথে শিক্ষক ও শিক্ষার্থী হিসেবে কাজ করে। শিক্ষার্থী কেবল মূল প্রশ্ন দেখে, আপডেটেড শিক্ষক প্রাধান্যপূর্ণ নিঃস্বার্থ প্রতিক্রিয়ার সাথে শর্ত দেয়। প্রশিক্ষণ মূলত শিক্ষার্থীর নমুনা পথে তাদের ডিনোইজ ডিফিউজন বিতরণের মধ্যে অবস্থা-ভিত্তিক পার্থক্য কমাতে লক্ষ্য রাখে। পরীক্ষাগুলি দেখায় যে UniEvo-VL প্রতিধ্বনি তথ্যের সংবেদনশীলতা বজায় রেখে ছবি জেনারেশন ক্ষমতা বাড়ায়। খুলা Qwen-image-2512-এর ভিত্তিতে, আমরা Gen Eval-এ 0.747 থেকে 0.808 পর্যন্ত এবং Gen Eval2 Soft-TIFA-এ 32.97 থেকে 35.53 পর্যন্ত পারফরম্যান্স উন্নতি দেখি। আরও সম্পন্ন বাহ্যিক সমালোচকদের, যেমন GPT5.6-Luna, ব্যবহার করে চেষ্টার মধ্যে দেখায় যে শক্তিশালী ন্যায়সঙ্গত দক্ষতা সম্পন্ন মল্টিমোডাল মডেলগুলি একটি উচ্চ নিজে-বিকাশী ছাত্র প্রত্যাশা করতে পারে। মিশ্র টেক্সট রেন্ডারিং ফলাফলগুলি ইঙ্গিত দেয় যে নিজে-সংশোধনগুলি বিভিন্ন কাজের মধ্যে সমানভাবে হতে পারে না। এই গবেষণাটি মল্টিমোডাল মডেল ব্যবহার করার সময় ব্যবহারকারীর অভিজ্ঞতা উন্নত করার জন্য করা হয়েছে, বাহ্যিক নিয়ন্ত্রণ বা দিকনির্দেশনা ছাড়া। এটি বর্তমানে জনপ্রিয় রিকর্সিভ স্ব-সংশোধন গবেষণার দিকনির্দেশনায় প্রকাশ করে।

UniEvo-VL কী এবং কীভাবে মল্টিমোডাল মডেলগুলিকে সুধরিয়ে দেয়?

UniEvo-VL একটি মল্টিমোডাল মডেলের জন্য একটি স্ব-বিকাশী ফ্রেমওয়ার্ক যা পরীক্ষার সময়ে নির্মাণযোগ্য স্ব-সংশোধন প্রতিক্রিয়া থেকে শিখে। এটি একক মডেলকে শিক্ষক ও শিক্ষার্থী হিসেবে কাজ করিয়ে দেয়, স্ব-নির্ণয়কে প্রাধান্যপূর্ণ তথ্য হিসেবে ব্যবহার করে ডিনোইজ ডিফিউজন বিতরণের মধ্যে পার্থক্য কমিয়ে ছবি জেনারেশন ক্ষমতা উন্নত করে।

বাংলা version →


🇪🇸 Español

UniEvo-VL Auto-Distilación Mejora el Rendimiento de Modelos Multimodales

Los modelos multimodales modernos integran la generación y comprensión en un sistema unificado, lo que le permite aprender a partir de retroalimentación auto-generada. Introducimos UniEvo-VL, un marco de auto-evolución que aprovecha las autocríticas como información privilegiada durante el cómputo en tiempo de prueba. En lugar de confiar en un modelo docente separado, a menudo más grande, un solo modelo multimodal actúa como docente y estudiante con diferentes contextos.

El estudiante solo ve la pregunta original, mientras que el docente se condiciona a la crítica privilegiada. El entrenamiento minimiza la divergencia por estado entre sus distribuciones de difusión denoizada a lo largo de las trayectorias de muestreo del estudiante. Los experimentos demuestran que UniEvo-VL mejora las capacidades de generación de imágenes mientras mantiene la sensibilidad a la información de reflexión.

Basándose en Qwen-image-2512 de código abierto, observamos mejoras del 0.747 a 0.808 en Gen Eval y de 32.97 a 35.53 en Gen Eval2 Soft-TIFA. Los intentos con críticos externos más poderosos, como GPT5.6-Luna, muestran que los modelos multimodales con capacidades de juez fuertes pueden anticipar un techo de auto-evolución más alto. Los resultados mixtos de renderizado de texto indican que las mejoras autogeneradas pueden no ser uniformes en diferentes tareas.

El estudio busca mejorar la experiencia del usuario al utilizar modelos multimodales sin supervisión o guía externa, y aporta claridad a la línea de investigación actual de auto-mejora recursiva.

¿Qué es UniEvo-VL y cómo mejora los modelos multimodales?

UniEvo-VL es un marco de auto-evolución para modelos multimodales que aprende de retroalimentación de autocrítica constructiva durante el cómputo en tiempo de prueba. Permite que un solo modelo actúe como docente y estudiante, aprovechando las autocríticas como información privilegiada para minimizar la divergencia entre distribuciones de difusión denoizada, resultando en mejoras en las capacidades de generación de imágenes sin supervisión externa.

Español version →


🇫🇷 Français

UniEvo-VL Auto-Distillation Améliore les Performances des Modèles Multimodaux

Les modèles multimodaux modernes intègrent la génération et la compréhension dans un système unifié, leur permettant d'apprendre à partir de rétroactions générées automatiquement. Nous présentons UniEvo-VL, un cadre auto-évolutif qui exploite les critiques autonomes comme informations privilégiées lors du calcul lors des tests. Au lieu de s'appuyer sur un modèle enseignant séparé, souvent plus important, un seul modèle multimodal agit à la fois comme enseignant et élève avec des contextes différents.

L'élève ne voit que la question d'origine, tandis que l'enseignant se base sur la critique privilégiée. L'entraînement vise à minimiser la divergence par état entre leurs distributions de diffusion débruitées sur les trajectoires d'échantillonnage de l'élève. Les expériences démontrent qu'UniEvo-VL améliore les capacités de génération d'images tout en maintenant la sensibilité aux informations de réflexion.

S'appuyant sur Qwen-image-2512 en code source ouvert, nous observons des gains de 0,747 à 0,808 sur Gen Eval et de 32,97 à 35,53 sur Gen Eval2 Soft-TIFA. Des tentatives avec des critiques externes plus puissants, tels que GPT5.6-Luna, montrent que les modèles multimodaux dotés de capacités de juge fortes peuvent anticiper un plafond d'amélioration autonome plus élevé. Les résultats mixtes de rendu textuel indiquent que les améliorations autonomes peuvent ne pas être uniformes dans différentes tâches.

Cette étude vise à améliorer l'expérience utilisateur lors de l'utilisation de modèles multimodaux sans supervision ou guidance externe, et éclaire la voie de la recherche actuelle sur l'amélioration autonome récursive.

Qu'est-ce que UniEvo-VL et comment améliore-t-il les modèles multimodaux ?

UniEvo-VL est un cadre auto-évolutif pour les modèles multimodaux qui apprend à partir des rétroactions de auto-correction constructive lors du calcul lors des tests. Il permet à un seul modèle d'agir à la fois comme enseignant et élève, exploitant les critiques autonomes comme informations privilégiées pour minimiser la divergence entre les distributions de diffusion débruitées, ce qui se traduit par une amélioration des capacités de génération d'images sans supervision externe.

Français version →


🇮🇳 हिन्दी

UniEvo-VL स्व-पुनर्विण्य से बहुमौदिक मॉडल प्रदर्शन को बढ़ाता है

आधुनिक बहुमौदिक मॉडल प्रजनन और समझ को एकीकृत प्रणाली में एकीकृत करते हैं, जिससे उन्हें स्व-निर्मित प्रतिक्रिया के माध्यम से सीखने के लिए सक्षम होते हैं। हमें UniEvo-VL पेश किया गया है, एक स्व-विकासी ढांचा जो परीक्षा समय पर स्व-निर्वाद को प्राथमिक जानकारी के रूप में उपयोग करता है। एक अलग, अक्सर बड़े शिक्षक मॉडल पर निर्भर नहीं करता, बल्कि एक ही बहुमौदिक मॉडल विभिन्न संदर्भों के साथ शिक्षक और छात्र के रूप में कार्य करता है। छात्र केवल मूल प्रश्न देखता है, जबकि शिक्षक प्राथमिक निर्णय के साथ संदर्भित होता है। प्रशिक्षण का उद्देश्य उनके डिनॉइज़ डिफ्यूजन वितरणों के बीच छात्र के नमूदने के मार्गों पर उनके अवस्था-विशिष्ट विभाजन को न्यूनतम करना है। प्रयोगों में दिखाया गया है कि UniEvo-VL प्रतिबिंब सूचना के प्रति संवेदनशीलता को बनाए रखते हुए चित्र उत्पादन क्षमताओं को बढ़ाता है। खुले स्रोत Qwen-image-2512 के आधार पर, हमने Gen Eval पर 0.747 से 0.808 तक और Gen Eval2 Soft-TIFA पर 32.97 से 35.53 तक की प्रगति देखी। अधिक शक्तिशाली बाहरी आलोचकों, जैसे GPT5.6-Luna के साथ किए गए प्रयासों में दिखाया गया है कि बहुमौदिक मॉडल जो मजबूत न्यायक्षमता क्षमताओं रखते हैं, एक अधिक उच्च स्व-विकासी छत का अनुमान लगा सकते हैं। मिश्रित पाठ रेंडरिंग परिणामों का संकेत देता है कि स्व-सुधार कई अलग-अलग कार्यों मर्मत हो सकते हैं। यह अध्ययन बहुमौदिक मॉडल का उपयोग करते समय उपयोगकर्ता अनुभव को बेहतर बनाने के लिए किया गया है, बिना बाहरी निगरानcha या मार्गदर्शन के। यह वर्तमान में लोकप्रिय पुनरावृत्ति स्व-सुधार अध्ययन दिशा को प्रकाशित करता है।

UniEvo-VL क्या है और यह बहुमौदिक मॉडल को कैसे सुधारता है?

UniEvo-VL एक बहुमौदिक मॉडल के लिए एक स्व-विकासी ढांचा है जो परीक्षा समय पर निर्माणात्मक स्व-सुधार प्रतिक्रिया के माध्यम से सीखता है। यह एक ही मॉडल को शिक्षक और छात्र के रूप में काम करने की अनुमति देता है, स्व-निर्वाद को प्राथमिक जानकारी के रूप में उपयोग करते हुए डिनॉइज़ डिफ्यूजन वितरणों के बीच विभाजन को न्यूनतम करता है, जिससे बिना बाहरी निगरानcha के चित्र उत्पादन क्षमताओं में सुधार होता है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

UniEvo-VL Auto-Distilasi Meningkatkan Kinerja Model Multimodal

Model multimodal modern mengintegrasikan generasi dan pemahaman ke dalam satu sistem, memungkinkan mereka belajar dari umpan balik yang dihasilkan secara otomatis. Kami mempresentasikan UniEvo-VL, kerangka kerja evolusi diri yang memanfaatkan kritik diri sebagai informasi khusus selama komputasi waktu pengujian. Alih-alih mengandalkan model guru terpisah, yang sering kali lebih besar, satu model multimodal berfungsi sebagai guru dan siswa dengan konteks yang berbeda.

Siswa hanya melihat pertanyaan mentahnya, sementara guru mengkondisikan diri pada kritik yang diberi privilase. Pelatihan bertujuan untuk meminimalkan divergensi antara distribusi difusi denoise-nya pada trajektori sampling siswa. Eksperimen menunjukkan bahwa UniEvo-VL meningkatkan kemampuan pembuatan gambar sambil mempertahankan sensitivitas terhadap informasi refleksi.

Berdasarkan Qwen-image-2512 open source, kami mengamati peningkatan dari 0,747 ke 0,808 pada Gen Eval dan dari 32,97 ke 35,53 pada Gen Eval2 Soft-TIFA. Upaya dengan kritik eksternal yang lebih kuat, seperti GPT5.6-Luna, menunjukkan bahwa model multimodal dengan kemampuan penilai yang kuat dapat memproyeksikan plafod evolusi diri yang lebih tinggi. Hasil pencampuran penyajian teks menunjukkan bahwa perbaikan diri mungkin tidak seragam pada tugas yang berbeda.

Penelitian ini bertujuan untuk meningkatkan pengalaman pengguna saat menggunakan model multimodal tanpa pengawasan atau panduan eksternal, dan membuka lampu pada garis penelitian rekursif self-improvement yang sedang hangat di kalangan saat ini.

Bahasa Indonesia version →


🇯🇵 日本語

UniEvo-VL 自己蒸留がマルチモーダルモデルのパフォーマンスを向上

現代のマルチモーダルモデルは、生成と理解を統合したシステムとして機能し、自己生成されたフィードバックから学習することができます。私たちは、テスト時間のコンピューティング中に自己批判を特権情報として活用する自己進化フレームワークであるUniEvo-VLを提案します。単独の、しばしば大きい教師モデルに依存するのではなく、単一のマルチモーダルモデルが異なるコンテキストで教師と学生として機能します。学生は純粋な質問のみを確認し、教師は特権批判に基づいて条件付けられます。トレーニングは、学生のサンプリングトレジャリーにおける去ノイズ拡散分布の間の状態ごとの発散を最小化することを目指します。実験は、自己批判の感度を維持しながら画像生成能力を向上させることを示しています。オープンソースのQwen-image-2512に基づいて、Gen Evalで0.747から0.808へ、Gen Eval2 Soft-TIFAで32.97から35.53へのパフォーマンス向上を観察しました。より強力な外部クリティック、例えばGPT5.6-Lunaを使用した試みは、強力な審査能力を持つマルチモーダルモデルがより高い自己進化の天井を予測できることを示しています。テキストレンダリングの結果が混在していることは、自己改善が異なるタスク間で均一でない可能性があることを示唆しています。この研究は、外部の監視や指導なしでマルチモーダルモデルを使用する際のユーザーエクスペリエンスを向上させることを目的としており、現在熱烈に注目されている再帰的自己改善研究の方向性を明らかにしています。

UniEvo-VLとは何ですか?どのようにマルチモーダルモデルのパフォーマンスを向上させますか?

UniEvo-VLは、テスト時間のコンピューティング中に建設的な自己修正フィードバックから学習するマルチモーダルモデル向けの自己進化フレームワークです。単一のモデルが教師と学生として同時に機能し、自己批判を特権情報として活用することで、去ノイズ拡散分布間の発散を最小化し、外部監視なしで画像生成能力を向上させます。

日本語 version →


🇧🇷 Português

UniEvo-VL Auto-Distilação Melhora o Desempenho de Modelos Multimodais

Modelos multimodais modernos integram geração e compreensão em um sistema unificado, permitindo-lhes aprender a partir de feedback auto-generado. Apresentamos UniEvo-VL, um framework auto-evolutivo que explora críticas auto-generadas como informações privilegiadas durante a computação em tempo de teste. Em vez de depender de um modelo de professor separado, muitas vezes maior, um único modelo multimodal atua como professor e aluno com diferentes contextos.

O aluno apenas vê a pergunta original, enquanto o professor se condiciona à crítica privilegiada. O treinamento minimiza a divergência por estado entre suas distribuições de difusão denoisada ao longo das trajetórias de amostragem do aluno. Experimentos demonstram que UniEvo-VL melhora as capacidades de geração de imagens enquanto mantém a sensibilidade às informações de reflexão.

Baseado no Qwen-image-2512 de código aberto, observamos melhorias de 0,747 para 0,808 em Gen Eval e de 32,97 para 35,53 em Gen Eval2 Soft-TIFA. Tentativas com críticos externos mais poderosos, como GPT5.6-Luna, mostram que modelos multimodais com fortes capacidades de juiz podem antecipar um teto de auto-evolução mais elevado. Resultados mistos de renderização de texto indicam que melhorias auto-generadas podem não ser uniformes em diferentes tarefas.

O estudo busca melhorar a experiência do usuário ao utilizar modelos multimodais sem supervisão ou orientação externa, e ilumina a linha de pesquisa atual de auto-melhoria recursiva.

O que é UniEvo-VL e como ele melhora os modelos multimodais?

UniEvo-VL é um framework auto-evolutivo para modelos multimodais que aprende com feedback de auto-correção construtiva durante a computação em tempo de teste. Ele permite que um único modelo atue como professor e aluno, explorando críticas auto-generadas como informações privilegiadas para minimizar a divergência entre distribuições de difusão denoisada, resultando em melhorias capacidades de geração de imagens sem supervisão externa.

Português version →


🇷🇺 Русский

UniEvo-VL Самодистилляция повышает производительность мультимодальных моделей

Современные мультимодальные модели объединяют генерацию и понимание в единой системе, позволяя учиться на основе автоматически сгенерированной обратной связи. Мы представляем UniEvo-VL — каркас самовозвращающихся моделей, который использует самокритику в качестве привилегированной информации во время вычислений во время тестирования. Вместо того чтобы полагаться на отдельную, часто более крупную учебную модель, одна мультимодальная модель одновременно выступает в роли учителя и ученика с разными контекстами. Ученик видит только исходный вопрос, тогда как учитель опирается на привилегированную критику. Обучение минимизирует расхождение по состояниям между их распределениями денойзинг-диффузии вдоль траекторий выборки ученика. Эксперименты показывают, что UniEvo-VL повышает способности генерации изображений, сохраняя чувствительность к информации об отражении. На основе открытого исходного кода Qwen-image-2512 мы наблюдаем прирост от 0,747 до 0,808 в Gen Eval и от 32,97 до 35,53 в Gen Eval2 Soft-TIFA. Попытки использовать более мощные внешние критики, такие как GPT5.6-Luna, демонстрируют, что мультимодальные модели с сильными способностями судьи могут прогнозировать более высокий предел самовозвращения. Смешанные результаты рендеринга текста указывают на то, что самосовершенствование может не быть однородным в разных задачах. Исследование направлено на повышение пользовательского опыта при использовании мультимодальных моделей без внешнего надзора или руководства. Оно освещает текущую популярную направленность исследований в области рекурсивного самосовершенствования.

Что такое UniEvo-VL и как он повышает производительность мультимодальных моделей?

UniEvo-VL — это каркас самовозвращающихся моделей мультимодальных данных, который обучается на основе конструктивной самокритики во время вычислений во время тестирования. Он позволяет одной модели одновременно выступать в роли учителя и ученика, используя самокритику в качестве привилегированной информации для минимизации расхождения между распределениями денойзинг-диффузии, что приводит к повышению способностей генерации изображений без внешнего надзора.

Русский version →


🇨🇳 简体中文

UniEvo-VL 自蒸馏提升多模态模型性能

现代多模态模型将生成与理解集成到统一的系统中,使其能够从自生成的反馈中学习。我们提出了UniEvo-VL,这是一种自演化框架,利用自我批评作为测试计算期间的特权信息。它不依赖于单独的、通常更大的教师模型,而是由单个多模态模型同时充当教师和学生,分别使用不同的上下文。学生仅看到原始问题,而教师则以特权批评为条件进行建模。训练目标是最小化其在学生采样轨迹上的去噪扩散分布与学生状态之间的差异。实验表明,UniEvo-VL在保持对反思信息敏感性的同时,提升了图像生成能力。在开源Qwen-image-2512的基础上,我们在Gen Eval上将性能从0.747提升到0.808,在Gen Eval2 Soft-TIFA上从32.97提升到35.53。尝试使用更强大的外部批评者(如GPT5.6-Luna)表明,具备强大判别能力的多模态模型可以预见更高的自演化上限。混合的文本渲染结果表明,自我改进可能不会在不同任务上均匀。该研究旨在增强用户在使用多模态模型时无需外部监督或指导的体验,并为当前热门的递归自我改进研究方向提供了启示。

UniEvo-VL是什么及其如何改善多模态模型?

UniEvo-VL是一种针对多模态模型的自演化框架,通过测试计算期间从建设性自校正反馈中学习。它使单个模型同时充当教师和学生,利用自我批评作为特权信息,以最小化去噪扩散分布之间的差异,从而在无外部监督的情况下提升图像生成能力。

简体中文 version →