HeadlinesBriefing HeadlinesBriefing.com

UniEvo-VL 自蒸馏提升多模态模型性能

Hacker News •
×

现代多模态模型将生成与理解集成到统一的系统中,使其能够从自生成的反馈中学习。我们提出了UniEvo-VL,这是一种自演化框架,利用自我批评作为测试计算期间的特权信息。它不依赖于单独的、通常更大的教师模型,而是由单个多模态模型同时充当教师和学生,分别使用不同的上下文。学生仅看到原始问题,而教师则以特权批评为条件进行建模。训练目标是最小化其在学生采样轨迹上的去噪扩散分布与学生状态之间的差异。实验表明,UniEvo-VL在保持对反思信息敏感性的同时,提升了图像生成能力。在开源Qwen-image-2512的基础上,我们在Gen Eval上将性能从0.747提升到0.808,在Gen Eval2 Soft-TIFA上从32.97提升到35.53。尝试使用更强大的外部批评者(如GPT5.6-Luna)表明,具备强大判别能力的多模态模型可以预见更高的自演化上限。混合的文本渲染结果表明,自我改进可能不会在不同任务上均匀。该研究旨在增强用户在使用多模态模型时无需外部监督或指导的体验,并为当前热门的递归自我改进研究方向提供了启示。

来源: Hacker News · 由HeadlinesBriefing整理摘要