HeadlinesBriefing HeadlinesBriefing.com

UniEvo-VL Auto-Distilação Melhora Modelos Multimodais

Hacker News •
×

Modelos multimodais modernos integram geração e compreensão em um sistema unificado, permitindo-lhes aprender a partir de feedback auto-generado. Apresentamos UniEvo-VL, um framework auto-evolutivo que explora críticas auto-generadas como informações privilegiadas durante a computação em tempo de teste. Em vez de depender de um modelo de professor separado, muitas vezes maior, um único modelo multimodal atua como professor e aluno com diferentes contextos.

O aluno apenas vê a pergunta original, enquanto o professor se condiciona à crítica privilegiada. O treinamento minimiza a divergência por estado entre suas distribuições de difusão denoisada ao longo das trajetórias de amostragem do aluno. Experimentos demonstram que UniEvo-VL melhora as capacidades de geração de imagens enquanto mantém a sensibilidade às informações de reflexão.

Baseado no Qwen-image-2512 de código aberto, observamos melhorias de 0,747 para 0,808 em Gen Eval e de 32,97 para 35,53 em Gen Eval2 Soft-TIFA. Tentativas com críticos externos mais poderosos, como GPT5.6-Luna, mostram que modelos multimodais com fortes capacidades de juiz podem antecipar um teto de auto-evolução mais elevado. Resultados mistos de renderização de texto indicam que melhorias auto-generadas podem não ser uniformes em diferentes tarefas.

O estudo busca melhorar a experiência do usuário ao utilizar modelos multimodais sem supervisão ou orientação externa, e ilumina a linha de pesquisa atual de auto-melhoria recursiva.

Fonte: Hacker News · Resumido por HeadlinesBriefing