Los modelos multimodales modernos integran la generación y comprensión en un sistema unificado, lo que le permite aprender a partir de retroalimentación auto-generada. Introducimos UniEvo-VL, un marco de auto-evolución que aprovecha las autocríticas como información privilegiada durante el cómputo en tiempo de prueba. En lugar de confiar en un modelo docente separado, a menudo más grande, un solo modelo multimodal actúa como docente y estudiante con diferentes contextos.
El estudiante solo ve la pregunta original, mientras que el docente se condiciona a la crítica privilegiada. El entrenamiento minimiza la divergencia por estado entre sus distribuciones de difusión denoizada a lo largo de las trayectorias de muestreo del estudiante. Los experimentos demuestran que UniEvo-VL mejora las capacidades de generación de imágenes mientras mantiene la sensibilidad a la información de reflexión.
Basándose en Qwen-image-2512 de código abierto, observamos mejoras del 0.747 a 0.808 en Gen Eval y de 32.97 a 35.53 en Gen Eval2 Soft-TIFA. Los intentos con críticos externos más poderosos, como GPT5.6-Luna, muestran que los modelos multimodales con capacidades de juez fuertes pueden anticipar un techo de auto-evolución más alto. Los resultados mixtos de renderizado de texto indican que las mejoras autogeneradas pueden no ser uniformes en diferentes tareas.
El estudio busca mejorar la experiencia del usuario al utilizar modelos multimodales sin supervisión o guía externa, y aporta claridad a la línea de investigación actual de auto-mejora recursiva.
Fuente: Hacker News · Resumido por HeadlinesBriefing