Les modèles multimodaux modernes intègrent la génération et la compréhension dans un système unifié, leur permettant d'apprendre à partir de rétroactions générées automatiquement. Nous présentons UniEvo-VL, un cadre auto-évolutif qui exploite les critiques autonomes comme informations privilégiées lors du calcul lors des tests. Au lieu de s'appuyer sur un modèle enseignant séparé, souvent plus important, un seul modèle multimodal agit à la fois comme enseignant et élève avec des contextes différents.
L'élève ne voit que la question d'origine, tandis que l'enseignant se base sur la critique privilégiée. L'entraînement vise à minimiser la divergence par état entre leurs distributions de diffusion débruitées sur les trajectoires d'échantillonnage de l'élève. Les expériences démontrent qu'UniEvo-VL améliore les capacités de génération d'images tout en maintenant la sensibilité aux informations de réflexion.
S'appuyant sur Qwen-image-2512 en code source ouvert, nous observons des gains de 0,747 à 0,808 sur Gen Eval et de 32,97 à 35,53 sur Gen Eval2 Soft-TIFA. Des tentatives avec des critiques externes plus puissants, tels que GPT5.6-Luna, montrent que les modèles multimodaux dotés de capacités de juge fortes peuvent anticiper un plafond d'amélioration autonome plus élevé. Les résultats mixtes de rendu textuel indiquent que les améliorations autonomes peuvent ne pas être uniformes dans différentes tâches.
Cette étude vise à améliorer l'expérience utilisateur lors de l'utilisation de modèles multimodaux sans supervision ou guidance externe, et éclaire la voie de la recherche actuelle sur l'amélioration autonome récursive.
Source: Hacker News · Résumé par HeadlinesBriefing