Современные мультимодальные модели объединяют генерацию и понимание в единой системе, позволяя учиться на основе автоматически сгенерированной обратной связи. Мы представляем UniEvo-VL — каркас самовозвращающихся моделей, который использует самокритику в качестве привилегированной информации во время вычислений во время тестирования. Вместо того чтобы полагаться на отдельную, часто более крупную учебную модель, одна мультимодальная модель одновременно выступает в роли учителя и ученика с разными контекстами. Ученик видит только исходный вопрос, тогда как учитель опирается на привилегированную критику. Обучение минимизирует расхождение по состояниям между их распределениями денойзинг-диффузии вдоль траекторий выборки ученика. Эксперименты показывают, что UniEvo-VL повышает способности генерации изображений, сохраняя чувствительность к информации об отражении. На основе открытого исходного кода Qwen-image-2512 мы наблюдаем прирост от 0,747 до 0,808 в Gen Eval и от 32,97 до 35,53 в Gen Eval2 Soft-TIFA. Попытки использовать более мощные внешние критики, такие как GPT5.6-Luna, демонстрируют, что мультимодальные модели с сильными способностями судьи могут прогнозировать более высокий предел самовозвращения. Смешанные результаты рендеринга текста указывают на то, что самосовершенствование может не быть однородным в разных задачах. Исследование направлено на повышение пользовательского опыта при использовании мультимодальных моделей без внешнего надзора или руководства. Оно освещает текущую популярную направленность исследований в области рекурсивного самосовершенствования.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing