UniEvo-VL: самообучение мультимодальной модели на собственных критиках
Опубликован метод UniEvo-VL, который превращает критику сгенерированных изображений в обучающий сигнал через on-policy self-distillation: студент учится повторять поведение EMA-учителя с расширенным промптом, видя только исходный запрос. На базе Qwen-Image-2512 GenEval вырос с 0,747 до 0,808, GenEval2 Soft-TIFA — с 32,97 до 35,53.
- GenEval вырос с 0,747 до 0,808, GenEval2 Soft-TIFA — с 32,97 до 35,53
- Метод построен на Qwen-Image-2512 и Qwen-VL-пайплайне обратной связи
- EMA-учитель с decay 0,999 получает промпт с критикой, студент — только исходный
- Без верификации OCR падает с 0,771 до 0,761
Читать дальше
ИИ