Дайджест по пост-тренировке LLM: GRPO применили к OCR, DPO и GRPO улучшили
Опубликован дайджест исследований по пост-тренировке LLM за 2–9 октября 2026 года. Среди ключевых работ: LightOnOCR-3 применила GRPO к OCR-пайплайну (86,3 на olmOCR-Bench), DIAL-OPD показала, что обучение на 40% токенов превосходит полный набор, а Falcon OCR Arabic на 270M параметров заняла 2-е место из 17.
- LightOnOCR-3 применила GRPO к OCR: 86,3 на olmOCR-Bench, лидер в тирах 4B/0.8B
- DIAL-OPD: обучение на 40% токенов даёт до +5,25 п.п. на математике
- Falcon OCR Arabic на 270M параметров заняла 2-е место из 17 через SFT+RL
- SGUID отбирает банк навыков до 11 раз меньше без потери качества дистилляции
Читать дальше
ИИ