AREX-2: самоулучшающиеся LLM-агенты через длинную рефлексию
Представлена AREX-2 — агентная модель на базе Qwen3.8-27B, обученная на верифицируемых траекториях самоулучшения в ML-инжиниринге и программировании. На MLE-bench Lite она набрала 81,8 балла, на GAIA — 92,2, на DeepSearchQA — 93,8, сохраняя рост качества до 30 раундов доработки.
- Модель на базе Qwen3.8-27B обучена на синтезированных траекториях с проверяемой обратной связью
- MLE-bench Lite — 81,8 балла, GAIA — 92,2, DeepSearchQA — 93,8
- Рост точности сохраняется до 30 раундов рефлексии, тогда как у GPT-4o плато наступает после 5–10
- Цикл Reflective-Self-Correction сжимает контекст, снижая загрязнение истории ошибками
Читать дальше
ИИ