Test-time training ломается, когда ИИ-агенты учатся на своих же выводах
Исследование KAUST (arXiv:2610.05076) показало: если ИИ-агент обновляет веса на собственных токенах, обучение коллапсирует. На 760M TTT-E2E потеря выросла на 6,00 нат, а успех в ALFWorld упал с 86,8% до 27,6%. Авторы предложили протокол Settlement с буфером обновлений.
- На 125M TTT-E2E самообучение добавило 3,01 ната потерь, на 760M — 6,00 ната
- В ALFWorld успех упал с 86,8% до 27,6% при масштабе обновления 8
- В WebShop точность упала с 16,0% до 10,5% на пяти сидах
- Протокол Settlement снизил разрыв до 0,07 ната на 125M и -0,02 на 760M
Читать дальше
ИИ