Perplexity обучила агента Computer на ошибках реальных сессий
Perplexity Research опубликовала метод постобучения агента внутри Perplexity Computer: отбор успешных сессий сочетается с подсказками-исправлениями через самодистилляцию. В живом A/B-тесте доля сбоев вызовов инструментов упала с 2,24% до 1,77% — на 21,2% относительно. Веса и код обучения не опубликованы, базовая модель GLM 5.2 открыта на Hugging Face.
- Сбои вызовов инструментов в A/B-тесте: 2,24% против 1,77%, снижение на 21,2%
- Метод сочетает RFT с подсказками и самодистилляцией (CE + KL-лосс)
- Ошибки с валидной подсказкой получают KL-лосс, остальные ходы — без лосса
- Веса и код не открыты, модель доступна только внутри Perplexity Computer
Читать дальше
ИИ