Sakana AI: система рецензирования ловит 73% ошибок в ключевых утверждениях
Sakana AI опубликовала работу Beyond Imitation о системе Multi-Layered Review для ИИ-рецензирования научных статей. На бенчмарке из 1164 подменённых утверждений в 257 статьях MLR поймала 73,43% ошибок в ключевых утверждениях против 14,81% у лучшего базового метода. Стоимость — около $0,47 за рецензию на моделях Claude Sonnet 4 и Haiku 3.5 без дообучения.
- MLR поймала 73,43% ошибок в ключевых утверждениях при 4 рецензиях
- Лучший базовый метод AgentReview — лишь 14,81%
- Бенчмарк: 1164 противоречия в 257 статьях с 5 конференций
- Стоимость рецензии — около $0,47, без GPU и дообучения
Читать дальше
ИИ