Аудит 162 разрывов в ИИ-бенчмарках: только 20 подтверждаются данными
Анализ шести анонсов фронтир-моделей и девяти публичных лидербордов показал: из 162 сравнений моделей лишь 20 статистически подтверждаются опубликованными данными. В 483 из 617 строк аудита невозможно честно рассчитать интервал неопределённости.
- Из 44 разрывов в анонсах моделей только 11 подтверждаются данными, 28 проверить нельзя
- Из 118 пар на лидербордах разделяются лишь 9
- В 483 из 617 строк аудита нет данных для расчёта интервала с учётом повторов
- Разрыв 6,4 п.п. на SWE-bench Multilingual не подтверждает превосходство: интервал включает ноль
Читать дальше
ИИ