GitHub представила ReviewBench для оценки ИИ-ревьюеров кода
GitHub запустила ReviewBench — бенчмарк в режиме research preview, который измеряет, насколько хорошо ИИ-инструменты ревью кода находят проблемы до релиза. Тесты идут на 219 pull request из 187 открытых репозиториев на 19 языках программирования, лидерборд учитывает серьёзность и категорию проблем.
- Бенчмарк использует 219 pull request из 187 публичных репозиториев на 19 языках
- Шесть метрик: precision, recall и F1 в обычной и расширенной версиях
- Тестовый набор из 25 PR доступен до полного прогона на 219 PR
- В тесте Copilot lite ансамбль моделей дал рост recall на 13,6% и снижение цены ревью на 8%
Читать дальше
ИИ