Martian запустила открытый бенчмарк Code Review Bench для ИИ-ревьюеров кода
ИИ-лаборатория Martian представила Code Review Bench — открытый бенчмарк для инструментов ИИ-ревью кода. На 16 017 реальных pull request'ах GitHub лидирует Cubic Dev AI с F1 65,7%, у GitHub Copilot 63,9%, Claude 62,5%, CodeRabbit 60,8%, CodeAnt AI 50,0%. Методика и код опубликованы под лицензией MIT.
- Бенчмарк оценил 14 инструментов на 16 017 pull request'ах GitHub
- Лидер по F1 — Cubic Dev AI: 65,7% при precision 72,9 и recall 59,8
- Greptile дал лучшую precision 80,3%, но худший recall 50,4%
- Код и методика открыты на GitHub под лицензией MIT
Читать дальше
ИИ