JetBrains выпустила бенчмарк Kotlin для ИИ-агентов: разброс токенов 12x
JetBrains представила Kotlin Benchmark — официальный бенчмарк для оценки ИИ-агентов на реальных задачах в открытых Kotlin-репозиториях. Лидирует Claude Code с Opus 4.7 xhigh (85,7%), но расход токенов на решённую задачу различается до 12 раз — от 66 тыс. до 777 тыс.
- 105 задач из активных open-source Kotlin-репозиториев, проверка патчей тестами репозитория
- Claude Code + Opus 4.7 xhigh: 90 задач, 10,59 млн токенов, 118 тыс. на задачу
- Claude Code + Opus 4.7 medium: 80 задач при 66 тыс. токенов на задачу — вдвое дешевле лидера
- Gemini CLI + Gemini 3 Flash: 47 задач и 777 тыс. токенов на задачу — худший результат
Читать дальше
ИИ