Бенчмарк Blog vs Bytecode: ИИ находит ошибки в коде, но перестраховывается на чистом коде
Автор опубликовал на Kaggle бенчмарк из 28 фрагментов кода с блогерскими утверждениями: половина содержит реальные ошибки (утечка данных, перемешанная кросс-валидация). Сильные модели почти идеально ловят ошибки, но ошибочно помечают корректный код как проблемный, а Gemma 4 31B наоборот доверяет тексту и пропускает 80% ошибок.
- Бенчмарк из 28 задач: 15 с ошибками и 13 корректных, баланс ловит модель, всегда отвечающую PROBLEM
- Gemini 3.1 Pro, Grok 4.20 с reasoning и DeepSeek-R1 показали 100% точности
- Claude Sonnet 5 и Gemini 3.8 Flash — 96%, оба ошиблись, пометив чистый код как проблему
- Gemma 4 31B: 85% на чистом коде, но лишь 20% на скрытых ошибках
Читать дальше
ИИ