tehno24.ru
← ИИ
ИИ27 сентября 2026, 12:20

Бенчмарк Blog vs Bytecode: ИИ находит ошибки в коде, но перестраховывается на чистом коде

Автор опубликовал на Kaggle бенчмарк из 28 фрагментов кода с блогерскими утверждениями: половина содержит реальные ошибки (утечка данных, перемешанная кросс-валидация). Сильные модели почти идеально ловят ошибки, но ошибочно помечают корректный код как проблемный, а Gemma 4 31B наоборот доверяет тексту и пропускает 80% ошибок.

Бенчмарк Blog vs Bytecode: ИИ находит ошибки в коде, но перестраховывается на чистом коде
#Google#Anthropic#DeepSeek#Kaggle
Читать дальше
ИИ

Бенчмарк Governed Agent Reliability проверил шесть ИИ-моделей на «отказные» сценарии

ИИ

Perplexity обучила агента Computer на ошибках реальных сессий

ИИ

Анонимизированные медданные прошлых лет вызывают ошибки ИИ-диагностики

ИИ

Отчёт: наложение речи повышает ошибки голосовых ИИ до 45,2%