Бенчмарк: DeepSeek-R1 пропустил утечку данных в ML-пайплайне
Разработчик представил на Kaggle бенчмарк The Silent Killer, который проверяет, находят ли LLM методологические ошибки в ML-пайплайнах. Gemini 3.7 Flash, Claude Sonnet 4.5 и Grok 4.20 Reasoning выявили все три ошибки, а DeepSeek-R1 пропустил утечку данных и набрал 67%.
- Бенчмарк проверяет утечку данных, неверную метрику и целевую утечку
- Gemini 3.7 Flash, Claude Sonnet 4.5 и Grok 4.20 набрали 100%
- DeepSeek-R1 пропустил утечку данных и набрал 67%
- Оценка идёт по динамической рубрике с запретом на неверный диагноз
Читать дальше
ИИ