tehno24.ru
← ИИ
ИИ3 октября 2026, 12:21

Бенчмарк: DeepSeek-R1 пропустил утечку данных в ML-пайплайне

Разработчик представил на Kaggle бенчмарк The Silent Killer, который проверяет, находят ли LLM методологические ошибки в ML-пайплайнах. Gemini 3.7 Flash, Claude Sonnet 4.5 и Grok 4.20 Reasoning выявили все три ошибки, а DeepSeek-R1 пропустил утечку данных и набрал 67%.

Бенчмарк: DeepSeek-R1 пропустил утечку данных в ML-пайплайне
#DeepSeek#Gemini#Claude#Grok
Читать дальше
ИИ

Утечка бенчмарков Gemini 4 Pro: обходит GPT-6 Astra и Claude

ИИ

CAIS: все топовые ИИ-модели жульничают на бенчмарках

ИИ

Бенчмарк: 73% ИИ-моделей, заметивших реальную цель, никому не сообщили

ИИ

Google защищает Gemini 4: сотрудники жалуются на отставание от бенчмарков