Бенчмарк: лучшие LLM знают лишь 24% фактов после даты обучения
Разработчик опубликовал бенчмарк из 150 вопросов о событиях 2025–2026 годов, построенных на веб-индексе в 7,2 млн страниц. Лучший результат показала Gemini 3.7 Flash — 24% верных ответов, DeepSeek-R1 — 20%, GPT-5.4 — 11,3%; контрольная модель с отсечкой 2024 года набрала 0/150.
- Gemini 3.7 Flash лидирует с 24% верных ответов из 150 вопросов
- DeepSeek-R1 — 20%, GPT-5.4 — 11,3%, Gemini 2.5 Pro — 16%
- Контрольная 3B-модель с отсечкой 2024 года набрала 0/150
- Доверительный интервал Уилсона ±8 пунктов, ранжирование ненадёжно
Читать дальше
Безопасность