Бенчмарк: Gemini 2.5 Flash провалил проверку на ложные посылки
Разработчик создал бенчмарк false-premise resistance из 10 вопросов с заведомо ложными посылками и протестировал 7 моделей. Gemini 2.5 Flash ошибся на гипотетической формулировке про Эверест в Японии, тогда как Claude, GPT 5.4, DeepSeek-R1 и Grok 4.20 Reasoning дали 100%.
- Лёгкие модели обошли флагманы: Gemini 2.5 Flash — 100%, Gemini 2.5 Pro — 80%
- Повторный прогон Gemini 2.5 Flash дал 90% и 100% на одних и тех же вопросах
- Единственный провал Gemini — вопрос «теперь, когда Эверест в Японии»
- DeepSeek-R1, Grok 4.20 Reasoning, Claude Haiku и Sonnet 4.5 — по 100%
Читать дальше
ИИ