tehno24.ru
← ИИ
ИИ30 сентября 2026, 02:39

Бенчмарк: Gemini 2.5 Flash провалил проверку на ложные посылки

Разработчик создал бенчмарк false-premise resistance из 10 вопросов с заведомо ложными посылками и протестировал 7 моделей. Gemini 2.5 Flash ошибся на гипотетической формулировке про Эверест в Японии, тогда как Claude, GPT 5.4, DeepSeek-R1 и Grok 4.20 Reasoning дали 100%.

Бенчмарк: Gemini 2.5 Flash провалил проверку на ложные посылки
#Google#Gemini#OpenAI#Anthropic
Читать дальше
ИИ

Epoch AI создала бенчмарк по сборке мебели IKEA для проверки ИИ

ИИ

Google выпустила Gemini 3.8 Flash и Flash Cyber, Meta ответила Muse Spark 1.3

ИИ

Real-SWE: Fable 5.1 обошла GPT-6 Astra и Gemini 3.8 Flash в кодинге

ИИ

Бенчмарк: Gemini чаще всех ИИ-ботов выдумывает товары и цены