tehno24.ru
← ИИ
ИИ19 сентября 2026, 16:18

Бенчмарк: только флагманские LLM едва обходят писателей-любителей

Vulsar AI опубликовала бенчмарк Creative Writing на 475 промптах, сравнив 24 LLM с людьми. GPT 6 Astra лидирует с 87,8% прогнозируемых побед против 86,6% у писателей-любителей, но профессионалы всё ещё заметно выше. Малые модели проваливаются: Qwen3.8-27B — 23,2%, DeepSeek V4.1 Flash — 19,8%, Gemma 4 26B — 10,9%.

Бенчмарк: только флагманские LLM едва обходят писателей-любителей
#OpenAI#Anthropic#GPT-6#Claude
Читать дальше
ИИ

AWS показала миграцию мультимодельного ИИ-агента с ECS на Bedrock AgentCore

ИИ

Лаборатории ИИ приближаются к рекурсивному самоулучшению моделей

ИИ

Alibaba DAMO открыла исходный код ИИ-модели для КТ брюшной полости DAMO RADAR

ИИ

SenseTime выпустила SenseNova U1.5 — нативную мультимодальную модель на 8 млрд параметров