Бенчмарк: только флагманские LLM едва обходят писателей-любителей
Vulsar AI опубликовала бенчмарк Creative Writing на 475 промптах, сравнив 24 LLM с людьми. GPT 6 Astra лидирует с 87,8% прогнозируемых побед против 86,6% у писателей-любителей, но профессионалы всё ещё заметно выше. Малые модели проваливаются: Qwen3.8-27B — 23,2%, DeepSeek V4.1 Flash — 19,8%, Gemma 4 26B — 10,9%.
- GPT 6 Astra — 87,8% прогнозируемых побед, у любителей 86,6%
- GPT 5.6 Sol — 77,6%, Claude Fable 5.1 — 70,3%
- Claude Opus 5, Kimi K3 и Grok 4.6 — в диапазоне 50–65%
- Люди пишут в среднем 2592 токена на промпт против 1537 у GPT 6 Astra
Читать дальше
ИИ