Бенчмарк креативного письма: топовые ИИ-модели догнали любителей, но уступают профи
Бенчмарк на 475 длинных промптов сравнил 24 LLM с людьми: GPT 6 Astra показал прогнозируемую долю побед 87,8% против 86,6% у объединённой группы людей, но профессиональные писатели заметно выше при отдельном подсчёте. Оценка основана на reward-модели предпочтений, а не на объективном качестве текста.
- GPT 6 Astra — 87,8% прогнозируемых побед, чуть выше 86,6% у людей в целом
- GPT 5.6 Sol — 77,6%, Claude Fable 5.1 — 70,3%, Claude Opus 5, Kimi K3 и Grok 4.6 — 50–65%
- Люди писали в среднем 2592 токена, Claude Fable 5.1 — 2114, GPT 6 Astra — 1537
- Малые модели теряют связность и повторяются на длинных промптах
Читать дальше
ИИ