Real-SWE: Fable 5.1 обошла GPT-6 Astra и Gemini 3.8 Flash в кодинге
Бенчмарк Real-SWE от Specific Labs оценил 8 связок моделей и CLI на приватном корпоративном коде: Fable 5.1 в Claude Code решила 38,8% задач при $6,96 за прогон, GPT-6 Astra в Codex CLI — 33,8% ($4,67), Gemini 3.8 Flash в Gemini CLI — 31,2% ($2,50). Шесть из десяти задач решаются менее чем в 15% случаев, а одна не решена никем.
- Fable 5.1 в Claude Code: 38,8% решённых задач, $6,96 за прогон
- GPT-6 Astra в Codex CLI: 33,8% при $4,67, Gemini 3.8 Flash: 31,2% при $2,50
- 6 из 10 задач решаются менее чем в 15% случаев, одна не решена никем
- Основная причина провалов — пропущенные требования, а не ошибки синтаксиса
Читать дальше
ИИ