ИИ-чат-боты ошибаются в 57% финансовых вопросов
Saturn протестировала 18 популярных ИИ-инструментов, включая ChatGPT, Gemini, Claude и Copilot: средняя точность ответов на финансовые вопросы составила 43%, а на сложные многошаговые сценарии упала до 12%. Лучший результат показал платный Claude Opus 5 (reasoning) с 61% верных ответов, худший — бесплатный Claude Haiku 4.5 с 82% ошибок.
- Средняя точность 17 моделей — 43%, ошибки в 57% случаев
- На сложных сценариях точность падает до 12%
- Бесплатные модели ошибаются в 63% случаев, платные — в 49%
- Лучший результат — Claude Opus 5 (reasoning) с 61% верных ответов
Читать дальше
ИИ