Тест 330 ИИ-моделей на корейском: половина ответила не тем алфавитом
Разработчики оценили 330 языковых моделей по семи осям владения корейским. Простая проверка на долю хангыля автоматически отбраковала 33,2% ответов, а 51,8% моделей хотя бы раз ответили не на корейском. Лучший средний балл у Anthropic (2,29 из 3), у OpenAI — 1,96.
- Автопроверка отбраковала 766 из 2304 ответов (33,2%) из-за примеси китайских или японских знаков
- 171 из 330 моделей (51,8%) хотя бы раз провалили проверку, 54 модели — все семь заданий
- Хуже всего модели справляются с гонорификой (8,5% оценок A) и знанием корейских институтов (9,4%)
- Средний балл Anthropic — 2,29, Mistral — 2,07, OpenAI — 1,96, Google и Qwen — по 1,48
Читать дальше
ИИ