Бенчмарк проверил, выдумывают ли LLM статьи японских законов
Разработчик проверил цитаты статей японских законов от трёх локальных LLM (1,8–8 млрд параметров) по официальному реестру e-Gov из 6913 статей. Модель llm-jp-3-1.8b выдумала 4,57% статей в японских ответах против 1,09% в английских, Qwen2.5-7B — 1,17% против 0%, Swallow-8B — 0% в обоих языках.
- llm-jp-3-1.8b: 63 из 1379 выдуманных цитат на японском, 7 из 642 на английском
- Qwen2.5-7B: 7 из 597 на японском, 0 из 567 на английском
- Swallow-8B не выдумал ни одной статьи ни в одном языке
- Реестр e-Gov включает 6913 статей, включая удалённые заглушки
Читать дальше
ИИ