tehno24.ru
← ИИ
ИИ6 октября 2026, 21:31

Бенчмарк проверил, выдумывают ли LLM статьи японских законов

Разработчик проверил цитаты статей японских законов от трёх локальных LLM (1,8–8 млрд параметров) по официальному реестру e-Gov из 6913 статей. Модель llm-jp-3-1.8b выдумала 4,57% статей в японских ответах против 1,09% в английских, Qwen2.5-7B — 1,17% против 0%, Swallow-8B — 0% в обоих языках.

Бенчмарк проверил, выдумывают ли LLM статьи японских законов
#Qwen#Swallow#Llm-jp
Читать дальше
ИИ

Бенчмарк: Gemini чаще всех ИИ-ботов выдумывает товары и цены

ИИ

Бенчмарк Governed Agent Reliability проверил шесть ИИ-моделей на «отказные» сценарии

ИИ

Открытый бенчмарк проверит, могут ли ИИ-агенты проектировать роботов

Регулирование

Массачусетс проверит использование ИИ букмекерами после статьи NYT