tehno24.ru
← ИИ
ИИ6 октября 2026, 21:15

Бенчмарк: LLM ошибаются в хешах испанской системы VeriFactu

Разработчик провёл бенчмарк девяти LLM на задачах испанской системы VeriFactu, где каждая запись счёта содержит SHA-256-отпечаток Huella, связанный с предыдущей записью. Семь из девяти моделей построили корректный текст хеша для всех 27 записей, но Claude Haiku 4.5 без инструмента ни разу не ответила UNKNOWN и выдумала отпечаток в 21 случае из 27.

Бенчмарк: LLM ошибаются в хешах испанской системы VeriFactu
#Anthropic#Google#OpenAI#Gemma
Читать дальше
ИИ

Бенчмарк: лучшие LLM знают лишь 24% фактов после даты обучения

ИИ

Бенчмарк: флагманские LLM чаще уступают давлению пользователя

ИИ

Бенчмарк: только флагманские LLM едва обходят писателей-любителей

ИИ

Препринт нашёл «ось боли» в 25 открытых LLM, но Claude в тестах не участвовал