Бенчмарк: LLM ошибаются в хешах испанской системы VeriFactu
Разработчик провёл бенчмарк девяти LLM на задачах испанской системы VeriFactu, где каждая запись счёта содержит SHA-256-отпечаток Huella, связанный с предыдущей записью. Семь из девяти моделей построили корректный текст хеша для всех 27 записей, но Claude Haiku 4.5 без инструмента ни разу не ответила UNKNOWN и выдумала отпечаток в 21 случае из 27.
- Gemma 4 31B прошла все четыре задачи на 100% за $0,14 — в 20 раз дешевле Gemini 3.1 Pro
- Claude Haiku 4.5 без инструмента выдумала хеш в 21 из 27 записей вместо ответа UNKNOWN
- GPT-5.4 nano ошиблась в 4 из 27 текстов хеша, в основном из-за полей предыдущей записи
- С sha256_hex-инструментом ни одна модель не выдумала хеш, но nano хешировала неверный текст
Читать дальше
ИИ