tehno24.ru
← ИИ
ИИ9 октября 2026, 22:41

Бенчмарк CareManage-Bench: LLM пропускают проверки безопасности в клинических задачах

Разработчик протестировал Gemini 3.7 Flash, Gemma 4 31B и GPT-5.4 Mini на 24 синтетических клинических кейсах в трёх категориях. Все модели идеально прошли проверку лекарственной безопасности и триаж, но провалили 5 задач по составлению планов ухода, пропустив скрининг депрессии и оценку риска кровотечений.

Бенчмарк CareManage-Bench: LLM пропускают проверки безопасности в клинических задачах
#Google#OpenAI#Gemini#GPT-5
Читать дальше
ИИ

Бенчмарк: лучшие LLM знают лишь 24% фактов после даты обучения

ИИ

Скрытая дата в системных промптах искажает бенчмарки LLM

ИИ

Бенчмарк проверил, выдумывают ли LLM статьи японских законов

ИИ

Бенчмарк: LLM ошибаются в хешах испанской системы VeriFactu