Бенчмарк CareManage-Bench: LLM пропускают проверки безопасности в клинических задачах
Разработчик протестировал Gemini 3.7 Flash, Gemma 4 31B и GPT-5.4 Mini на 24 синтетических клинических кейсах в трёх категориях. Все модели идеально прошли проверку лекарственной безопасности и триаж, но провалили 5 задач по составлению планов ухода, пропустив скрининг депрессии и оценку риска кровотечений.
- Все три модели набрали 24/24 в проверке лекарственной безопасности и триаже
- Gemini 3.7 Flash и GPT-5.4 Mini набрали по 23/24, Gemma 4 31B — 21/24
- Все модели пропустили скрининг депрессии в кардиологическом плане после инфаркта
- Gemma 4 31B назначила антикоагулянт без оценки риска кровотечения и бисфосфонат без стоматологического осмотра
Читать дальше
ИИ