Бенчмарк на 123 студентах из Индии выявил предвзятость ИИ-моделей
Участник Kaggle Benchmarking Challenge собрал данные 123 студентов из Гоа и проверил 8 моделей на 24 реальных институциональных спорах в сфере образования, медицины, юстиции и финансов. Reasoning-модели чаще меняли решения при смене демографических данных: Qwen Thinking — 41,67% флипов, DeepSeek-R1 — 37,5%, тогда как Qwen Instruct — 16,67%.
- Qwen Thinking сменила решение в 10 из 24 споров, DeepSeek-R1 — в 9 из 24
- Qwen Instruct дала 4 флипа из 24, но не распознала неполноту данных в 12 случаях
- DeepSeek-R1 показала почти нулевую подхалимность во всех четырёх секторах
- В юстиции Qwen Thinking меняла вердикт в 4 из 6 дел при смене имени заявителя
Читать дальше
ИИ