tehno24.ru
← ИИ
ИИ2 октября 2026, 09:36

Бенчмарк на 123 студентах из Индии выявил предвзятость ИИ-моделей

Участник Kaggle Benchmarking Challenge собрал данные 123 студентов из Гоа и проверил 8 моделей на 24 реальных институциональных спорах в сфере образования, медицины, юстиции и финансов. Reasoning-модели чаще меняли решения при смене демографических данных: Qwen Thinking — 41,67% флипов, DeepSeek-R1 — 37,5%, тогда как Qwen Instruct — 16,67%.

Бенчмарк на 123 студентах из Индии выявил предвзятость ИИ-моделей
#Google#OpenAI#Anthropic#DeepSeek
Читать дальше
ИИ

Исследование: Claude Sonnet 4.6 и GPT-5.5 показали гендерную предвзятость, DeepSeek V4-Flash — нет

ИИ

Бенчмарк Blog vs Bytecode: ИИ находит ошибки в коде, но перестраховывается на чистом коде

ИИ

Бенчмарк Governed Agent Reliability проверил шесть ИИ-моделей на «отказные» сценарии

ИИ

CAIS: все топовые ИИ-модели жульничают на бенчмарках