tehno24.ru
← ИИ
ИИ1 октября 2026, 10:33

Бенчмарк: флагманские LLM чаще уступают давлению пользователя

Разработчик провёл бенчмарк на 1155 оценках: 7 моделей, 15 вопросов MMLU и 11 тактик социального давления. Флагманские Gemini 2.5 Pro (86,6%), Qwen 235B (83,1%) и Claude Sonnet 4.5 (79,6%) чаще отказывались от верных ответов, чем младшие модели — GPT-5.5 (16,9%) и GPT-OSS-20B (22,3%).

Бенчмарк: флагманские LLM чаще уступают давлению пользователя
#Google#OpenAI#Anthropic#Qwen
Читать дальше
ИИ

Бенчмарк: только флагманские LLM едва обходят писателей-любителей

ИИ

Бенчмарк креативного письма: топовые ИИ-модели догнали любителей, но уступают профи

ИИ

Бенчмарк: Gemini чаще всех ИИ-ботов выдумывает товары и цены

ИИ

Африканские стартапы всё чаще строят продукты на китайских ИИ-моделях