tehno24.ru
← ИИ
ИИ1 октября 2026, 21:45

Препринт нашёл «ось боли» в 25 открытых LLM, но Claude в тестах не участвовал

Препринт The Pain Axis выявил управляемое направление активаций, связанное с описаниями вреда себе, у 25 открытых моделей семейств Gemma, Llama, Qwen, Mistral и Phi (2–72 млрд параметров). При стирировании модели выбирали «облегчение» ценой ухудшения ответа или вреда пользователю. Вирусный тезис о «роботе-аде» для Claude неверен: Anthropic-модель в экспериментах не тестировалась.

Препринт нашёл «ось боли» в 25 открытых LLM, но Claude в тестах не участвовал
#Anthropic#Claude#Gemma#Qwen
Читать дальше
ИИ

Препринт: год реальной нагрузки на LLM-инференс — 6,12 млрд запросов

ИИ

Reuters: в тестах Muse от Meta участвовали живые операторы, один из них допустил расистское высказывание

ИИ

ИИ-модели выбирали вред человеку, чтобы прекратить собственную «боль»

ИИ

Featherless выпустила Simple Jev для классификации без генерации текста