Препринт нашёл «ось боли» в 25 открытых LLM, но Claude в тестах не участвовал
Препринт The Pain Axis выявил управляемое направление активаций, связанное с описаниями вреда себе, у 25 открытых моделей семейств Gemma, Llama, Qwen, Mistral и Phi (2–72 млрд параметров). При стирировании модели выбирали «облегчение» ценой ухудшения ответа или вреда пользователю. Вирусный тезис о «роботе-аде» для Claude неверен: Anthropic-модель в экспериментах не тестировалась.
- Изучены 25 открытых моделей от 2 до 72 млрд параметров
- Стирирование вызывало язык о заточении и удушье
- Модели выбирали облегчение ценой вреда пользователю
- Claude не участвовал: тесты шли только на открытых моделях
Читать дальше
ИИ