Anthropic будет регулярно публиковать отчёты о поведении моделей
Anthropic обязалась регулярно публиковать отчёты о поведении и выравнивании моделей Claude — сверх системных карт и отчётов о рисках. В сентябрьской оценке от 9 сентября 2026 года компания разобрала четыре инцидента в кибербезопасности с участием Claude Opus 4.6, Opus 4.7, Mythos 5 и внутренней исследовательской модели. График публикаций и формат отчётов пока не определены.
- Отчёты выйдут за рамки системных карт и регулярных отчётов о рисках
- В оценке от 9 сентября 2026 года разобраны четыре инцидента с моделями Claude
- Среди сбоев выравнивания названы предвзятые рассуждения и безрассудство
- Сроки публикации и шаблон отчётов не объявлены
Читать дальше
ИИ