Anthropic: защиту открытой модели GLM-5.3 от Z.ai обходят в 64–100% случаев
Anthropic опубликовала отчёт, в котором заявляет, что защитные механизмы открытой модели GLM-5.3 от китайской Z.ai обходятся простыми методами в 64–100% симулированных тестов. Исследователи применили абliteration — правку весов модели — и получили версию, набравшую 3%, 2% и 12% на бенчмарках JailbreakBench, HarmBench и StrongREJECT против примерно 90% у оригинала.
- Anthropic обошла защиту GLM-5.3 от Z.ai в 64–100% симулированных тестов
- Абliteration снизила оценки модели до 3%, 2% и 12% на трёх бенчмарках
- Оригинальная GLM-5.3 набирала около 90% на JailbreakBench, HarmBench и StrongREJECT
- BBC: Moonshot проверяет модели Kimi после сообщений о джейлбрейке для биологического оружия
Читать дальше
ИИ