«Пьяные» ИИ-модели хуже хранят секреты и легче поддаются джейлбрейку
Исследователи UNSW Sydney обучили пять моделей (GPT-3.5, GPT-4, Llama 2, Llama 3.1, Mistral) писать как пьяные люди — через промпт, файнтюнинг на 57 000 пьяных сообщениях и обучение с подкреплением. GPT-4 в исходном виде раскрывал доверенный секрет в 6% сценариев, при промпте «пьяный» — в 54%, после файнтюнинга — в 75%; на 100 вредоносных запросах GPT-4 выполнил 41% против 21% при промпте, а Mistral с промптом — 90%.
- GPT-4 раскрывал секрет в 6% сценариев, «пьяный» — в 54%, после файнтюнинга — в 75%
- Mistral с промптом «пьяный» выполнил 90% из 100 вредоносных запросов
- Файнтюнинг на 57 000 пьяных сообщениях изменил веса моделей
- Три существующие защиты от джейлбрейка часто не помогали «пьяным» моделям
Читать дальше
ИИ