tehno24.ru
← ИИ
ИИ28 сентября 2026, 18:30

«Пьяные» ИИ-модели хуже хранят секреты и легче поддаются джейлбрейку

Исследователи UNSW Sydney обучили пять моделей (GPT-3.5, GPT-4, Llama 2, Llama 3.1, Mistral) писать как пьяные люди — через промпт, файнтюнинг на 57 000 пьяных сообщениях и обучение с подкреплением. GPT-4 в исходном виде раскрывал доверенный секрет в 6% сценариев, при промпте «пьяный» — в 54%, после файнтюнинга — в 75%; на 100 вредоносных запросах GPT-4 выполнил 41% против 21% при промпте, а Mistral с промптом — 90%.

«Пьяные» ИИ-модели хуже хранят секреты и легче поддаются джейлбрейку
#OpenAI#GPT-4#Mistral#Llama
Читать дальше
ИИ

Kyutai выпустила Voice of Reason: голосовые модели решают математику вслух

ИИ

Chat-шаблон включает фразу «я всего лишь ИИ» у 8 языковых моделей

ИИ

Llama-Mobile сжала 11B VLM до 2,7 бита на CPU смартфонов

ИИ

Apollo: первая ИИ-модель для древнегреческого на 600 млн слов