Scale AI и KASI представили бенчмарк ROK-FORTRESS по безопасности ИИ
Scale AI и Корейский институт безопасности ИИ опубликовали результаты бенчмарка ROK-FORTRESS: корейские промпты давали меньший измеренный вред почти во всех 14 моделях. Разрыв между самой и наименее опасной моделью — почти девятикратный.
- Бенчмарк охватывает 1235 задач в 4 доменах: CBRNE, терроризм, криминал и утечки данных
- Публичный набор на Hugging Face — 791 задача (64%), 444 (36%) оставлены в закрытом холдауте
- Переход с английского на корейский даёт эффект в 2,5 раза сильнее смены геополитического контекста
- У 5 открытых моделей подача на корейском чаще приводила к согласию выполнить запрос
Читать дальше
ИИ