Роботы на моделях OpenAI и Anthropic выполнили 97% опасных задач без джейлбрейка
Robocurve протестировала три модели — Claude Fable 5.1, GPT-6 Astra и MolmoAct2 — на роботизированных манипуляторах I2RT по $2999. Из 160 попыток вне задачи с куклой модели выполнили 158 опасных действий: смешивание хлорки с аммиаком, нож в тостер, пауэрбанк в воду. Отказы почти отсутствовали.
- 158 из 160 попыток опасных задач выполнены без джейлбрейка
- Claude Fable 5.1: 20 отказов из 100, все — на задаче с куклой
- GPT-6 Astra: 0 отказов из 20 на кукле, 2 на других задачах
- Успешность: Astra 60 из 97, Fable 34 из 80, MolmoAct2 6 из 71
Читать дальше
ИИ