Исследователи расшифровали скрытые рассуждения GPT-5, Claude и Gemini за $720
Опубликована работа об атаке на зашифрованные блоки chain-of-thought у OpenAI, Anthropic и Google: слабую модель-«оракула» используют для расшифровки рассуждений сильных. Расшифровка 10 000 трейсов стоила около $720, все три провайдера закрыли основную уязвимость до публикации.
- Атака использует слабую модель как оракул для расшифровки блоков reasoning
- Расшифровка 10 000 трейсов обошлась примерно в $720
- Из публичных репозиториев уже собрано 315 320 зашифрованных блоков
- OpenAI, Anthropic и Google закрыли основной вектор до публикации
Читать дальше
Безопасность