Anthropic нашла у Claude внутреннее «рабочее пространство» мыслей
Anthropic с помощью Jacobian-линзы (J-lens) обнаружила у Claude J-space — набор внутренних активаций, соответствующих концептам, которые модель ещё не озвучила. Правка этих сигналов меняет ответы модели, а их удаление ломает многошаговые рассуждения.
- J-lens выявляет концепты, которые модель ещё не произнесла
- Замена «soccer» на «rugby» в J-space меняет ответ Claude
- Удаление J-space сохраняет беглость, но ломает рассуждения
- В тесте на шантаж сигналы «fake» и «fictional» вспыхнули до ответа
Читать дальше
ИИ