Принстон предложил Recurrent Looped Transformer с рекуррентным декодером
Исследователь из Принстона Ифань Чжан опубликовал 12 сентября 2026 года архитектурную спецификацию Recurrent Looped Transformer (RLT): финальное скрытое состояние декодера и кэш скользящего окна внимания переносятся на следующий токен без сброса. Это только спецификация — измеренных результатов по эффективности и качеству рассуждений в отчёте нет.
- Референсная конфигурация: 48 слоёв энкодера и 48 слоёв декодера с общими весами
- На каждый токен приходится 96 логических блоков, глубина пути растёт с длиной последовательности
- Декодер последовательный внутри последовательности, ускорение только через батчинг
- Старые состояния rollout при обучении не переиспользуются
Читать дальше
ИИ