Latent-GRPO: обучение с подкреплением в непрерывном пространстве мыслей
Представлен метод Latent-GRPO, заменяющий дискретные текстовые токены рассуждений на непрерывные рекуррентные векторы в пространстве эмбеддингов. Это устраняет «налог на токены»: до 80–90% времени генерации уходило на текст, а 19–34% траекторий обрезались лимитом и получали нулевую награду.
- Дискретный Chain-of-Thought тратит 80–90% времени генерации на текст, который никто не читает
- 19–34% траекторий обрезались лимитом токенов и получали нулевую награду
- Непрерывные векторы мыслей размерностью 5120 подаются обратно на вход модели вместо слов
- Метод решает проблему плотности действий для policy gradient через two-pass replay
Читать дальше
ИИ