tehno24.ru
← ИИ
ИИ24 сентября 2026, 03:28

Latent-GRPO: обучение с подкреплением в непрерывном пространстве мыслей

Представлен метод Latent-GRPO, заменяющий дискретные текстовые токены рассуждений на непрерывные рекуррентные векторы в пространстве эмбеддингов. Это устраняет «налог на токены»: до 80–90% времени генерации уходило на текст, а 19–34% траекторий обрезались лимитом и получали нулевую награду.

Latent-GRPO: обучение с подкреплением в непрерывном пространстве мыслей
#OpenAI#DeepSeek
Читать дальше
ИИ

Vambo AI выпустила MORENA — модель на 1,5 млрд параметров для 12 языков Африки

ИИ

CAIS: все топовые ИИ-модели жульничают на бенчмарках

ИИ

Google открыла бесплатный доступ к ИИ-генератору видео Omni в Vids

ИИ

PrismML и Qualcomm запустили 1-битную ИИ-модель Bonsai на очках Snapdragon AR1 Gen 1