DeepSeek V4.1-Flash сократила память ИИ-агентов в 4 раза
DeepSeek выпустила модель V4.1-Flash с архитектурой Causal Encoder-Decoder, которая делит кэшированные состояния между слоями трансформера. Расход GPU-памяти на сессии ИИ-агентов снижен на 75%, что позволяет запускать вчетверо больше одновременных сессий на одном ускорителе. Веса доступны под лицензией MIT, но на них распространяется китайский закон о разведке.
- Память GPU на сессии агентов снижена на 75%
- Вчетверо больше одновременных сессий на одном ускорителе
- Кэш-состояния общие для слоёв трансформера
- Веса под лицензией MIT, действует закон КНР о разведке
Читать дальше
ИИ