Zhipu открыла GLM-5.3-FlashX со скоростью около 200 токенов/с
Zhipu AI открыла доступ к GLM-5.3-FlashX через API и центр тестирования: пиковая генерация около 200 токенов в секунду на примерно 100 000 китайских ИИ-ускорителей. Базовая модель GLM-5.3-Flash — MoE на 320 млрд параметров (18 млрд активных) с контекстом 1 млн токенов, открыта 26 августа.
- Пиковая скорость генерации FlashX — около 200 токенов в секунду
- Ускорение обеспечено кластером из ~100 000 китайских ИИ-ускорителей
- База GLM-5.3-Flash: 320 млрд параметров, 18 млрд активных, контекст 1 млн токенов
- Стек оптимизировал Infra Agent на GLM-5.3: рост пропускной способности примерно в 3 раза
Читать дальше
ИИ