Z.ai построила инференс GLM-5.3-Flash на 100 000 китайских чипов
Z.ai описала запуск продакшн-инференса модели GLM-5.3-Flash на кластере из более чем 100 000 китайских ИИ-ускорителей. Значительную часть работы выполнил ИИ-агент на базе самой модели: пропускная способность выросла втрое, а подготовка заняла менее двух недель.
- Кластер из более 100 000 китайских ИИ-ускорителей — рекордный масштаб для таких чипов
- GLM-5.3-Flash: 320 млрд параметров, 18 млрд активных, контекст 1 млн токенов
- Пропускная способность выросла втрое, подготовка к продакшену заняла менее двух недель
- Исправления ядра KDA слиты в upstream Flash Linear Attention 27 августа 2026 года
Читать дальше
ИИ