Ai2 выпустила Olmo-core 3 для обучения MoE на триллион параметров
Allen Institute for AI представила Olmo-core 3 — открытый стек обучения смесей экспертов (MoE) масштабом свыше триллиона параметров. На 512 GPU NVIDIA B300 модель на 1,2 трлн параметров с 58,36 млрд активных показала до 858 TFLOP/s на GPU; в тесте на 8 GPU пропускная способность выросла в 2,7 раза.
- Бенчмарк: 1,2 трлн параметров, 58,36 млрд активных на токен, 512 GPU B300
- На 8 GPU B300: 52 000 токенов/с на GPU против 19 400 у прошлой версии
- MXFP8 даёт +21% пропускной способности, пиковая память падает с 103 до 95 GiB
- Эксперты выросли с 8 до 128 при 4 активных на токен, падение throughput менее 5%
Читать дальше
ИИ