Gemma 4 на SageMaker: QAT-веса декодируют в 2,05 раза быстрее bf16 на одной L4
Тест на Amazon SageMaker ml.g6.xlarge с одной NVIDIA L4 показал, что QAT-чекпоинт Gemma 4 E2B (4-битные веса) декодирует 105,1 ток/с против 51,3 у bf16 и выдаёт 1077,25 ток/с при 16 параллельных запросах против 619,1. Качество на 40 проверочных вопросах одинаковое, 4-битные веса экономят 18% памяти GPU.
- QAT-чекпоинт декодирует 105,1 ток/с против 51,3 у bf16 на одной L4
- При 16 параллельных запросах — 1077,25 ток/с против 619,1
- 4-битные веса занимают 8,01 ГиБ против 9,75 ГиБ, экономия 18%
- Одинаковый результат на 40 проверочных вопросах
Читать дальше
Железо