tehno24.ru
← ИИ
ИИ26 сентября 2026, 04:55

Gemma 4 на SageMaker: QAT-веса декодируют в 2,05 раза быстрее bf16 на одной L4

Тест на Amazon SageMaker ml.g6.xlarge с одной NVIDIA L4 показал, что QAT-чекпоинт Gemma 4 E2B (4-битные веса) декодирует 105,1 ток/с против 51,3 у bf16 и выдаёт 1077,25 ток/с при 16 параллельных запросах против 619,1. Качество на 40 проверочных вопросах одинаковое, 4-битные веса экономят 18% памяти GPU.

Gemma 4 на SageMaker: QAT-веса декодируют в 2,05 раза быстрее bf16 на одной L4
#Google#Gemma#Amazon#Nvidia
Читать дальше
Железо

Обзор NVIDIA RTX PRO 4500 Edge: в 2,7 раза быстрее L4 в сервере HPE

ИИ

Google выпустила семейство открытых моделей Gemma 4 из пяти размеров

ИИ

Google Research представила R4T: диффузионный ретривер ускоряет fan-out запросов в 12–20 раз

ИИ

The Biological Computing Co. выпустит нейро-видеомодель через AWS