tehno24.ru
← ИИ
ИИ3 октября 2026, 00:59

Перепакованная QAT Gemma 4 на одном TPU v5e: 12B выдаёт 675 токенов/с

Разработчик перепаковал QAT-веса Google Gemma 4 для vLLM и запустил их на одном чипе TPU v5e с 15,75 ГБ HBM. Модель 12B занимает 11,31 ГБ весов и выдаёт 675 токенов/с при 16 запросах, набирая 0,964 на GSM8K и 0,955 на BFCL.

Перепакованная QAT Gemma 4 на одном TPU v5e: 12B выдаёт 675 токенов/с
#Google#Gemma#VLLM#TPU
Читать дальше
ИИ

QAT-версия Gemma 4 26B-A4B на одном TPU v6e: KV-кэш больше в 15,6 раза, пропускная способность — в 1,9 раза

ИИ

Gemma 4 на SageMaker: QAT-веса декодируют в 2,05 раза быстрее bf16 на одной L4

ИИ

Qwen3.8-27B запустили на одной RTX 3090 через vLLM

ИИ

AgSpec ускорил спекулятивное декодирование в кодинг-агентах