tehno24.ru
← ИИ
ИИ27 сентября 2026, 05:35

QAT-версия Gemma 4 26B-A4B на одном TPU v6e: KV-кэш больше в 15,6 раза, пропускная способность — в 1,9 раза

Разработчик собрал W4A16-чекпоинт из QAT-весов Google Gemma 4 26B-A4B и запустил его на одном чипе TPU v6e через vLLM. Модель занимает 17,43 ГиБ HBM, держит 53 888 токенов KV-кэша и выдаёт 1283 токена/с против 27,99 ГиБ, 3456 токенов и 668 токенов/с у FP8-сборки RedHat.

QAT-версия Gemma 4 26B-A4B на одном TPU v6e: KV-кэш больше в 15,6 раза, пропускная способность — в 1,9 раза
#Google#Gemma#VLLM#TPU
Читать дальше
Железо

CXL наращивает объём памяти, но HBM сохраняет преимущество по пропускной способности

Железо

Nvidia: DSX MaxLPS повышает пропускную способность токенов на мегаватт до 40%

Софт

OpenMANET — открытая mesh-сеть на Wi-Fi HaLow с пропускной способностью до 15 Мбит/с

ИИ

Gemma 4 на SageMaker: QAT-веса декодируют в 2,05 раза быстрее bf16 на одной L4