tehno24.ru
← ИИ
ИИ25 сентября 2026, 12:00

Grouped Value Attention сокращает KV-кэш трансформеров на 45%

Метод Grouped Value Attention (GVA) уменьшает постоянный KV-кэш трансформеров примерно на 45–47% без потери точности: на модели 350M параметров средняя точность отличается от GQA на 0,01 пункта. DeepSeek-V4.1-Flash снижает глобальный след в HBM до 890 байт на токен и сокращает KV-кэш до ~1/8 от DeepSeek-V4-Flash.

Grouped Value Attention сокращает KV-кэш трансформеров на 45%
#DeepSeek
Читать дальше
ИИ

Маск планирует удвоить число чипов Nvidia в кластере Colossus 2 к концу года

ИИ

Китайские регионы субсидируют ИИ-кинематографистов

ИИ

Microsoft Foundry получила голосовых агентов в реальном времени

ИИ

Fastino выпустила GLiNER2.5-Decide: открытая модель решений на 340M параметров