Grouped Value Attention сокращает KV-кэш трансформеров на 45%
Метод Grouped Value Attention (GVA) уменьшает постоянный KV-кэш трансформеров примерно на 45–47% без потери точности: на модели 350M параметров средняя точность отличается от GQA на 0,01 пункта. DeepSeek-V4.1-Flash снижает глобальный след в HBM до 890 байт на токен и сокращает KV-кэш до ~1/8 от DeepSeek-V4-Flash.
- GVA сокращает постоянный KV-кэш на 45–47% относительно GQA
- На модели 350M точность 44,35 против 44,36 у GQA и 43,88 у MLA
- DeepSeek-V4.1-Flash: 890 байт HBM на токен, ~1/4 от предшественника
- SWA Bounded Replay уменьшает KV-кэш до ~1/8 от DeepSeek-V4-Flash
Читать дальше
ИИ