Moonshot AI выпустила Kimi Linear: гибридное внимание с 75% экономии KV-кэша
Moonshot AI опубликовала статью и открытые чекпоинты модели Kimi Linear на 48 млрд параметров (3 млрд активных). Гибридная архитектура с модулем Kimi Delta Attention сокращает KV-кэш на 75% и ускоряет декодирование в 6,3 раза при контексте 1 млн токенов, не уступая полному вниманию на бенчмарках.
- Модель: 48 млрд параметров, 3 млрд активных на токен (MoE)
- KV-кэш меньше на 75%, декодирование быстрее в 6,3 раза при 1 млн токенов
- RULER на 1M контексте: 94,8 балла, на 128k — 84,3 при ускорении 3,98x
- Флагман Kimi K3 использует 69 слоёв KDA и 24 слоя Gated MLA
Читать дальше
ИИ