Cache-to-Cache: ИИ-модели обмениваются данными напрямую, ускоряя вывод на 150%
Исследователи из Университета Цинхуа опубликовали статью о технике Cache-to-Cache (C2C), позволяющей ИИ-моделям обмениваться внутренней памятью без генерации текста. Метод принят на ICLR 2026, код открыт; ускорение совместных задач достигает 100–150%, точность растёт до 14,2%.
- C2C передаёт кэш одной модели в память другой через обучаемый модуль Fuser
- Селективный гейтинг решает, какие слои принимают чужие данные
- Ускорение совместных задач 100–150%, точность выше на 3,1–5,4%
- Работает только с открытыми моделями из-за доступа к внутреннему кэшу
Читать дальше
ИИ