Nunchux AI представила VC-Attention для видео-диффузии
Nunchux AI выпустила VC-Attention — обучаемый без дообучения низкобитный attention-ядро для видео Diffusion Transformers. Метод снижает ошибку квантования значений и ускоряет softmax: на B200 attention в Wan2.2 работает в 1,59 раза быстрее, на RTX 5090 — в 3,58 раза.
- Ускорение attention Wan2.2: 1,59× на B200 и 3,58× на RTX 5090
- На B200 VC-Attention в 6,02 раза быстрее SageAttention2
- V-Smooth даёт +2,3 дБ PSNR над SageAttention2 на Wan2.2
- Публичного релиза ядра нет, работает проприетарное расширение
Читать дальше
ИИ