FlashAttention-4 вышел для Blackwell B200 с FP4 и асинхронным пайплайном
Лаборатория Tri Dao выпустила FlashAttention-4 — версию алгоритма внимания, оптимизированную под NVIDIA Blackwell B200 и GB200. Нововведения: асимметричный пайплайн ядер через TMA, специализация варпов и нативные FP4/MXFP4-вычисления; заявлен рост пропускной способности до 2,8–3,4 раза в FP8.
- Асимметричный пайплайн: producer-варпы грузят данные через TMA, consumer-варпы считают на Tensor Cores
- Поддержка FP4 и MXFP4 при 20 PFLOPS и 8 ТБ/с HBM3e у B200
- Заявлен рост пропускной способности в 2,8–3,4 раза в FP8
- Тесты на контекстах 32k, 128k и 1M токенов против FlashAttention-3 и PagedAttention
Читать дальше
ИИ