MIT и NVIDIA закрыли разрыв точности при 8-битном обучении LLM
Исследователи MIT и Carnegie Mellon нашли и математически исправили причину остаточного разрыва точности при нативном обучении LLM в FP8. Метод Delta-Matching восстанавливает инвариант нулевой суммы строк якобиана softmax, позволяя использовать удвоенную пропускную способность FP8-тензорных ядер без потери качества.
- На H100 FP8 даёт 3958 терафлопс против 1979 у BF16
- На 5,29 млрд параметров наивный FP8 дал 16,3% на RULER-8K против 53,5% у BF16
- Delta-Matching не требует смены архитектуры и снижения размера батча
- Метод согласует форматы E4M3 и E5M2 на границе forward-backward
Читать дальше
ИИ