LoGRA от Nvidia: RL-дообучение LLM с экономией памяти до 45,7%
Nvidia и партнёры представили метод LoGRA, который заменяет полные градиентные буферы низкоранговыми «скетчами» и добавляет контроль шага по предсказанному KL. Средняя память при обучении падает до 45,7%, а модель на 27B стабильно обучается 1100+ шагов на одном узле из восьми GPU.
- Память 7B-модели снижена с 31,82 до 17,29 ГиБ — экономия 45,7%
- 27B-модель обучается 1100+ шагов на узле из 8 GPU, где dense Adam падает по памяти
- Held-out macro score 27B-модели вырос с 39,69% до 62,94%
- Для 1,5B LoGRA требует 7,18 ГиБ против 13,21 ГиБ у LoRA
Читать дальше
ИИ