Dust: обучение ИИ без обратного распространения
Исследователи представили Dust — метод оптимизации нулевого порядка, который обучает нейросети без вычисления градиентов. При больших размерах популяции он достигает результатов, сопоставимых с backprop, и в 10³–10⁴ раз эффективнее эволюционных стратегий в пространстве весов.
- Dust заменяет градиенты случайными возмущениями активаций на каждом слое
- Метод в 10³–10⁴ раз эффективнее эволюционных стратегий в пространстве весов
- Крупные модели оказались популяционно эффективнее мелких
- Согласованность оценок с backprop сохраняется до 1 млрд токенов
Читать дальше
Регулирование