Prism: динамическое разреженное внимание для генерации видео со звуком
Представлен фреймворк Prism — динамическое разреженное внимание для обучения моделей совместной генерации видео и аудио в высоком разрешении. Авторы заявляют об обучении в 2,5 раза быстрее полного внимания при более высоком качестве; для инференса 720p нужен один GPU на 80 ГБ, для 1080p и 2K — от четырёх.
- Prism делит видео на пространственно-временные зоны и подбирает блоки внимания по контенту
- Заявлено обучение в 2,5 раза быстрее полного внимания при более высоком качестве генерации
- Инференс 720p требует одного GPU на 80 ГБ, 1080p и 2K — от четырёх
- Обучение 720p требует минимум 32 GPU на 80 ГБ, 1080p и 2K — 64
Читать дальше
ИИ