SparkDiffusion ускорил генерацию видео Wan до 265 раз в тестах исследователей

SparkDiffusion ускорил генерацию видео Wan до 265 раз в тестах исследователей

Изображение: OpenAI

Исследователи Пекинского университета, Университета Цинхуа и Alibaba открыли код SparkDiffusion для ускорения генерации видео моделями Wan 2.1 и Wan 2.2. По данным Pandaily, в тестах команды генерация ролика на одной RTX 5090 сократилась с 4769 до 18 секунд, то есть в 265 раз.

Результат относится к модели Wan2.1-T2V-14B и ролику из 81 кадра, примерно пяти секунд, в разрешении 720P. За основу сравнения исследователи взяли исходную модель, которая делает 50 шагов генерации и использует classifier-free guidance. SparkDiffusion сокращает генерацию до трёх шагов и обходится без этого механизма.

При разработке команда столкнулась с проблемой: после сокращения доли активных блоков внимания до 3% ошибки при обучении продолжали снижаться, но в видео нарушалась структура, смещался фон и становилось нестабильным движение. Дополнительное обучение проблему не устранило. Опыты указали на ошибки в ранних шагах, когда формируется структура ролика. Поэтому SparkDiffusion сначала адаптирует модель к разреженному вниманию, сохраняя общий контекст, а затем корректирует итоговый результат. Линейные операции перевели в FP8 и объединили вычислительные ядра, чтобы сокращение вычислений действительно уменьшало задержку на GPU.

Код опубликован на GitHub под аккаунтом AlibabaResearch по лицензии Apache 2.0. Модели для генерации видео по тексту и изображению в разрешениях 480P и 720P доступны на Hugging Face с 25 сентября. Команда планирует распространить подход на генерацию с более высоким разрешением, авторегрессионное видео и модели мира.

Сергей
Автор: Сергей
Пишу о кибербезопасности и информационных технологиях на простом и понятном языке
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных