Пирамидальный метод сопоставления потоков для генерации видео
Пирамидальный метод сопоставления потоков для генерации видео Современные модели для генерации видео, подобные Sora, создают каждый кадр из шума и затем его «расшумляют». Однако генерация видео сложнее, чем создание статичных изображений, поскольку требуется смоделировать целую последовательность кадров. Например, для 5-секундного видео с частотой 30 кадров в секунду понадобится сгенерировать 150 кадров, что требует значительных вычислительных ресурсов. Кроме того, такие модели не могут создавать видео длиннее тех, на которых они обучались. Авторы нового препринта предлагают компромисс: снизить качество изображений для повышения эффективности обучения и генерации. Их модель использует фреймы из прошлого и теоретически способна генерировать видео любой длины без склеек. Для обучения модели применяется метод flow-matching — предсказание векторного поля пикселей, которое показывает, как они будут перемещаться и изменять кадр со временем. Особенность подхода — пирамидальная структура. Вместо многоступенчатой генерации, когда сначала создаются кадры низкого разрешения, а затем они масштабируются, модель обрабатывает все разрешения одновременно. На каждом уровне пирамиды — своя степень зашумления, а картинка «расшумляется» с помощью специально предсказанного векторного поля. На последнем уровне шум устраняется, и получается готовый кадр.