DART: новая модель для генерации изображений из текста
DART: новая модель для генерации изображений из текста Авторы нового препринта представили модель DART (Denoising Autoregressive Transformer), которая позволяет преобразовать авторегрессионную визуальную генерацию в диффузионную. Для этого необходимо соблюдать несколько условий: фиксировать процесс зашумления, работать в Марковской парадигме (когда модель зависит только от одного предыдущего состояния) и взвешивать loss с учётом timestamp и наложенного шума. В DART предлагается ослабить второе условие — добавить зависимость от предыдущих зашумлённых изображений. Существует несколько способов генерации последовательности с помощью DART: — генерировать частично расшумлëнное изображение на каждом шаге (DART); — генерировать изображение по патчам на каждой стадии расшумления (DART-AR); — последовательно увеличивать размер генерируемых изображений (Matryoshka-DART); — генерировать не только изображение, но и его текстовое описание (Kaleydo-DART). Для генерации на основе текстового промпта используется предобученная модель Flan-T5-XL, а для генерации на основе заданного класса — дополнительные слои Adaptive LayerNorm.