Модификации DART: как улучшить генерацию изображений из текста
Модификации DART: как улучшить генерацию изображений из текста Модель DART (Denoising Autoregressive Transformer) используется для генерации изображений из текста. У базовой версии есть недостаток — ограниченный объём входных данных (4000 токенов), что замедляет обучение. Существует две модификации модели: - DART-AR: обучение происходит быстрее, чем у базовой версии, но время, необходимое для инференса, значительно увеличивается. - DART-FM: в эту версию добавляют несколько прогонов простой нейросети. Это помогает повысить качество генераций за счёт итерирования между основными шагами расшумления. Несмотря на теоретическую значимость исследования, практическое применение модели ограничено из-за длительного времени инференса и использования не самых современных моделей для сравнения результатов.