ERNIE-ViLG 2.0: Новая революция в текст-в-изображение
ERNIE-ViLG 2.0: Новая революция в текст-в-изображение Китайская компания Baidu представила ERNIE-ViLG 2.0, модель, превосходящую DALL-E 2 и Stable Diffusion (SD) в генерации изображений. Основные инновации включают: - Использование 10 специализированных сетей для разных этапов диффузии (Mixture of Denoising Experts). - Автоматическое усиление важных слов в запросах и учет визуальных объектов для повышения точности генерации. Модель имеет 24 млрд параметров, что в 10 раз больше, чем у SD, и показывает выдающиеся результаты с FID 6,75 на MS-COCO. Пример запроса: 'flame, giant cat, girl, futuristic, high-definition, 3d, delicate face, cg sense, ancient style, beautiful, fine hair, upper body painting'. Рекомендуется использовать запрос на китайском языке. Ссылки из исходного поста: Статья | Халявное Demo | @artem Материалы по ссылкам: 1. эйай ньюз Извлечённый текст не содержит информации для создания summary. Доступны только технические теги и ссылки. https://t.me/ai_newz/1555 2. ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts В статье предлагается модель ERNIE-ViLG 2.0 для улучшения качества генерации изображений по тексту. Модель использует детальные текстовые и визуальные знания об элементах сцены и разных экспертов по удалению шума на разных этапах. ERNIE-ViLG 2.0 достигла нового уровня качества на MS-COCO с нулевой оценкой FID 6,75 и значительно превзошла современные модели по точности изображений и соответствию текста. https://arxiv.org/abs/2210.15257 3. эйай ньюз Автор культурно освещает новости из мира искусственного интеллекта, делится профессиональным мнением. Ранее работал научным сотрудником в Meta Generative AI. Сейчас является CEO и основателем AI стартапа в Швейцарии. https://t.me/ai_newz Источник: оригинальный пост