Alibaba представила Qwen-Image-2.1 Turbo — новую открытую ИИ-модель для ускоренного соз...
Alibaba представила Qwen-Image-2.1 Turbo — новую открытую ИИ-модель для ускоренного создания изображений по текстовому описанию и редактирование готовых картинок. Главное нововведение — ускоренная генерация. Модель создает изображения всего за 8 шагов вместо 40 шагов. Также есть встроенная поддержка прозрачности, возможность загрузки до 10 референсов, а редактирование выделенных областей проходит без изменения других объектов. Визуальный энкодер Diffusion Transformer на 32 слоя содержит около 7 млрд параметров. Но на деле весь пайплайн почти вдвое больше: текстовый энкодер Qwen3-VL, который понимает промпты и референсы, весит 8,8 млрд параметров, то есть даже больше визуального генератора. Вместе с VAE получается, что моделька весит около 16,2 млрд параметров на 32,5 ГБ весов в полной точности BF16. Для запуска в BF16 без компромиссов понадобится видеокарта на 48 ГБ (с KV-кэшем). При квантизации в INT8 веса сокращаются примерно до 16-17 ГБ, и тогда для генерации в разрешении 1024 x 1024 хватит карты на 24 ГБ. А смешанная 4-битная квантизация уменьшает пайплайн до 10-12 ГБ и позволяет уложиться в 16 ГБ видеопамяти для генерации в том же разрешении. Владельцы карт на 8–12 ГБ тоже смогут запустить модель, если загружать энкодер, генератор и VAE по очереди, но скорость, очевидно, будет заметно ниже. С ростом разрешения до 2048 x 2048 рабочая память под вычисления может вырасти на 5-9 ГБ сверху. Веса уже доступны на Hugging Face. 😅 Канал Serverflow в MAX: Подписаться