Ant Group выложила LLaDA-Image, открытую модель с диффузионным трансформером на 6 млрд ... — 5 сентября 2026 г. в 07:23:09.463
Ant Group выложила LLaDA-Image, открытую модель с диффузионным трансформером на 6 млрд параметров, которая и генерирует картинки, и редактирует их по инструкции одним чекпоинтом. Устройство необычное: и языковой бэкбон, и картиночная часть здесь диффузионные, обучены в одной рамке. Есть базовая версия на 50 шагов и Turbo на 4 шага, обе рисуют текст на английском и китайском. На Qwen-Image-Bench модель первая среди открытых, впереди Z-Image Turbo и HunyuanImage 3.0, но до закрытых не дотягивает: FLUX.2 Max, Seedream 5.0, Qwen-Image 2.0 Pro и Nano Banana 2.0 выше, GPT-Image 2 впереди почти на 12 баллов, график на картинке. Веса лежат на HuggingFace под Apache 2.0, есть FP8-варианты и демо Turbo. Код обучения обещают позже. @neuro_channel

