NVIDIA и Университет Ватерлоо опубликовали мультимодальную модель PixelUMM, которая объ... — 3 октября 2026 г. в 18:01:58.696
NVIDIA и Университет Ватерлоо опубликовали мультимодальную модель PixelUMM, которая объединяет понимание и генерацию визуального контента. Она принимает фото, видео и текст, отвечает текстом и сама генерирует изображения или ролики прямо в сырых пикселях, без VAE и отдельного визуального энкодера. Языковой базой служит Qwen3-8B, но в полном чекпоинте 15,2 млрд параметров из-за раздельных экспертов для понимания и генерации, связанных общим вниманием. Архитектура позволяет брать входное изображение за основу и развивать его в видеоряд: на визуализации авторов в первой колонке дан исходный кадр, а следующие кадры сгенерированы моделью. Веса выпущены только для некоммерческих исследований и оценки под лицензией NVIDIA One-Way, а код доступен в основном под Apache 2.0 с заимствованным модулем под CC BY-NC. @neuro_channel