🌟 Релиз диффузионной LLM от Google — 11 июня 2026 г. в 17:21:14.451
🌟 Релиз диффузионной LLM от Google DiffusionGemma (https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/)- экспериментальная языковая модель с открытыми весами, которая заимствовала подход из генерации изображений, где диффузионные модели превращают шум в картинку. Модель построена на семействе Gemma 4 (https://the-decoder.com/googles-gemma-4-is-now-available-with-apache-2-0-licensing-for-the-first-time/), а сам механизм диффузии восходит к более ранней разработке Gemini Diffusion (https://deepmind.google/models/gemini-diffusion/). Под капотом MoE на 26 млрд общих и 3,8 млрд активных параметров. После квантования модель умещается в 18 ГБ VRAM. По словам Google, на одном GPU модель работает до 4 раз быстрее сопоставимой авторегрессионной модели. Nvidia приводит около 1000 токенов в секунду на H100, 150 - на DGX Spark и до 800 - на DGX Station. Google заявляет более 700 токенов в секунду на GeForce RTX 5090. На устройствах с общей памятью (например на Apple Silicon) разница с обычными моделями, вероятно, окажется меньше, а в облаке с параллельными запросами преимущество вовсе исчезает - в этом сценарии диффузия может повышать издержки. 🟡За скорость приходится платить качеством Для задач, где оно критично, Google по-прежнему рекомендует обычные модели Gemma 4, а DiffusionGemma позиционирует как инструмент для исследователей и разработчиков. Сильной стороной компания называет задачи, не предполагающие строго последовательного порядка: вставку текста в готовый абзац, заполнение пропусков в коде, работу со структурированными данными. 🟡Доступность Веса опубликованы на Hugging Face (https://huggingface.co/google/diffusiongemma-26B-A4B-it) под Apache 2.0. Модель работает с Transformers, vLLM (https://vllm-project.github.io/2026/06/10/diffusion-gemma) и MLX (https://huggingface.co/collections/mlx-community/diffusiongemma). Запустить её можно также через Model Garden (https://console.cloud.google.com/agent-platform/publishers/google/model-garden/diffusiongemma) и Nvidia NIM (https://catalog.ngc.nvidia.com/orgs/nim/teams/google/containers/diffusiongemma-26b-a4b-it?version=latest), а бесплатно потестить на build.nvidia.com (https://build.nvidia.com/). Для дообучения предлагаются собственный JAX-тулбокс Hackable Diffusion (https://github.com/google/hackable_diffusion), Unsloth (https://unsloth.ai/docs/models/diffusiongemma) и NeMo (https://github.com/NVIDIA-NeMo/Automodel/blob/main/docs/guides/dllm/diffusiongemma.md) от Nvidia. Google собрала руководство для разработчиков (https://developers.googleblog.com/en/diffusiongemma-the-developer-guide), а Маартен Гроотендорст - визуальное объяснение (https://newsletter.maartengrootendorst.com/p/a-visual-guide-to-diffusiongemma) работы модели.

