DiffusionGemma: диффузионный inference вместо авторегрессии и новая арифметика tokens/sec — 13 июня 2026 г. в 05:09:32.642
DiffusionGemma: диффузионный inference вместо авторегрессии и новая арифметика tokens/sec Canvas на 256 токенов вместо очереди по одному — и вот уже block-autoregressive склейка для длинных ответов. DiffusionGemma заявляет до 1100 tokens/sec на H100 в FP8 и 18 ГБ VRAM в квантованной сборке, но на reasoning Google советует оставаться на авторегрессивной Gemma 4. В разборе с командами vLLM — как поднять OpenAI-compatible endpoint сегодня и когда диффузия оправдана в IDE и агентных обёртках.

