Мультимодальные модели: AI, который видит, слышит и отвечает за секунду — 28 июня 2026 г. в 05:08:42.648
Мультимодальные модели: AI, который видит, слышит и отвечает за секунду 🧠 Google DeepMind запустил DiffusionGemma — мультимодальную модель нового поколения, объединяющую текстовое понимание с генерацией изображений в одном пайплайне. Скорость текстового вывода выросла в 4 раза по сравнению с прошлым поколением Gemma. Это не просто incremental update: архитектура позволяет контексту одного модality напрямую влиять на другой без промежуточного энкодера, что снижает задержку и галлюцинации. Полный список моделей DeepMind — на deepmind.google/models. 🦞 Параллельно экосистема с открытым кодом не отстаёт: Qwen 3.5 от Alibaba вышел под Apache 2.0 и заткнул 100+ моделей — не только LLM, но и vision/audio/coding-агенты в одном пакетe. Benchmarks на benchlm.ai уже показывают, что разрыв между проприетарными и open-source мультимодальными системами сокращается до 3–5% по метрикам понимания изображений с текстом. ⚡ Тренд ясен: в середине 2026 мультимодальность перестала быть фичей — это стандарт ввода-вывода.

