Gemma 4 12B: мультимодальность на одной RTX 3090 — 23 июня 2026 г. в 10:37:06.430
Gemma 4 12B: мультимодальность на одной RTX 3090 👋 Gemma 4 12B — модель среднего класса в новой линейке Gemma 4: мощнее компактной E4B, но доступнее старшей 26B A4B MoE. Что важно: ▪️ Полностью бесэнкодерная архитектура Gemma 4 12B не использует отдельные визуальные и аудиоэнкодеры. Изображения и аудиоволны напрямую переводятся в токены через линейные проекции и обрабатываются единым decoder-only трансформером. Это упрощает работу с мультимодальностью и делает модель удобнее для инференса и дообучения. ▪️ Мультимодальность в одной модели Модель работает с текстом, изображениями, видео и аудио, поддерживает длинный контекст до 256K токенов, function calling, режим мышления и Multi-Token Prediction для ускорения инференса. ▪️ Доступность для self-hosting Gemma 4 12B можно запускать в 4-bit и 8-bit форматах на одной RTX 3090 или 4090. Это делает модель интересной для локальных ассистентов, анализа документов, голосового ввода, видеофрагментов и агентных сценариев. 📲 Подробнее — в слайдах. ➡️ В immers.cloud можно быстро проверить, подходит ли Gemma 4 12B под ваш сценарий: запустить модель , протестировать её на реальных данных и оценить требования к GPU без долгой подготовки окружения.

