🧠 DeepSeek запустил Vision Mode — 22 июня 2026 г. в 10:43:01.279
🧠 DeepSeek запустил Vision Mode Режим визуального мышления уже доступен в веб-версии и мобильном приложении. Нейросеть научилась решать задачи, требующие точной пространственной ориентации: геометрические выводы, анализ графиков и конвертацию UI-скринов в HTML. Как это работает (простыми словами): Вместо того чтобы описывать изображения словами (как обычные LLM), DeepSeek использует координаты и рамки объектов как "единицы мышления" — это как если бы модель рисовала себе схему вместо текстового описания. Техническая основа: Функция построена на подходе Thinking with Visual Primitives. Проблема MMLM (мультимодальных моделей) — слабая локализация объектов и пространственные рассуждения. Решение — встраивание координат и bounding boxes непосредственно в визуальную цепочку CoT (Chain-of-Thought). Это даёт точную привязку к пикселям без оглядки на естественный язык. Ограничения: Режим работает только со статическими изображениями. Аудио, видео и генерация картинок не поддерживаются. 🧠 Нейросети и Технологии. Подписаться

