🌟 Cohere Labs выложила компактную зрительно-языковую модель North Micro Vision — 17 августа 2026 г. в 11:06:38.275
🌟 Cohere Labs выложила компактную зрительно-языковую модель North Micro Vision Модель на 2,4 млрд параметров стала (https://huggingface.co/blog/CohereLabs/meet-north-micro-vision-instruct) самой маленькой в линейке VLM компании. От большинства таких моделей она отличается тем, что работает с изображением в исходном разрешении. Обычно картинку перед подачей в модель сжимают, и мелкий текст, разметка таблицы и подписи на графике при этом теряются. Здесь пропорции сохраняются, а верхняя планка соответствует странице A4, отсканированной при 200 dpi. Отсюда и заявленная область применения - документы, таблицы, графики, скриншоты, формы. Компактный размер удобен для дообучения под свою предметную область, а квантованные сборки, по словам Cohere, пойдут не только на сервере, но и на ноутбуке или устройстве мобильного класса. 🟡Архитектура Зрительный энкодер на 400 млн параметров вырос из SigLIP 2 (https://huggingface.co/google/siglip2-so400m-patch16-384) и держит исходное разрешение за счёт двумерного RoPE вместе с обученными одномерными позиционными эмбеддингами. Языковая часть - собственная North Micro LLM на 2 млрд параметров, повторяющая архитектуру Command A+ (https://cohere.com/blog/command-a-plus): три слоя внимания со скользящим окном и RoPE чередуются с одним глобальным слоем, который работает вообще без позиционных эмбеддингов. Получается разделение труда - окна с RoPE держат локальный контекст, глобальный слой смотрит на всё сразу и в разметке позиций не нуждается. Между ними проектор, и здесь изюминка. Вместо того чтобы отдать языковой модели один готовый набор признаков, Cohere подмешивает эмбеддинги патчей с нескольких уровней зрительного энкодера в соответствующие ранние слои языковой модели. Так модель видит картинку сразу на разных степенях обобщения. Принцип взят из DeepStack (https://arxiv.org/pdf/2406.04334). 🟡Тесты Замеры проводили через VLMEvalKit (https://github.com/open-compass/vlmevalkit), сравнивая с восемью моделями размером от 1,6 до 5,1 млрд параметров. Сильнее всего North Micro Vision выглядит там, куда её и целили. На DocVQA 0,921, на ChartQA 0,808, на AI2D 0,775, на RefCOCO 0,732 (втрое выше, чем у Ministral и Qwen3-VL). Общий язык и рассуждение даются слабее. На MMMU 0,329, худший результат в таблице; на MMLU и MMLU-Pro модель тоже уступает большинству соседей. 📌Лицензирование: Apache 2.0 License. 🟡Статья (https://huggingface.co/blog/CohereLabs/meet-north-micro-vision-instruct) 🟡Модель (https://huggingface.co/CohereLabs/North-Micro-Vision-Instruct) 🟡Демо (https://huggingface.co/spaces/akhaliq/North-Micro-Vision-Instruct)

