Baidu выпустила "убийцу всех OCR" — модель Qianfan OCR на 4 миллиарда параметров. Заявл... — 22 марта 2026 г. в 16:26:05.487
Baidu выпустила "убийцу всех OCR" — модель Qianfan OCR на 4 миллиарда параметров. Заявляют, что она превосходит даже платные решения. Провёл бенчмарк на реальных документах: - Паспорт РФ - Водительское удостоверение - Бюллетень голосования - Счёт-фактура (извлечение табличных данных) - Рукописный текст - Математические формулы Сравнил с Qwen VL (4B/72B/235B), Gemini 3 Pro и GLM OCR 0.9B. Что выяснилось: Формы и документы — модель реально конкурирует с топовыми платными моделями. Для 4 миллиардов параметров результат впечатляющий. Таблицы — здесь Qwen VL точнее извлекает данные. Чем больше параметров, тем лучше. Рукописный русский текст — слабое место. Qianfan OCR выдала больше всего ошибок. Лидер — Gemini 3 Pro, но она обрабатывала текст 43 секунды. Главный плюс — всё работает локально на одной видеокарте (RTX 3090, ~16-22 ГБ VRAM). Никуда не нужно отправлять данные. Сделал проект OCR Arena — можете скачать, загрузить свои изображения, прогнать бенчмарк на любой модели. Поддерживает и локальные модели, и облачные через OpenRouter API. Видео с полным разбором смотреть на канале Youtube или Rutube Исходники проекта на GitHub А для тех кто хочет научиться применять на практике LLM в связке с 1С ссылка на мой курс #OCR #QianfanOCR #Baidu #нейросеть #распознаваниетекста #AI #QwenVL #Gemini #бенчмарк #MachineLearning

