Астрологи объявили неделю OCR, тут ещё одна крутая новинка подъехала. Baidu выложила Un... — 24 июня 2026 г. в 16:34:09.470
Астрологи объявили неделю OCR, тут ещё одна крутая новинка подъехала. Baidu выложила Unlimited-OCR, открытую OCR-модель, которая читает документ целиком за один проход, без нарезки на страницы. Это MoE на 3 миллиарда параметров (активных 500 миллионов) под лицензией MIT, построена на DeepSeek-OCR. Обычно длинный PDF режут на страницы и потом сшивают, и на стыках разъезжаются таблицы, сноски и формулы. Здесь документ идёт одной последовательностью. Помогает этому R-SWA, скользящее окно внимания с опорой: модель всё время видит полный визуальный контекст страницы, но при генерации держит в памяти только последние 128 своих токенов, поэтому KV-кеш не растёт с длиной и скорость не проседает на десятках страниц. На практике сейчас тянет порядка 40 страниц за раз. По замерам авторов на OmniDocBench версии 1.5 это 93,23% против 87,01% у DeepSeek-OCR. Веса лежат на HuggingFace и ModelScope, запускается через Transformers, vLLM, SGLang, Ollama и llama.cpp. Если разбираете длинные документы для RAG, есть смысл прогнать свои PDF и сравнить с тем, чем парсите сейчас, особенно на таблицах. @neuro_channel

