Представляем LightOnOCR-3 — полезный инструмент для подготовки отчётов и технических до...
Представляем LightOnOCR-3 — полезный инструмент для подготовки отчётов и технических документов к поиску, аналитике и RAG. Это семейство открытых моделей для обработки документов, позволяющее извлекать данные не только из PDF, но и из графиков. Возможности моделей: • Распознавание печатного и рукописного текста; • Сохранение структуры страницы и координат блоков; • Описание изображений; • Преобразование данных с графиков в таблицы. Доступно три размера моделей: 0,8B, 1B и 4B. Их можно адаптировать и разворачивать на собственной инфраструктуре. Согласно тестам, модели опережают большинство конкурентов, а в бенчмарке ParseBench версии 4B и 0,8B занимают первые места. Попробовать модельки можно тут.