Оптимизация работы Qwen2.5-VL-72B-Instruct с документами: ключевые факторы успеха
Оптимизация работы Qwen2.5-VL-72B-Instruct с документами: ключевые факторы успеха Пользователь столкнулся с задачей обработки 44-страничного документа: требовалось извлечь текст и координаты текстовых блоков (bbox). Использование Qwen2.5-VL-72B-Instruct через OpenRouter не дало нужных результатов. После тестирования на разных провайдерах выяснилось, что Parasail (0,7 доллара за 1 млн токенов) показал лучший результат, в то время как NovitaAI (0,8 доллара) и Together (8 долларов) дали худшие результаты. Для улучшения работы модели были предложены следующие решения: предобработка изображений (уменьшение размера до 2000 пикселей по широкой стороне), использование детального промпта и структурированного вывода через guided_json vLLM. В результате был реализован пайплайн обработки документов с точностью распознавания 100%.