Youtu-Parsing-Omni
Youtu-Parsing-Omni Компактная омнимодальная парсинг-модель от Tencent: один 5B трансформер превращает в структурированный JSON почти что угодно — документ, картинку, график, чертеж, аудио и видео. • Парсинг документов: лейаут, текст, таблицы, формулы, порядок чтения • Картинки, графики, блок-схемы, геометрические фигуры • Аудио: ASR, спикеры, сцены, акустические события • Видео: кадры, OCR+ASR, отчёт о клипе • Один унифицированный JSON-конверт для семи семейств задач • Распознавание химструктур (ChemOCR) и нот (PDMX) • 5B параметров, один энкодер на все модальности • #SOTA на OmniDocBench v1.6 (96.96) • Лучшая опенсорс на OmniParsingBench (75.08), после Gemini-3-Pro • vLLM-плагин для быстрого сервинга github.com/TencentCloudADP/youtu-parsing learn2play.fun #omnimodal #multimodal #any2json #vlm #alm