🎓 Работы выпускников. Как научить ИИ читать сложную документацию так, чтобы он не теря... — 22 июня 2026 г. в 08:30:53.613
🎓 Работы выпускников. Как научить ИИ читать сложную документацию так, чтобы он не терялся в таблицах, схемах и формулах Откройте инженерный регламент или технический стандарт — там не только текст. Таблицы, чертежи, формулы, подписи к рисункам. Человек считывает эту структуру с одного взгляда, а машина видит сплошной поток символов и легко теряет нить. Из-за этого помощник на основе языковой модели либо упускает смысл, либо в ответ на точный вопрос выдаёт слишком общий кусок документа. Дмитрий Львов, выпускник магистратуры ФТИИ, в дипломной работе взялся за эту задачу — научить мультимодальные языковые модели отвечать на вопросы по сложным техническим PDF-документам. Научный руководитель — Анастасия Лаушкина. Идея в том, чтобы сначала разбить документ с учётом его визуальной структуры, а потом подавать модели нужный объём контекста: где-то достаточно точного локального фрагмента с ответом, где-то — целой страницы вокруг него. Чем работа сильна: 🔹 собран полный воспроизводимый конвейер — от обработки PDF-документов и сегментации до поиска нужного контекста; 🔹 разные стратегии подачи контекста сравнили между собой и проверили на нескольких эталонных наборах; 🔹 результаты вошли в статью в журнале IEEE Access. Работу Дмитрия отдельно отметила государственная экзаменационная комиссия. Где это пригодится: всюду, где нужно быстро и надёжно отвечать на вопросы по сложной документации — инженерные регламенты, технические стандарты, инструкции, проверка соответствия, научно-техническая документация. Это шаг к системам, которые понимают структуру документа, а не просто читают текст. Что дальше — развивать интеллектуальную обработку документов: точнее находить доказательную часть ответа, работать с разными типами документов, доводить методы до прикладных задач в индустрии и исследованиях. Репозиторий с кодом: https://github.com/mindlab-itmo/layout-aware-doc-segmentation

