🎓 Работы выпускников. Как научить ИИ читать русский рукописный текст — и уместить его ... — 25 июля 2026 г. в 09:12:21.456
🎓 Работы выпускников. Как научить ИИ читать русский рукописный текст — и уместить его в лёгкую модель Бахер Мохаммад, выпускник магистратуры ФТИИ по программе «Большие данные и машинное обучение» (научный руководитель — Пётр Гладилин), добивается, чтобы ИИ хорошо распознавал русский текст с картинок — даже кривой почерк или размытую вывеску — и при этом оставался лёгким. Сильные OCR-модели для русского обычно либо огромные, либо маленькие, но с кучей ошибок. Он зашёл с двух сторон. Сначала выжал максимум из небольшой открытой модели и придумал аккуратный способ «сливать» две версии модели без конфликта — метод Decoupled SLERP. Когда стало ясно, что 100-миллионная модель не тянет всё разнообразие рукописного русского, взял модель посильнее (2 млрд параметров) и сжал её вдвое своим методом ROCKET — за 5 часов на одной видеокарте, без обучения с нуля. Итог делает вдвое меньше ошибок на рукописном русском, чем прежняя лучшая «лёгкая». Где пригодится: мобильные сканеры документов, приложения для незрячих — читать вывески, этикетки лекарств, меню в реальном времени. А сами методы ROCKET и Decoupled SLERP работают не только с OCR — их можно применять и к большим языковым моделям. Сейчас Бахер — ML-исследователь в MWS AI (ИИ-направление МТС): участвовал в Cotype-VL (мультимодальная модель на 32 млрд параметров, уже работает у корпоративных клиентов), а научную часть ведёт в лаборатории LEAD — совместной у MWS AI и ИТМО. Дальше — голосовые модели и публикации на конференциях уровня A*. Репозиторий: github.com/mts-ai/ROCKET Препринт: arxiv.org/abs/2602.11008 #работы_выпускников

