🔬 Почему ИИ проваливается на химических формулах из патентов
🔬 Почему ИИ проваливается на химических формулах из патентов Миллионы химических формул в патентах и статьях существуют только как картинки. Чтобы искать по ним, компьютеры должны «читать» рисунки. Задача казалась решённой — пока не взяли реальные документы. Исследователи во главе с Yani Guan (препринт на arXiv) взяли нейросеть Qwen2.5-VL-7B — модель, которая видит и понимает изображения, — и проверили, как она распознаёт химические структуры (OCSR: превращение рисунка формулы в текстовое описание). На аккуратных синтетических картинках точность — выше 91%. На настоящих патентах — меньше 16%. Провал в шесть раз! Причина проста: синтетика «слишком идеальная» — чистые линии, ровные углы. А в реальных документах — сканы, шрифты, помехи, рукописные пометки. Секрет, который нашли авторы: добавляй в обучение настоящие размеченные примеры из патентов. Точность на тесте ACS выросла с 15% до 46%, когда доля реальных данных достигла половины обучающей выборки. Ещё сюрприз: популярные «ускорители» обучения — LoRA для зрительной части модели — помогают не всем. Qwen — ноль эффекта, а InternVL3-8B — плюс 23–35 пунктов. Вывод: прокачку модели нужно подбирать под конкретную задачу, а не по трендам. Урок шире химии: любую нейросеть, обученную на синтетике, проверяйте на реальных данных — иначе «почти решённая» задача рушится в бою. А вы доверяете моделям, обученным на синтетике? Делитесь 👇 #ИИ #наука #химия