Кто работал с рецептурными данными, тот знает этот ад. “Light mozzarella”, “fat free pa... — 27 мая 2026 г. в 18:12:00.586
Кто работал с рецептурными данными, тот знает этот ад. “Light mozzarella”, “fat free parmesan”, “kraft shredded triple cheddar cheese with a touch of philadelphia” — всё это не кулинарная онтология, а мусорный ветер с сайтов рецептов. Если его не прибрать, модель начинает думать, что «куриная грудка без кожи» и «курица» — это совершенно разные сущности. У системы FlavorGraph, с которой авторы себя сравнивают, такие артефакты заметны. В соседях курицы там могут вылезать “boneless skinless chicken” и рандомные бренды. У Epicure словарь чище, и это сразу видно. Третье — важное разделение вопросов. Cooc отвечает: с чем это обычно готовят? Chem отвечает: что близко по ароматическому профилю? С кулинарной точки зрения разница принципиальная. Одно дело — культурная привычка. Другое — сенсорное родство. Да, иногда они совпадают. Но часто нет. И когда авторы показывают, что добавление химического сигнала расширяет спектр различимых категорий, это уже не пустая игрушка. Это нормальный методологический ход. Это, конечно, не «ИИ понял вкус», но появилась ось, по которой можно отдельно смотреть контекст рецепта и ароматическую близость. Это полезно. Что вызывает вопросы Теперь — большая ложка дёгтя. Корпус данных радикально несбалансирован. Восточноазиатских рецептов в обучающей выборке — около полутора миллионов. Южноазиатских — сорок семь тысяч. Латиноамериканских — сорок. Не сорок тысяч. Сорок. Восточноевропейских, включая русские — сто пятьдесят четыре тысячи, и за этой цифрой стоит ровно один источник: пользовательский сайт «Поварёнок». Вот тут у меня, как у русского повара, начинается нервный тик. Никаких сборников рецептур. Никаких технологических карт. Никакой Александровой-Игнатьевой. Никакого Похлёбкина. Никакой советской нормативной базы. Никакой серьёзной академической опоры. Русская и советская кухня представлены максимально стрёмным сайтом домашних рецептов, где рядом могут жить нормальные щи, салат «Нежность» с ананасом и селедкой и майонезная фантазия под названием «Муж в восторге». Это не значит, что данные бесполезны. Но надо понимать цену такого представления. Когда модель уверенно выделяет восточноевропейский кластер, это не «карта русской кухни». Это карта того, как один пользовательский сайт отражает часть домашней кулинарной практики. Разница огромная. Второй вопрос — артефакты не опубликованы. В конце статьи прямо сказано: код и обученные модели пока не выкладываются. Для инженерной работы это слабое место. Выводы есть, графики есть, красивые кластеры есть, а пощупать руками и проверить независимо нельзя. Ну такое. На кухне это называлось бы: «соус отличный, я пробовал, но вам не дам». Не научно. Третий момент — химия покрывает меньше трети словаря. Из 1790 канонических ингредиентов прямую химическую сигнатуру через FlavorDB получают только 523. Остальные 1267 подключаются к химическому сигналу опосредованно: через цепочку соседей, узлов и соединений. Это не преступление. Так можно делать. Но надо честно понимать, что для большинства продуктов «химическая близость» здесь не прямая, а вычисленная через посредников. То есть это уже не чистая химия, а конструкция поверх графа. Работающая конструкция, возможно полезная. Но не надо делать вид, что модель нюхала укроп. Четвёртый момент — и, пожалуй, самый принципиальный — модель моделирует следствие и называет его причиной. Авторы заявляют как обнаружение: «культурная традиция структурирует совместное использование ингредиентов сильнее, чем нутрициологическая категория». Это правда. Но это правда того же рода, что «мокрый асфальт сильнее коррелирует с грозой, чем сухой». Сама по себе ничего не объясняет.

