🤓 Сегодня в рубрике #разбираемся_в_понятиях — технология, стоящая за большинством совр... — 6 июля 2026 г. в 12:00:05.209
🤓 Сегодня в рубрике #разбираемся_в_понятиях — технология, стоящая за большинством современных генераторов изображений. Вы пишете текстовый запрос, и через пару мгновений перед вами появляется готовая картинка. Интуитивно кажется, будто нейросеть «рисует» её с нуля, постепенно добавляя детали. На деле всё ровно наоборот: она движется от хаоса к структуре. 🧑🏻💻 Во время обучения модель берёт реальные изображения и методично их разрушает. Она добавляет шум (случайные искажения) снова и снова, пока от исходной картинки не остаётся бессмысленный набор пикселей. Параллельно она запоминает, как выглядел каждый шаг разрушения. Когда этот навык доведён до совершенства, процесс запускают в обратную сторону: модель начинает шаг за шагом вычитать шум, пока из «пиксельной каши» не проявится осмысленное изображение. 🎯 Такой подход выбран не случайно. Прямая генерация «с нуля» — невероятно сложная задача: модели пришлось бы сразу создавать готовое изображение, не имея промежуточных ориентиров. Диффузионные модели идут другим путём: они разбивают задачу на множество маленьких этапов. 🤔 Но возникает вопрос: как модель понимает, что именно должно проявиться? Здесь в игру вступает ваш промпт. Он кодируется в числовой вектор и на каждом этапе очистки «подсказывает» модели, в каком направлении двигаться. Именно благодаря этому «закат над морем» и «портрет в стиле Ван Гога» при одинаковой механике дают совершенно разный результат. 💫 Диффузионные модели перевернули представление о том, как машина может «творить». Это уже не подбор похожих образов из базы данных, а создание структуры заново — из чистой случайности, направляемой заданным смыслом.

