Год назад я не понимал, почему одна и та же нейросеть на одном запросе выдаёт шедевр, а... — 12 июля 2026 г. в 14:03:03.501
Год назад я не понимал, почему одна и та же нейросеть на одном запросе выдаёт шедевр, а на другом — шестипалую руку и глаза в разные стороны. Списывал на «не тот промпт». А потом полез разбираться, как это вообще работает внутри. И многое встало на места. Если очень коротко и без матана — большинство генераторов картинок сегодня это диффузионные модели. Логика такая: модель училась не рисовать с нуля, а наоборот — брать нормальную картинку, постепенно засыпать её шумом до состояния телевизора без сигнала, и запоминать, как этот процесс выглядит на каждом шаге. А потом её просят сделать всё в обратную сторону. Даёшь ей квадрат чистого шума и текст — «женщина в красном пальто на мокрой улице ночью» — и она шаг за шагом «отчищает» этот шум так, чтобы в итоге он превратился в картинку, подходящую под описание. Отсюда, кстати, растут ноги у знаменитого «шестого пальца». Модель не считает пальцы. Она угадывает, как должен выглядеть кусок изображения на следующем шаге. Иногда угадывает мимо. Разные генераторы — это разные компромиссы внутри этой же логики. Flux — линейка от Black Forest Labs, тех же людей, что делали Stable Diffusion. Сильна в фотореализме, хорошо держит анатомию и текст на картинке (наконец-то вывески читаются). Есть открытые версии, которые можно крутить локально или через API — то есть это про контроль и кастомизацию. GPT Image (тот, что внутри ChatGPT) — история про другое. Там сильная связка с языковой моделью. Ты не столько «пишешь промпт», сколько объясняешь задачу. Он понимает контекст диалога, правит по кусочкам, нормально работает с текстом внутри картинки, с макетами, с инфографикой. Для маркетинга это часто важнее, чем «красивость». Nano Banana — это гугловский Gemini-шный редактор изображений (внутреннее название так прижилось, что его вынесли наружу). Его фишка не в генерации с нуля, а в редактировании: поменять фон, переодеть героя, сохранить лицо между кадрами, собрать серию в одном стиле. Для контент-маркетинга это, по-моему, вообще главный сдвиг последнего года — стабильность персонажа между картинками. Раньше это была боль. Что из этого следует для работы с контентом. Стоимость визуала за последние пару лет упала не в разы, а на порядок. Съёмка условной серии для карусели — фотограф, локация, реквизит, обработка — легко превращалась в цифру с пятью нулями. Сейчас та же серия делается за вечер и стоит как подписка на сервис. Я не говорю, что это заменяет живую съёмку под бренд — не заменяет. Но 80% рутинного визуала для соцсетей, рассылок, обложек, лендингов — да, закрывается генерацией. Второе — меняется сам процесс. Раньше: идея → бриф → дизайнер → правки → готово. Три дня в лучшем случае. Сейчас: идея → черновик за 2 минуты → смотришь, что не так → правишь словами → готово. Через час. И между «черновиком» и «готово» помещается штук двадцать итераций, которые в старом процессе никто бы не оплатил. Третье, менее очевидное. Модели разные не только по «качеству», но и по характеру. Flux даёт кинематографичность, но иногда слишком «глянцевую». GPT Image — про смысл и композицию, но фото у него часто узнаваемо «джипитишное». Nano Banana — про консистентность и правки. И вот выбор модели под задачу — это, кажется, новый навык, который отличает человека, который просто «пользуется нейронкой», от того, кто выстраивает под себя рабочий стек. Я сейчас как раз собираю для себя такой стек — какая модель под какой тип задачи, как их связывать между собой, где логично добавить свой шаг. Планирую отдельно расписать, когда докручу. Одна мысль напоследок. Понимание, как оно устроено внутри, не делает тебя художником. Но экономит кучу времени на этапе «почему опять не то». Ты перестаёшь спорить с моделью и начинаешь с ней договариваться. А ты на какой сейчас чаще всего рисуешь?

