Заказывал картинку для презентации — попросил бизнесмена с ноутбуком в костюме. Думал, ... — 5 июля 2026 г. в 17:54:02.841
Заказывал картинку для презентации — попросил бизнесмена с ноутбуком в костюме. Думал, будет просто. А вышло вот что: костюм вроде нормальный, ноутбук на месте, а вот кисти рук... На правой — шесть пальцев. На левой — семь. И один палец торчит из уха. Поздравляю: ты только что открыл главный секрет нейросетей. Они рисуют космос, фантастических существ и Да Винчи — идеально. Но когда дело доходит до рук, текста или отражений — всё идёт наперекосяк. Мы собрали топ вещей, которые ИИ принципиально не умеет рисовать. И разобрались почему. --- Руки — абсолютный чемпион абсурда Шесть пальцев. Семь. Пальцы разной длины на одной ладони. Сросшиеся в «весло». ИИ буквально «забывает», что у человека пять пальцев — и лепит сколько получится. Почему так? Рука — самый сложный объект в природе. 27 костей, десятки мышц, бесконечное количество поз и ракурсов. Каждый раз это новая конфигурация. Нейросеть не «понимает» анатомию. Она запоминает паттерны пикселей. А руки в этих паттернах — как талантливый музыкант, который никогда не учил ноты, но случайно попадает в мелодию. Иногда. --- Текст на вывесках — отдельный кошмар Вывеска «COFFEE» превращается в «C0FF33». Кириллица вообще катастрофа — буквы сливаются, переворачиваются, один символ из четырёх похож на иероглиф. Проблема фундаментальная: задача генерации текста — это по сути OCR наоборот (нейросеть «забывает» буквы, которые должна была бы распознавать). Нейросеть для картинок не обучена буквам как символам. Она «помнит» форму слова целиком — но если в обучающей выборке это слово встречалось редко, нейросеть просто забывает начертание и рисует «впечатление от слова». Длинные слова — вообще катастрофа. ИИ запоминает начало, теряет середину, и буквы на выходе — как пароль, который ты вводишь в пьяном виде. --- Достопримечательности — знакомо, но криво Эйфелева башня с неправильным количеством ярусов. Статуя Свободы без факела или с кривым лицом. Биг-Бен, где стрелки часов указывают на разное время. Модель знает «это похоже на Эйфелеву башню» — но она никогда не видела чертежей. Она видела тысячи фотографий с разных ракурсов в разном свете. И генерирует «впечатление» от здания — а не его геометрию. Это как если бы ты описывал достопримечательность иностранцу по памяти, а он потом рисовал по твоему описанию. Что-то да будет не так. --- Логотипы — абстракция, которую ИИ не переваривает Логотип Apple превращается в яблоко с зубами. McDonald's теряет одну арку — или обе, или они становятся фиолетовыми. Nike swoosh искривляется до неузнаваемости. Логотип — это компактный высокоинформативный паттерн. Искажение даже на пиксель ломает узнаваемость. А нейросеть обожает «дорисовывать» детали, которых нет в оригинале. --- Бонус: отражения и зеркала Человек в зеркале смотрит в другую сторону, одет иначе, или вообще другой человек. Отражение — это геометрическая трансформация в трёхмерном пространстве. А нейросеть не «видит» это пространство. Она генерирует 2D-картинку — и просто лепит туда «что-то отражающееся». --- Почему это не починить просто? Проблема в архитектуре диффузионных моделей. Они обучены на статичных данных, а руки, текст и отражения — это динамические задачи, требующие понимания трёхмерного пространства и причинно-следственных связей. Современные модели стали заметно лучше справляться с текстом. Но всё равно косячат на нестандартных шрифтах. Прогресс есть — но «последняя миля» оказалась самой сложной. Косяки стали изящнее. Но никуда не делись. --- Ставьте 🔥, если попадались на таких косяках! Пишите в комментариях, какой косяк ИИ самый нелепый на ваш взгляд.

