Как добиться стабильности образа персонажа в генеративных моделях
Как добиться стабильности образа персонажа в генеративных моделях Существует способ заставить генеративную модель создавать одного и того же персонажа при разных промптах. Это важно для сторителлинга и комиксов, где герой должен сохранять идентичность. Авторы исследования предлагают метод, который работает только с текстом, без исходного изображения. Сначала генерируется 128 изображений по одному промпту, затем извлекаются эмбеддинги через DINOv2 и выполняется кластеризация. Из кластеров выбирается самый крупный и плотный — в нём образ героя выглядит максимально однородно. На этом подмножестве проводится дообучение модели с помощью LoRA и текстовой инверсии. Цикл генерации, кластеризации и обучения повторяется 4–5 раз. Процедура занимает около 24 минут на одной GPU. Метод позволяет зафиксировать ключевые черты персонажа, но при смене промпта обучение нужно повторить. Сравнение с другими методами показывает, что предложенный подход («Sauce») обеспечивает баланс между соответствием промту и стабильностью образа. В перспективе авторы хотят адаптировать подход для работы с реальными фотографиями.