InsightEdit: модель для редактирования изображений по текстовому запросу
InsightEdit: модель для редактирования изображений по текстовому запросу Учёные разработали модель InsightEdit, которая умеет добавлять, удалять и заменять объекты на изображениях по текстовому запросу. Для обучения модели они создали датасет AdvancedEdit с помощью автоматизированного пайплайна. В качестве исходных данных использовали датасет Pixels, содержащий более миллиона фотографий высокого разрешения. Процесс создания датасета включал генерацию описаний изображений (caption), использование LLM для создания списка объектов, генерацию масок с помощью GroundedSAM и фильтрацию масок с низким уровнем уверенности. Затем были составлены инструкции для редактирования и сгенерированы отредактированные изображения с помощью инпейнтинга. Модель состоит из трёх модулей: понимания, объединения и генерации. Модуль понимания анализирует текстовый запрос, модуль объединения улучшает взаимодействие запроса и изображения, а модуль генерации создаёт итоговое изображение. Качество модели оценивается с помощью различных метрик, включая CLIPScore, PSNR, SSIM, LPIPS и VIEScore.