Новая версия нейросети Kandinsky 2.1 от Сбера
Сбер выпустил новую версию своей нейросети Kandinsky 2.1
Kandinsky 2.1 генерирует картинки по текстовому описанию на русском или английском языках, а также — вариации входного изображения, совмещает два изображения и изменяет изображение по текстовому описанию.
Архитектура Kandinsky 2.1 базируется на латентной диффузии с добавлением Image prior модели для повышения качества генераций. Image prior модель была разработана и обучена для маппинга текстов и изображений, в основе которой лежит трансформерная архитектура.
После обучения Image prior модели была обучена основная модель Text2Image, в архитектуре которой Image prior модель DiffusionMapping использовалась для маппинга входного текстового описания в визуальный эмбеддинг CLIP. Далее он применялся в обучении и инференсе диффузионной модели. Конечный блок — декодер, который из латентного представления позволяет получить финальное синтезированное изображение.
В отличие от предыдущих реализаций, в модели Kandinsky 2.1 используется новый декодер MoVQ вместо VQGAN, что позволяет значительно повысить качество генераций.
Среди нескольких возможных способов использования генеративной модели мы особое внимание уделено возможности смешивания изображений. Для этого в обученную диффузионную модель подается два визуальных эмбеддинга CLIP. И далее декодер восстанавливает “смешанное” изображение.