Раньше для генерации, редактирования и работы с прозрачностью требовались отдельные модели или сложные пайплайны. Теперь Alibaba объединила эти функции в одной компактной модели Qwen-Image-2.1, представив её как открытый исходный код.
Qwen-Image-2.1 использует облегчённую архитектуру с 7 миллиардами параметров в компоненте визуальной генерации. Несмотря на компактный размер, модель обеспечивает высокое качество изображений. Эффективность вывода, особенно при редактировании с несколькими входными изображениями, достигается за счёт архитектуры внимания со смешанной гранулярностью и повторного использования KV-кеша.
Модель теперь нативно поддерживает работу с прозрачностью, интегрируя возможности, ранее доступные только в отдельной модели Qwen-Image-Layered. Qwen-Image-2.1 может:
- Генерировать обычные изображения или изображения с прозрачным каналом по текстовому запросу.
- Редактировать прозрачные слои, например, менять выражение лица на прозрачном фоне или текст в слое.
- Извлекать нужные объекты из фотографий как отдельные слои с прозрачностью (RGBA).
Возможности редактирования Qwen-Image-2.1 расширились:
- До 10 референсных изображений: Модель способна объединять несколько объектов или элементов в одну композицию. Примеры включают создание групповых портретов из отдельных лиц, сборку полного комплекта одежды для виртуальной примерки из пяти предметов или обустройство комнаты из десяти изображений мебели.
- Точечное редактирование: Пользователь может указывать области для изменений с помощью кругов, закрашенных аннотаций или отдельных масок. Это позволяет удалять объекты, менять цвет волос или добавлять элементы в конкретные части изображения, а также создавать простые анимации последовательными изменениями.
- Сохранение деталей: Улучшена точность сохранения черт лица при редактировании портретов и консистентность продуктов (текст, текстуры, форма) при их изменении.
- Широкий спектр задач: Поддерживаются панорамы, инфографика и раскадровки, что делает модель гибкой для различных приложений визуального сторителлинга.
Визуальное качество также улучшено, особенно в части типографики и портретов. Рендеринг текста учитывает не только содержание, но и стиль, расположение и общую композицию. В портретах улучшены освещение и мелкие детали, что придаёт изображениям более реалистичный вид.
Объединив генерацию, редактирование и работу с прозрачностью в компактной модели на 7B параметров, Qwen-Image-2.1 упрощает рабочие процессы для дизайнеров и разработчиков. Модель становится универсальным инструментом для создания контента, e-commerce и визуального сторителлинга. Однако Alibaba пока не опубликовала подробные результаты сравнений с конкурентами, лишь указав на наличие внутреннего бенчмарка Qwen-Image-Bench.