Alibaba выпустила модель Qwen-Image-2.1: генератор и редактор изображений с поддержкой RGBA
Подробнее
Pandaily
pandaily.com

Alibaba выпустила модель Qwen-Image-2.1: генератор и редактор изображений с поддержкой RGBA

Команда Alibaba представила открытую модель Qwen-Image-2.1, которая является унифицированным инструментом для генерации и редактирования изображений на основе текста. Визуальный генерационный стек этой модели использует около 7 миллиардов параметров, распределенных по 32 слоям DiT с одним потоком.

Компания позиционирует этот релиз как компактную альтернативу, способную достигать результатов класса 2K, обеспечивать качественную типографику и портретное освещение, а также демонстрировать высокую производительность относительно вычислительных затрат на потребительских графических процессорах, таких как карта уровня RTX 3090.

Веса и демонстрационные версии модели доступны на платформах Hugging Face, ModelScope и GitHub. Это отличается от недавнего выпуска omnimodal language Qwen3.8-Omni-Flash от Alibaba, который был сосредоточен на аудиовизуальном чате с длинным контекстом, а не на синтезе пикселей.

Четыре ключевых заявления определяют возможности модели. Поддержка нативного формата RGBA позволяет одной и той же контрольной точке генерировать или редактировать прозрачные слои, а также извлекать объекты из фотографий без необходимости использования отдельной модели маскирования. Это особенно полезно для создания стикеров, композитинга и готовых к печати вырезок.

Функционал редактирования поддерживает до десяти эталонных изображений для создания групповых композиций с сохранением идентичности, виртуальной примерки и изменения интерьера. При этом круги, нанесенные мазки или внешние маски позволяют локализовать изменения, предотвращая полное стирание неизмененных областей при глобальном рестайлинге.

Архитектурные улучшения, включая повторное использование внимания смешанной гранулярности и кэша KV-префикса, призваны поддерживать интерактивность многоэтапного редактирования, исключая необходимость повторного кодирования каждого предыдущего кадра с нуля.

Поддерживаемые соотношения сторон варьируются от квадратного формата 2048 до ультрашироких и вертикальных форматов для телефонов.

Согласно таблице лидеров самой команды Qwen, 7-миллиардная генеративная модель превосходит большинство закрытых систем обработки изображений, которые она сравнивала. Тем не менее, независимые общедоступные бенчмарки пока ограничены и следует рассматривать их как заявления вендора до момента их воспроизведения третьими сторонами.

Практическая реализация имеет такое же значение, как и результаты тестирования. Конвейеры Diffusers охватывают запросы типа «текст в изображение», «редактирование» и «стиль стикера RGBA», а наличие хуков для разгрузки ЦП обеспечивает более жесткие бюджеты видеопамяти, а генераторы с возможностью задания начального значения позволяют проводить воспроизводимые тесты по направлению художественного замысла.

Коммерческое ограничение связано с лицензированием: Qwen-Image-2.1 распространяется под Лицензионным соглашением Qwen Research, которое запрещает коммерческое использование. Бизнесу необходимо отдельно подавать заявку на грант.

Однако для исследователей, независимых студий и любителей этот открытый набор весов представляет собой функциональный мультимодальный стек изображений, объединяющий прозрачность и многоэтапное редактирование в одном пакете на 7 миллиардов параметров, вместо того чтобы требовать облачного API для каждого эксперимента.

Популярное