Alibaba представила Qwen Image 3.0 — новое поколение своей модели для создания изображений. Разработчики сделали основной упор на генерацию текста, многоязычные макеты и работу со сложными композициями, в которых нужно одновременно разместить заголовки, подписи, иллюстрации, таблицы и другие элементы.
Компания заявляет, что модель способна воспроизводить символы размером до 10 пикселей, поддерживает 12 языков и более 100 визуальных стилей. Ещё одно обещанное улучшение — создание сложного макета за один проход без последовательной дорисовки отдельных блоков. Qwen Image 3.0 уже доступна пользователям через режим генерации изображений в Qwen Chat.
Qwen Image 3.0, как утверждает Alibaba, может корректно отображать текст размером до 10 пикселей. Такой уровень подходит для подписей к графикам, мелких элементов интерфейса, сносок, ценников, этикеток и информационных карточек.
Работа с типографикой была одной из основных особенностей семейства с первого выпуска Qwen-Image. Исходная модель использовала архитектуру MMDiT с 20 млрд параметров и обучалась поэтапно: сначала на простых надписях, затем на более сложных текстовых конструкциях и целых абзацах. Разработчики отдельно выделяли качество китайских и английских символов.
Версия Qwen-Image-2512, выпущенная в декабре 2025 года, улучшила композицию текста и изображения, детализацию лиц и естественных материалов. Команда заявляла, что модель прошла более 10 тыс. слепых сравнений на собственной площадке AI Arena.
Qwen-Image 2.0 появилась 10 февраля 2026 года. Она получила поддержку инструкций объёмом до тысячи токенов, нативное разрешение 2K и возможность создавать инфографику, презентационные страницы, плакаты и комиксы. Генерация и редактирование были объединены в одном режиме, а архитектура стала компактнее и быстрее.
Третья версия продолжает ту же линию, но переносит акцент с отдельных надписей на полноценную визуальную верстку. Модель должна понимать, где расположить текстовые блоки, как выстроить иерархию и каким образом связать надписи с объектами на изображении.
Под сложным макетом Alibaba подразумевает композицию из нескольких типов элементов: текста, фотографий, декоративной графики, схем, пиктограмм и фоновых объектов. Пользователь описывает итоговую страницу одним запросом, после чего модель самостоятельно распределяет элементы по холсту. Предыдущие генераторы обычно требуют серии итераций.
Alibaba заявляет о поддержке текста на 12 языках. Полный перечень и раздельные показатели точности для каждого языка в доступной версии анонса не приведены. Одна модель сможет создавать варианты одного плаката или карточки товара для разных рынков, сохраняя общую композицию.
Модель должна не просто написать правильные слова, но и заново подстроить размер, межстрочный интервал и положение каждого блока. Реальное качество этой функции станет понятно после тестирования одинаковых макетов на всех заявленных языках.
Qwen Image 3.0 поддерживает свыше 100 стилистических направлений. В анонсе речь идёт о способности воспроизводить разные визуальные способы подачи. Пользователь сможет запросить фотореализм, журнальную иллюстрацию, техническую инфографику, рисованный комикс, рекламную фотографию или другой тип оформления. Вероятно, часть вариантов доступна в интерфейсе как готовые настройки, а часть вызывается обычным текстовым описанием.
Пользователи могут проверить Qwen Image 3.0 в веб-интерфейсе Qwen Chat. В сервисе предусмотрен отдельный режим работы с изображениями. Для доступа к полному набору функций может потребоваться вход в аккаунт.
Пока неясно, какие ограничения действуют для бесплатных пользователей, сколько изображений разрешается создавать и появится ли отдельный программный интерфейс для разработчиков.
Официальный репозиторий Qwen-Image на GitHub в момент проверки всё ещё указывал Qwen-Image 2.0 как последнее крупное поколение. На странице команды в Hugging Face также не было отдельной опубликованной модели Qwen Image 3.0.
Это означает, что релиз пока относится прежде всего к облачному продукту. Статус открытых весов, лицензия, размер модели, требования к видеопамяти и возможность локального запуска не подтверждены.
Команда Qwen ранее выпускала веса отдельных версий Qwen-Image, включая исходную модель и Qwen-Image-2512. История семейства показывает, что публикация модели может происходить позднее запуска в чате, но Alibaba пока не объявила такой план для версии 3.0.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.