Введение
Alibaba выпустила Qwen-Image 3.0 Pro через Qwen Cloud, открыв для международных разработчиков модель третьего поколения в виде API-рабочего процесса.
Основной акцент этого релиза — не генерация отдельных красивых изображений, а создание изображений, применимых в реальной работе. Ключевые улучшения включают:
- Поддержка до 4.5K токенов во входном промпте
- Поддержка плотных макетов: газет, раскадровок, меню, экзаменационных листов, вложенных интерфейсов
- Рендеринг текста от ~10 пикселей
- Нативная поддержка 12 языков и более 20 шрифтов
- Более реалистичные кожа, волосы, материалы и мелкие текстуры
- Одновременная поддержка генерации по тексту и редактирования изображений в одной модели
- Цена API от 0,04 доллара США за 1K выходных изображений в Qwen Cloud
AIBase также сообщила о более дешёвой версии Standard. Публичная страница модели Qwen Cloud, изученная в данной статье, чётко показывает Pro-модель и её цены; однако международная страница модели Standard и полный тарифный лист не были найдены отдельно в одном публичном документе.

Модель также вошла в рейтинг Text-to-Image Arena. По состоянию на 4 августа 2026 года Arena указывает qwen-image-3.0-pro как одну из проприетарных моделей изображений с лидирующими предварительными показателями. На этом снимке это самая высокорейтинговая модель китайской разработки, но в живом общем рейтинге она не занимает второе место среди всех моделей.
Qwen-Image 3.0 Pro и Standard одновременно выходят в API
AIBase сообщает, что Alibaba выпустила две версии:
| Модель | Позиционирование | Сообщаемая стартовая цена |
|---|---|---|
| Qwen-Image 3.0 Pro | Флагманская версия более высокого качества | 0,04 доллара США за изображение |
| Qwen-Image 3.0 Standard | Универсальная версия по более низкой цене | 0,03 доллара США за изображение |
Официальная страница Pro-модели Qwen Cloud в настоящее время публикует более детальные международные цены:
| Позиция Qwen-Image 3.0 Pro | Официальная цена Qwen Cloud |
|---|---|
| Вход 1K изображений | 0,003 доллара США за изображение |
| Вход 2K изображений | 0,003 доллара США за изображение |
| Выход 1K изображений | 0,04 доллара США за изображение |
| Выход 2K изображений | 0,075 доллара США за изображение |
Это означает, что широко цитируемые «0,04 доллара США за изображение» относятся к стартовой цене выхода 1K для версии Pro. Выход 2K стоит дороже.
Страница цен может измениться в любой момент, поэтому производственные приложения должны считывать актуальный тарифный лист Qwen Cloud или Alibaba Cloud Bailian, а не зашивать сообщаемые СМИ цены в долгосрочные бюджеты.
Основная цель — генерация полезных и информационно насыщенных изображений
Alibaba резюмирует тему Qwen-Image 3.0 одним словом: реализм.
Компания разделяет эту концепцию на три измерения:
- Богатое содержание
- Достоверные детали
- Глубокие знания
Эти три измерения объясняют, почему Qwen-Image 3.0 ориентирован на производственные сценарии, а не только на генерацию художественных изображений.
Генерация.
Богатое содержание: промпт до 4.5K токенов
Qwen-Image 3.0 поддерживает до ~4.5K токенов во входных инструкциях.
Больший бюджет промпта позволяет пользователю в одном запросе указать несколько блоков, меток, ролей, формул, правил компоновки, визуальных стилей и иерархических требований.
Официальные примеры Alibaba включают:
- Сетку 3×3 с девятью различными образовательными и профессиональными инфографиками
- Газетный макет с плотным текстом
- Полную раскадровку
- Экзаменационный лист
- Интерфейсы, вложенные друг в друга
- Математические графики и формулы
- Карточки знаний с диаграммами, метками и иллюстрациями
Одна официальная демонстрация использовала промпт объёмом ~3.7K токенов и сгенерировала одно изображение 3×3 с девятью независимыми информационными панелями. Каждая панель имела свою тему, макет, текст, диаграммы и визуальный язык.
Горизонтальная и вертикальная сложность
Alibaba описывает две формы сложности.
Горизонтальная сложность означает размещение множества параллельных элементов на одном холсте без их взаимных помех.
Примеры включают:
- Девять панелей инфографики
- Меню с множеством категорий
- Многосценную раскадровку
- Сравнительные диаграммы
- Образовательные постеры с несколькими модулями
Вертикальная сложность означает понимание вложенных визуальных отношений.
Один официальный пример вкладывает следующие интерфейсы друг в друга:
Интерфейс VS Code
└── Чат-интерфейс Qwen
└── Интерфейс WeChat
└── Постер про кофе ручного заваривания
Модель должна сохранять узнаваемую структуру каждого интерфейса, одновременно соблюдая иерархические отношения, описанные в промпте.
Такая генерация особенно полезна, когда изображение ближе к проектному документу, чем к традиционной иллюстрации.
Достоверные детали: мелкий текст и реалистичные текстуры
Второй акцент — точность рендеринга.
Alibaba заявляет, что Qwen-Image 3.0 в своих демонстрациях способен генерировать чёткий читаемый текст размером около 10 пикселей.
Официальные примеры включают:
- Газетный контент с плотным текстом
- Академические страницы с формулами LaTeX
- Верхние и нижние индексы
- Греческие буквы
- Номера теорем
- Рукописные пометки
- Мелкие подписи в образовательных диаграммах
Компания также подчёркивает улучшенные физические детали, включая:
- Поры кожи
- Отдельные волоски
- Текстуру тканей
- Натуральные материалы
- Мелкие поверхностные повреждения
- Тушевые градиенты
В одной демонстрации редактирования модель восстановила утраченные фрагменты повреждённой традиционной картины, стараясь сохранить оригинальные мазки и композицию.
«Текст в 10 пикселей» — не абсолютная гарантия
Показатель 10 пикселей взят из продуктовой демонстрации Alibaba. Его не следует интерпретировать как гарантию того, что каждый 10-пиксельный текст будет абсолютно точным на всех языках, шрифтах, макетах и сценариях генерации.
В производственной среде текст по-прежнему следует проверять на:
- Орфографию
- Отсутствующие символы
- Пунктуацию
- Переносы строк
- Согласованность шрифтов
- Точность формул
- Точность названий брендов
Важные юридические, медицинские, финансовые или продуктовые тексты должны проверяться вручную; добавление их после генерации с помощью обычных инструментов дизайна может оставаться более надёжным подходом.
Глубокие знания: 12 языков, интерфейсы и контекст мира
Alibaba заявляет, что модель нативно поддерживает рендеринг 12 языков и более 20 шрифтов.
Её официальные примеры релиза включают контент на японском, корейском, испанском, китайском и английском языках.
Модель также нацелена на воспроизведение распространённых визуальных систем, включая:
- Веб-страницы
- Программные интерфейсы
- Окна чатов
- Игры
- Прямые трансляции
- Образовательные диаграммы
- Научные графики
Это не просто соответствие визуальному стилю. Модель должна понимать предполагаемую структуру изображаемых объектов.
Например, панель погоды должна содержать узнаваемые дату, местоположение, иконки, температуру и иерархию прогноза. Редактор кода должен иметь панели, вкладки, номера строк, область кода и панель инструментов в разумных местах.
Релизная статья Alibaba также описывает рабочие процессы, связывающие генерацию с внешним поиском знаний. Не следует предполагать, что модель обладает актуальными знаниями в реальном времени при каждом вызове API; текущая информация зависит от того, действительно ли в окружающем продукте или агентном рабочем процессе включены поиск или извлечение.
Генерация и редактирование в одной модели
Одно из самых практичных изменений — объединение возможностей генерации и редактирования в модели qwen-image-3.0-pro.
Официальная документация API Alibaba Cloud указывает, что одна и та же модель поддерживает:
-
Генерацию изображения по тексту
-
Преобразование изображения в изображение
-
Редактирование изображений с использованием 1–3 опорных изображений
Это снижает необходимость выбирать одну модель для первичной генерации, а затем другую — для последующего редактирования.
Типичный рабочий процесс выглядит так:
- Сгенерируйте первое изображение на основе подробного запроса.
- Используйте результат в качестве входного изображения.
- Попросите модель изменить выбранные элементы.
- Сохраните остальные аспекты — объект, композицию или стиль.
- При необходимости сгенерируйте несколько альтернативных вариантов.
Задачи редактирования могут включать:
- Замену одежды
- Замену фона или сцены
- Добавление или удаление объектов
- Комбинирование визуальных элементов из нескольких изображений
- Исправление текста
- Восстановление повреждённых фрагментов
- Перенос стиля
- Сохранение объекта при замене сцены
Модель принимает от 1 до 3 опорных изображений для запросов на редактирование.
Официальные ограничения API и формат вывода
В текущей справочной документации API Alibaba Cloud Bailian для Qwen Image 3.0 указаны следующие характеристики для qwen-image-3.0-pro:
| Свойство API | Значение в документации |
|---|---|
| Режим генерации | Текст-в-изображение и изображение-в-изображение / редактирование |
| Опорные изображения | 1–3 для редактирования изображений |
| Форматы входных изображений | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Рекомендуемое разрешение входа | Ширина и высота от 384 до 2048 пикселей |
| Максимальный размер входного файла | 10 МБ на изображение |
| Диапазон выходных пикселей | Общее разрешение от 512×512 до 2048×2048 |
| Формат вывода | PNG |
| Количество изображений на запрос | 1–6 |
| Языки запросов в справочнике API | Китайский и английский |
| Время хранения URL результатов | 24 часа |
| Международный лимит скорости в Qwen Cloud | 1 запрос в минуту |
В более широких примечаниях к выпуску продукта указано, что отображаемые изображения могут содержать текст на 12 языках. Это отличается от формулировки в документации API, где указано, что положительные запросы поддерживают китайский и английский.
Иными словами:
- Язык инструкций поддерживается на китайском или английском языке в документации.
- Сгенерированные изображения могут содержать текст на более широком наборе языков.
Вызов Qwen-Image 3.0 Pro с помощью cURL
Текущий международный пример API Alibaba использует конечную точку DashScope для мультимодальной генерации.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Замените {WorkspaceId} на идентификатор рабочей области, связанный с вашим ключом API.
Alibaba Cloud использует отдельные ключи API и конечные точки для своих развернутых регионов в Китае и Сингапуре. Ключи и конечные точки нельзя смешивать между регионами.
Редактирование изображений с помощью Python SDK
Официальный SDK использует MultiModalConversation для вызова Qwen-Image 3.0 Pro.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
Сгенерированный URL является временным. Alibaba Cloud заявляет, что ссылки на результаты хранятся только в течение 24 часов, поэтому приложения должны своевременно загружать одобренные выходные данные в собственное хранилище.
Производительность Arena: сильные результаты, но рейтинг требует контекста
AIBase сообщает, что Qwen-Image 3.0 Pro занял первое место среди китайских моделей и второе место среди основных моделей.
Первая часть соответствует актуальному снимку Arena, рассмотренному в этой статье: Qwen-Image 3.0 Pro — это модель китайской разработки с самым высоким рейтингом в общей таблице «текст-в-изображение».
Вторая часть не подтверждается данными живого рейтинга от 4 августа 2026 года.
Arena показывает:
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
- Модель:
qwen-image-3.0-pro - Разработчик: Alibaba
- Оценка: 1263 ±
11
- Статус:
Предварительные результаты
- Текущее место в рейтинге: 5-е место
- Диапазон позиций: 4–9-е место
- Показано голосов: 2 801
Данный балл близок к нескольким конкурирующим системам, доверительные интервалы пересекаются. Ярлык «предварительная оценка» также означает, что рейтинг может измениться по мере сбора дополнительных голосов.
Arena основана на сравнении пользовательских предпочтений и не является полным показателем для всех производственных задач.
Сам по себе он не доказывает превосходство в следующих аспектах:
- Точность текста
- Консистентность продукта
- Точность редактирования изображений
- Задержка
- Надёжность API
- Безопасное поведение
- Стоимость за каждый допустимый элемент
- Пригодность для коммерческого лицензирования
Командам следует тестировать модель на собственных промптах и критериях приёмки.
Наиболее подходящие сценарии использования модели
Функциональный набор Qwen-Image 3.0 особенно актуален, когда изображение содержит одновременно визуальные и текстовые структуры.
Раскадровки и планирование коротких драм
Один длинный промпт может описать несколько кадров, персонажей, ракурсы камеры, реплики диалогов и переходы сцен в одной раскадровке.
Образовательные и научно-познавательные графические материалы
Модель может использоваться для создания черновиков:
- Учебных иллюстраций
- Таблиц формул
- Научных плакатов
- Карточек знаний
- Вёрстки экзаменационных материалов
- Аннотированных иллюстраций
Все факты и формулы по-прежнему требуют проверки экспертами.
Электронная коммерция и реклама
Потенциальные варианты использования включают:
- Рекламные плакаты продуктов
- Многоязычные маркетинговые варианты
- Меню
- Описательные изображения продуктов
- Промо-баннеры
- Макеты для социальных сетей
Функция редактирования по референсным изображениям полезна, когда продукт или объект должен сохранять узнаваемость в разных вариантах.
Интерфейсы и концепт-дизайн продуктов
Модель может создавать черновики:
- Веб-страниц
- Интерфейсов приложений
- Стриминговых студий
- Игровых интерфейсов
- Вложенных UI-концепций
Эти изображения являются визуальными концептами, а не готовым к продакшену фронтенд-кодом.
Газеты, отчёты и сложная редакционная вёрстка
Большой лимит промптов и возможность рендеринга мелкого текста делают модель подходящей для изучения сложных редакционных макетов.
Если к финальной публикации предъявляются строгие требования к точности текста, текст всё равно следует заменять или проверять в программе вёрстки.
Практические рекомендации по промптам
Ограничение в 4,5 тыс. символов не означает, что каждый промпт нужно заполнять до максимума.
Длинные промпты работают лучше всего только при чёткой структуре.
- Определите холст
Чётко укажите:
- Соотношение сторон
- Целевое разрешение
- Ориентацию — горизонтальную или вертикальную
- Количество блоков
- Порядок чтения
- Описывайте контент и стиль отдельно
Сначала опишите информационное содержимое, затем — визуальное оформление.
Контент:
- Главный заголовок
- Три преимущества продукта
- Таблица характеристик
- Дисклеймер в нижнем колонтитуле
Стиль:
- Минималистичный редакционный дизайн
- Тёмно-синий фон
- Белый шрифт без засечек
- Мягкий студийный свет
- Распределите текст по конкретным областям
Не давайте модели просто набор фраз без порядка.
Объясните, к какой области относится каждый текстовый блок.
- Указывайте точные формулировки
Заключайте в кавычки текстовое содержимое, которое должно появиться на изображении.
Сгенерированное написание всё равно следует проверять.
- Описывайте иерархию между элементами
Для вложенных или многопанельных дизайнов объясняйте, какой элемент содержит какой.
- Используйте референсные изображения для задач, критичных к идентичности
Когда конкретный продукт, человек, упаковка или объект имеют решающее значение, редактирование по референсу обычно надёжнее, чем только текстовая генерация.
- Генерируйте несколько кандидатов
API поддерживает до шести выходных изображений за один вызов. Создание нескольких вариантов эффективнее, чем многократная доработка одного промпта без сравнения.
Текущие ограничения и особенности публикации
Официальная документация всё ещё дорабатывается
Просмотренная в этом обзоре страница API Alibaba Cloud изначально была помечена как ограниченный предварительный доступ, тогда как сообщения от 5 августа утверждали, что модель стала более широко доступна через платформу Qwen.
Таким образом, документация, требования к доступу, лимиты запросов и псевдонимы моделей могут быстро меняться.
Разная видимость документации для версий Pro и Standard
Публичная страница Qwen Cloud чётко документирует Qwen-Image 3.0 Pro. AIBase сообщает, что Standard-версия стоит 0,03 доллара за изображение, однако в ходе этого обзора соответствующая публичная международная страница модели не была найдена.
Модель является проприетарной
Живой список Arena помечает Qwen-Image 3.0 Pro как проприетарную модель. Официального релиза открытых весов для версии 3.0 не обнаружено.
Текст по-прежнему требует ручной проверки
Возможности рендеринга текста в этой модели — значительное улучшение, но они не гарантируют идеальной типографики или фактической точности.
URL-адреса изображений имеют ограниченный срок действия
Сгенерированные API URL-адреса изображений действительны в течение 24 часов. Сразу сохраняйте нужные файлы.
Коммерческое использование требует изучения соответствующих политик
Перед развёртыванием сгенерированных материалов необходимо изучить:
- Условия обслуживания Qwen Cloud
- Интеллектуальную собственность
- Использование товарных знаков
- Права на референсные изображения
- Конфиденциальность и права на изображение
- Региональные нормативы по AI-контенту
- Требования к раскрытию или водяным знакам
Часто задаваемые вопросы
Что такое Qwen-Image 3.0 Pro?
Qwen-Image 3.0 Pro — это флагманская модель третьего поколения Alibaba для генерации и редактирования изображений. Она поддерживает генерацию по тексту, редактирование с использованием до трёх референсных изображений, длинные промпты, многоязычный рендеринг текста и плотные визуальные макеты.
Сколько стоит Qwen-Image 3.0 Pro?
Qwen Cloud в настоящее время указывает цену 0,04 доллара за изображение при выходе 1K и 0,075 доллара за изображение при выходе 2K. Входные изображения для рабочих процессов 1K и 2K указаны по цене 0,003 доллара за каждое.
Существует ли модель Qwen-Image 3.0 Standard?
AIBase сообщает о запуске Standard-версии по цене от 0,03 доллара за изображение. На момент написания данного материала соответствующая публичная международная страница модели с полной официальной таблицей цен не была найдена, поэтому перед планированием бюджета разработчикам следует проверить актуальную консоль Qwen Cloud.
Насколько длинным может быть промпт для Qwen-Image 3.0?
Alibaba заявляет о поддержке до примерно 4,5 тыс. токенов на вход. Увеличенный лимит предназначен для удовлетворения требований раскадровок, газет, учебных графических материалов, вложенных интерфейсов и других информационно насыщенных изображений.
Может ли Qwen-Image 3.0 редактировать существующие изображения?
Да. Тот же API-модель qwen-image-3.0-pro поддерживает преобразование изображения в изображение и запросы на редактирование с использованием одного-трёх референсных изображений плюс текстовой инструкции.
Может ли Qwen-Image 3.0 точно отображать мелкий текст?
Демонстрации Alibaba показывают читаемый текст размером около 10 пикселей и сложные страницы LaTeX. Результаты по-прежнему могут различаться, поэтому важные орфографические написания, формулы, цены, юридический контент и названия брендов требуют ручной проверки.
Является ли Qwen-Image 3.0 открытым?
Официального релиза открытых весов для Qwen-Image 3.0 Pro не обнаружено.
Официальные источники, рассмотренные здесь. Arena в настоящее время помечает модель как проприетарную.
Какое место Qwen-Image 3.0 Pro занимает в Arena?
В снимке Text-to-Image Arena от 4 августа 2026 года это самая высокорейтинговая модель китайской разработки: предварительное общее 5-е место, диапазон с 4-го по 9-е. Рейтинг Arena меняется по мере добавления новых голосов и моделей.
Связанные инструменты
- Qwen Cloud: международная платформа моделей Alibaba Cloud для тестирования моделей, получения доступа к API и просмотра актуальных цен.
- Qwen-Image 3.0 Pro: официальная страница модели с функциями, лимитами запросов, ценами и примерами cURL.
- Alibaba Cloud Bailian: управляемая платформа Alibaba Cloud для развёртывания и вызова моделей Qwen и сторонних моделей.
- DashScope Python SDK: официальный пакет Python, используемый в примерах API Qwen от Alibaba Cloud.
- [Text-to-Image
Arena](https://arena.ai/leaderboard/text-to-image): живой рейтинг предпочтений для сравнения моделей генерации изображений.
- Qwen Studio: официальная пользовательская платформа Qwen для тестирования поддерживаемых функций моделей.
Связанные ссылки
- Официальный анонс Qwen-Image 3.0: подробное описание Alibaba Cloud о богатом контенте, достоверных деталях и глубоких знаниях.
- Qwen-Image 3.0 Pro на Qwen Cloud: текущий обзор международной модели, цены, лимиты скорости и примеры API-запросов.
- Справочник API Qwen Image Generation and Editing 3.0: официальные параметры запросов, конечные точки, примеры кода, поддерживаемые форматы изображений и режимы ответов.
- Анонс мультимодальных моделей Alibaba Cloud: официальная сводка о сериях Qwen-Image 3.0 и Qwen-Audio 3.0.
- Рейтинг Text-to-Image Arena: живой рейтинг для проверки предварительного положения модели.
- Журнал обновлений рейтинга Arena: официальная запись о том, когда Qwen-Image 3.0 Pro был добавлен в рейтинг.
Резюме
Qwen-Image 3.0 Pro разработан для задач генерации изображений, сочетающих визуальное качество с плотной информацией. Его емкость подсказок в 4,5K токенов, рендеринг мелкого текста, многоязычный вывод, понимание вложенных интерфейсов и реалистичные детали делают его особенно подходящим для раскадровок, плакатов, учебных диаграмм, интерфейсов и редактирования типографики.
Одна и та же API-модель поддерживает генерацию и редактирование, включая от одной до трех референсных изображений. Qwen Cloud в настоящее время оценивает вывод Pro от 0,04 доллара за изображение 1K и 0,075 доллара за вывод 2K.
Модель показывает сильные результаты в живом Text-to-Image Arena, но текущий рейтинг не поддерживает утверждение из заголовка источника о том, что она занимает
второе место в общем зачете. Отображается позиция пятого места с предварительными оценками и пересекающимися доверительными интервалами.
Основной прогресс заключается не просто в создании более эстетичных изображений; а в возможности преобразовывать более длинные и структурированные инструкции в редактируемые визуальные активы при относительно низкой стоимости API за изображение.



