Alibaba выпустила Qwen-Image 3.0 Pro через Qwen Cloud, интегрировав свою модель изображений третьего поколения в API-процессы для международ...

Alibaba выпустила Qwen-Image 3.0 Pro через Qwen Cloud, открыв для международных разработчиков модель третьего поколения в виде API-рабочего процесса.
Основной акцент этого релиза — не генерация отдельных красивых изображений, а создание изображений, применимых в реальной работе. Ключевые улучшения включают:
AIBase также сообщила о более дешёвой версии Standard. Публичная страница модели Qwen Cloud, изученная в данной статье, чётко показывает Pro-модель и её цены; однако международная страница модели Standard и полный тарифный лист не были найдены отдельно в одном публичном документе.

Модель также вошла в рейтинг Text-to-Image Arena. По состоянию на 4 августа 2026 года Arena указывает qwen-image-3.0-pro как одну из проприетарных моделей изображений с лидирующими предварительными показателями. На этом снимке это самая высокорейтинговая модель китайской разработки, но в живом общем рейтинге она не занимает второе место среди всех моделей.
AIBase сообщает, что Alibaba выпустила две версии:
| Модель | Позиционирование | Сообщаемая стартовая цена |
|---|---|---|
| Qwen-Image 3.0 Pro | Флагманская версия более высокого качества | 0,04 доллара США за изображение |
| Qwen-Image 3.0 Standard | Универсальная версия по более низкой цене | 0,03 доллара США за изображение |
Официальная страница Pro-модели Qwen Cloud в настоящее время публикует более детальные международные цены:
| Позиция Qwen-Image 3.0 Pro | Официальная цена Qwen Cloud |
|---|---|
| Вход 1K изображений | 0,003 доллара США за изображение |
| Вход 2K изображений | 0,003 доллара США за изображение |
| Выход 1K изображений | 0,04 доллара США за изображение |
| Выход 2K изображений | 0,075 доллара США за изображение |
Это означает, что широко цитируемые «0,04 доллара США за изображение» относятся к стартовой цене выхода 1K для версии Pro. Выход 2K стоит дороже.
Страница цен может измениться в любой момент, поэтому производственные приложения должны считывать актуальный тарифный лист Qwen Cloud или Alibaba Cloud Bailian, а не зашивать сообщаемые СМИ цены в долгосрочные бюджеты.
Alibaba резюмирует тему Qwen-Image 3.0 одним словом: реализм.
Компания разделяет эту концепцию на три измерения:
Эти три измерения объясняют, почему Qwen-Image 3.0 ориентирован на производственные сценарии, а не только на генерацию художественных изображений.
Генерация.
Qwen-Image 3.0 поддерживает до ~4.5K токенов во входных инструкциях.
Больший бюджет промпта позволяет пользователю в одном запросе указать несколько блоков, меток, ролей, формул, правил компоновки, визуальных стилей и иерархических требований.
Официальные примеры Alibaba включают:
Одна официальная демонстрация использовала промпт объёмом ~3.7K токенов и сгенерировала одно изображение 3×3 с девятью независимыми информационными панелями. Каждая панель имела свою тему, макет, текст, диаграммы и визуальный язык.
Alibaba описывает две формы сложности.
Горизонтальная сложность означает размещение множества параллельных элементов на одном холсте без их взаимных помех.
Примеры включают:
Вертикальная сложность означает понимание вложенных визуальных отношений.
Один официальный пример вкладывает следующие интерфейсы друг в друга:
Интерфейс VS Code
└── Чат-интерфейс Qwen
└── Интерфейс WeChat
└── Постер про кофе ручного заваривания
Модель должна сохранять узнаваемую структуру каждого интерфейса, одновременно соблюдая иерархические отношения, описанные в промпте.
Такая генерация особенно полезна, когда изображение ближе к проектному документу, чем к традиционной иллюстрации.
Второй акцент — точность рендеринга.
Alibaba заявляет, что Qwen-Image 3.0 в своих демонстрациях способен генерировать чёткий читаемый текст размером около 10 пикселей.
Официальные примеры включают:
Компания также подчёркивает улучшенные физические детали, включая:
В одной демонстрации редактирования модель восстановила утраченные фрагменты повреждённой традиционной картины, стараясь сохранить оригинальные мазки и композицию.
Показатель 10 пикселей взят из продуктовой демонстрации Alibaba. Его не следует интерпретировать как гарантию того, что каждый 10-пиксельный текст будет абсолютно точным на всех языках, шрифтах, макетах и сценариях генерации.
В производственной среде текст по-прежнему следует проверять на:
Важные юридические, медицинские, финансовые или продуктовые тексты должны проверяться вручную; добавление их после генерации с помощью обычных инструментов дизайна может оставаться более надёжным подходом.
Alibaba заявляет, что модель нативно поддерживает рендеринг 12 языков и более 20 шрифтов.
Её официальные примеры релиза включают контент на японском, корейском, испанском, китайском и английском языках.
Модель также нацелена на воспроизведение распространённых визуальных систем, включая:
Это не просто соответствие визуальному стилю. Модель должна понимать предполагаемую структуру изображаемых объектов.
Например, панель погоды должна содержать узнаваемые дату, местоположение, иконки, температуру и иерархию прогноза. Редактор кода должен иметь панели, вкладки, номера строк, область кода и панель инструментов в разумных местах.
Релизная статья Alibaba также описывает рабочие процессы, связывающие генерацию с внешним поиском знаний. Не следует предполагать, что модель обладает актуальными знаниями в реальном времени при каждом вызове API; текущая информация зависит от того, действительно ли в окружающем продукте или агентном рабочем процессе включены поиск или извлечение.
Одно из самых практичных изменений — объединение возможностей генерации и редактирования в модели qwen-image-3.0-pro.
Официальная документация API Alibaba Cloud указывает, что одна и та же модель поддерживает:
Генерацию изображения по тексту
Преобразование изображения в изображение
Редактирование изображений с использованием 1–3 опорных изображений
Это снижает необходимость выбирать одну модель для первичной генерации, а затем другую — для последующего редактирования.
Типичный рабочий процесс выглядит так:
Задачи редактирования могут включать:
Модель принимает от 1 до 3 опорных изображений для запросов на редактирование.
В текущей справочной документации API Alibaba Cloud Bailian для Qwen Image 3.0 указаны следующие характеристики для qwen-image-3.0-pro:
| Свойство API | Значение в документации |
|---|---|
| Режим генерации | Текст-в-изображение и изображение-в-изображение / редактирование |
| Опорные изображения | 1–3 для редактирования изображений |
| Форматы входных изображений | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Рекомендуемое разрешение входа | Ширина и высота от 384 до 2048 пикселей |
| Максимальный размер входного файла | 10 МБ на изображение |
| Диапазон выходных пикселей | Общее разрешение от 512×512 до 2048×2048 |
| Формат вывода | PNG |
| Количество изображений на запрос | 1–6 |
| Языки запросов в справочнике API | Китайский и английский |
| Время хранения URL результатов | 24 часа |
| Международный лимит скорости в Qwen Cloud | 1 запрос в минуту |
В более широких примечаниях к выпуску продукта указано, что отображаемые изображения могут содержать текст на 12 языках. Это отличается от формулировки в документации API, где указано, что положительные запросы поддерживают китайский и английский.
Иными словами:
Текущий международный пример API Alibaba использует конечную точку DashScope для мультимодальной генерации.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Замените {WorkspaceId} на идентификатор рабочей области, связанный с вашим ключом API.
Alibaba Cloud использует отдельные ключи API и конечные точки для своих развернутых регионов в Китае и Сингапуре. Ключи и конечные точки нельзя смешивать между регионами.
Официальный SDK использует MultiModalConversation для вызова Qwen-Image 3.0 Pro.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
Сгенерированный URL является временным. Alibaba Cloud заявляет, что ссылки на результаты хранятся только в течение 24 часов, поэтому приложения должны своевременно загружать одобренные выходные данные в собственное хранилище.
AIBase сообщает, что Qwen-Image 3.0 Pro занял первое место среди китайских моделей и второе место среди основных моделей.
Первая часть соответствует актуальному снимку Arena, рассмотренному в этой статье: Qwen-Image 3.0 Pro — это модель китайской разработки с самым высоким рейтингом в общей таблице «текст-в-изображение».
Вторая часть не подтверждается данными живого рейтинга от 4 августа 2026 года.
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Arena показывает:
qwen-image-3.0-pro11
Предварительные результаты
Данный балл близок к нескольким конкурирующим системам, доверительные интервалы пересекаются. Ярлык «предварительная оценка» также означает, что рейтинг может измениться по мере сбора дополнительных голосов.
Arena основана на сравнении пользовательских предпочтений и не является полным показателем для всех производственных задач.
Сам по себе он не доказывает превосходство в следующих аспектах:
Командам следует тестировать модель на собственных промптах и критериях приёмки.
Функциональный набор Qwen-Image 3.0 особенно актуален, когда изображение содержит одновременно визуальные и текстовые структуры.
Один длинный промпт может описать несколько кадров, персонажей, ракурсы камеры, реплики диалогов и переходы сцен в одной раскадровке.
Модель может использоваться для создания черновиков:
Все факты и формулы по-прежнему требуют проверки экспертами.
Потенциальные варианты использования включают:
Функция редактирования по референсным изображениям полезна, когда продукт или объект должен сохранять узнаваемость в разных вариантах.
Модель может создавать черновики:
Эти изображения являются визуальными концептами, а не готовым к продакшену фронтенд-кодом.
Большой лимит промптов и возможность рендеринга мелкого текста делают модель подходящей для изучения сложных редакционных макетов.
Если к финальной публикации предъявляются строгие требования к точности текста, текст всё равно следует заменять или проверять в программе вёрстки.
Ограничение в 4,5 тыс. символов не означает, что каждый промпт нужно заполнять до максимума.
Длинные промпты работают лучше всего только при чёткой структуре.
Чётко укажите:
Сначала опишите информационное содержимое, затем — визуальное оформление.
Контент:
- Главный заголовок
- Три преимущества продукта
- Таблица характеристик
- Дисклеймер в нижнем колонтитуле
Стиль:
- Минималистичный редакционный дизайн
- Тёмно-синий фон
- Белый шрифт без засечек
- Мягкий студийный свет
Не давайте модели просто набор фраз без порядка.
Объясните, к какой области относится каждый текстовый блок.
Заключайте в кавычки текстовое содержимое, которое должно появиться на изображении.
Сгенерированное написание всё равно следует проверять.
Для вложенных или многопанельных дизайнов объясняйте, какой элемент содержит какой.
Когда конкретный продукт, человек, упаковка или объект имеют решающее значение, редактирование по референсу обычно надёжнее, чем только текстовая генерация.
API поддерживает до шести выходных изображений за один вызов. Создание нескольких вариантов эффективнее, чем многократная доработка одного промпта без сравнения.
Просмотренная в этом обзоре страница API Alibaba Cloud изначально была помечена как ограниченный предварительный доступ, тогда как сообщения от 5 августа утверждали, что модель стала более широко доступна через платформу Qwen.
Таким образом, документация, требования к доступу, лимиты запросов и псевдонимы моделей могут быстро меняться.
Публичная страница Qwen Cloud чётко документирует Qwen-Image 3.0 Pro. AIBase сообщает, что Standard-версия стоит 0,03 доллара за изображение, однако в ходе этого обзора соответствующая публичная международная страница модели не была найдена.
Живой список Arena помечает Qwen-Image 3.0 Pro как проприетарную модель. Официального релиза открытых весов для версии 3.0 не обнаружено.
Возможности рендеринга текста в этой модели — значительное улучшение, но они не гарантируют идеальной типографики или фактической точности.
Сгенерированные API URL-адреса изображений действительны в течение 24 часов. Сразу сохраняйте нужные файлы.
Перед развёртыванием сгенерированных материалов необходимо изучить:
Qwen-Image 3.0 Pro — это флагманская модель третьего поколения Alibaba для генерации и редактирования изображений. Она поддерживает генерацию по тексту, редактирование с использованием до трёх референсных изображений, длинные промпты, многоязычный рендеринг текста и плотные визуальные макеты.
Qwen Cloud в настоящее время указывает цену 0,04 доллара за изображение при выходе 1K и 0,075 доллара за изображение при выходе 2K. Входные изображения для рабочих процессов 1K и 2K указаны по цене 0,003 доллара за каждое.
AIBase сообщает о запуске Standard-версии по цене от 0,03 доллара за изображение. На момент написания данного материала соответствующая публичная международная страница модели с полной официальной таблицей цен не была найдена, поэтому перед планированием бюджета разработчикам следует проверить актуальную консоль Qwen Cloud.
Alibaba заявляет о поддержке до примерно 4,5 тыс. токенов на вход. Увеличенный лимит предназначен для удовлетворения требований раскадровок, газет, учебных графических материалов, вложенных интерфейсов и других информационно насыщенных изображений.
Да. Тот же API-модель qwen-image-3.0-pro поддерживает преобразование изображения в изображение и запросы на редактирование с использованием одного-трёх референсных изображений плюс текстовой инструкции.
Демонстрации Alibaba показывают читаемый текст размером около 10 пикселей и сложные страницы LaTeX. Результаты по-прежнему могут различаться, поэтому важные орфографические написания, формулы, цены, юридический контент и названия брендов требуют ручной проверки.
Официального релиза открытых весов для Qwen-Image 3.0 Pro не обнаружено.
Официальные источники, рассмотренные здесь. Arena в настоящее время помечает модель как проприетарную.
В снимке Text-to-Image Arena от 4 августа 2026 года это самая высокорейтинговая модель китайской разработки: предварительное общее 5-е место, диапазон с 4-го по 9-е. Рейтинг Arena меняется по мере добавления новых голосов и моделей.
Arena](https://arena.ai/leaderboard/text-to-image): живой рейтинг предпочтений для сравнения моделей генерации изображений.
Qwen-Image 3.0 Pro разработан для задач генерации изображений, сочетающих визуальное качество с плотной информацией. Его емкость подсказок в 4,5K токенов, рендеринг мелкого текста, многоязычный вывод, понимание вложенных интерфейсов и реалистичные детали делают его особенно подходящим для раскадровок, плакатов, учебных диаграмм, интерфейсов и редактирования типографики.
Одна и та же API-модель поддерживает генерацию и редактирование, включая от одной до трех референсных изображений. Qwen Cloud в настоящее время оценивает вывод Pro от 0,04 доллара за изображение 1K и 0,075 доллара за вывод 2K.
Модель показывает сильные результаты в живом Text-to-Image Arena, но текущий рейтинг не поддерживает утверждение из заголовка источника о том, что она занимает
второе место в общем зачете. Отображается позиция пятого места с предварительными оценками и пересекающимися доверительными интервалами.
Основной прогресс заключается не просто в создании более эстетичных изображений; а в возможности преобразовывать более длинные и структурированные инструкции в редактируемые визуальные активы при относительно низкой стоимости API за изображение.
Начните с одной фразы и получите полноценный сайт за считанные минуты.