For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh/articles/qwen-image-3-0-pro-launches.md.
阿里巴巴通过 Qwen Cloud 推出 Qwen-Image 3.0 Pro,支持最长约 4.5K token 提示词、10 像素级文字、多语言密集排版,以及文生图与图像编辑;1K 输出 API 定价低至每张 0.04 美元。

阿里巴巴已通过 Qwen Cloud 推出 Qwen-Image 3.0 Pro,将第三代图像模型以 API 工作流形式开放给国际开发者。
本次发布的重心不在于生成单张精美的图片,而在于产出能够应用于实际工作的图像。其核心改进包括:
AIBase 还报道了价格更低的 Standard 版。本文所查阅的 Qwen Cloud 公开模型页面明确展示了 Pro 模型及其定价;但 Standard 版的国际模型页面和完整费率表未能在同一公开文档中独立找到。

该模型也已进入 Text-to-Image Arena 排行榜。截至 2026 年 8 月 4 日,Arena 将 qwen-image-3.0-pro 列为初步得分领先的专有图像模型之一。在该快照中,它是排名最高的中国开发模型,但在实时总榜上并未位列所有模型的第二名。
AIBase 报道称,阿里巴巴发布了两个版本:
| 模型 | 定位 | 报道起步价 |
|---|---|---|
| Qwen-Image 3.0 Pro | 更高质量的旗舰版 | 每张图像 0.04 美元 |
| Qwen-Image 3.0 Standard | 更低成本的通用版 | 每张图像 0.03 美元 |
Qwen Cloud 官方 Pro 模型页面目前列出了更详细的国际定价:
| Qwen-Image 3.0 Pro 项目 | 官方 Qwen Cloud 价格 |
|---|---|
| 1K 图像输入 | 每张 0.003 美元 |
| 2K 图像输入 | 每张 0.003 美元 |
| 1K 图像输出 | 每张 0.04 美元 |
| 2K 图像输出 | 每张 0.075 美元 |
这意味着广泛报道的“每张图像 0.04 美元”指的是 Pro 版 1K 输出的起步价格。2K 输出价格更高。
定价页面随时可能变更,因此生产环境应用应读取当前 Qwen Cloud 或阿里云百炼的最新费率表,而不是将媒体报道的价格硬编码到长期预算中。
阿里巴巴用两个字概括 Qwen-Image 3.0 的主题:真实。
该公司将该理念分为三个维度:
这三个维度解释了为何 Qwen-Image 3.0 面向生产力场景,而不仅仅是艺术图像生成。
生成。
Qwen-Image 3.0 支持最高约 4.5K Token 的指令输入。
更大的提示词预算允许用户在一次请求中指定多个区块、标签、角色、公式、布局规则、视觉风格和层级要求。
阿里巴巴的官方示例包括:
一项官方演示使用了约 3.7K Token 的提示词,生成了包含九个独立信息面板的单个 3×3 图像。每个面板都有自己的主题、布局、文字、图表和视觉语言。
阿里巴巴描述了两种形式的复杂度。
横向复杂度指在同一画布上放置多个平行的元素,同时不让它们相互干扰。
示例包括:
纵向复杂度指理解嵌套的视觉关系。
一项官方示例将以下界面嵌套在彼此内部:
VS Code 界面
└── Qwen 聊天界面
└── 微信界面
└── 手冲咖啡海报
模型需要保留每个界面可辨识的结构,同时遵循提示词中描述的层级关系。
当图像更接近设计文档而非传统插画时,这类生成方式尤为有用。
第二个重点是渲染精度。
阿里巴巴表示,Qwen-Image 3.0 在其演示中能够生成约 10 像素大小的清晰可读文字。
官方示例包括:
该公司还强调改进了物理细节,包括:
在一项编辑演示中,该模型修复了一幅受损传统绘画的缺失部分,同时试图保留原有的笔触和构图。
10 像素的指标来自阿里巴巴的产品演示。它不应被解读为每个 10 像素的文字在所有语言、字体、布局和生成场景中都一定准确无误。
在生产环境中,文字仍应检查以下方面:
重要的法律、医疗、财务或产品文字应人工核对,生成后使用常规设计工具添加可能仍然更稳妥。
界面与世界上下文
阿里表示,该模型原生支持渲染12种语言和超过20种字体。
其官方发布示例包括日语、韩语、西班牙语、中文和英语内容。
该模型还旨在还原常见视觉系统,包括:
这不仅仅需要匹配视觉风格。模型必须理解其所绘制对象的预期结构。
例如,天气面板应包含可识别的日期、地点、图标、温度和预报层级。代码编辑器应在合理位置具备面板、标签页、行号、代码区域和工具栏。
阿里的发布文章还描述了将生成过程与外部知识检索连接起来的工作流。不应假定模型在每次API调用中都拥有实时知识;当前信息取决于周围产品或代理工作流是否实际启用搜索或检索功能。
最实用的变化之一是在qwen-image-3.0-pro模型中结合了生成和编辑功能。
阿里云官方API文档指出,同一模型支持:
这减少了为首次生成选择一个模型、为后续修改再选择另一个模型的必要性。
典型的工作流如下:
编辑任务可能包括:
模型在图像编辑请求中接受1至3张参考图像。
阿里云百炼当前的Qwen Image 3.0 API参考列出了qwen-image-3.0-pro的以下规格:
| API属性 | 当前文档值 |
|---|---|
| 生成模式 | 文生图和图生图/编辑 |
| 参考图像 | 图像编辑时为1–3张 |
| 输入图像格式 | JPG、JPEG、PNG、BMP、TIFF、WEBP、GIF |
| 推荐输入尺寸 | 宽高在384至2048像素之间 |
| 最大输入文件大小 | 每张图像10 MB |
| 输出像素范围 | 总分辨率从512×512到2048×2048 |
| 输出格式 | PNG |
| 每次请求图像数 | 1–6 |
| API参考中的提示词语言 | 中文和英语 |
| 结果URL保留时间 | 24小时 |
| Qwen Cloud显示的国际速率限制 | 每分钟1次请求 |
更广泛的产品发布说明指出,渲染图像可包含12种语言。这与API文档中正面提示词支持中文和英语的表述有所不同。
换句话说:
指令语言支持中文或英文文档。
阿里巴巴目前的国际 API 示例使用 DashScope 多模态生成端点。
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
将 {WorkspaceId} 替换为与 API 密钥关联的工作空间 ID。
阿里云对其中国和新加坡部署区域使用独立的 API 密钥和端点。密钥和端点不能跨区域混用。
官方 SDK 使用 MultiModalConversation 调用 Qwen-Image 3.0 Pro。
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
生成的 URL 是临时的。阿里云表示结果链接仅保留 24 小时,因此应用程序应及时将审核通过的输出下载到自己的存储中。
AIBase 头条报道称 Qwen-Image 3.0 Pro 在中国模型中排名第一,在主流模型中排名第二。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
第一部分与本文审查的 Arena 实时快照一致:Qwen-Image 3.0 Pro 是整体文生图表中排名最高的中国开发模型。
第二部分在 2026 年 8 月 4 日的实时排行榜上未得到支持。
Arena 显示:
qwen-image-3.0-pro初评结果
该分数与多个竞争系统相近,置信区间存在重叠。“初评”标签也意味着随着更多投票的收集,排名可能会发生变化。
Arena 基于用户偏好对比,并非对所有生产需求的完整度量。
它本身不能证明以下方面的优越性:
团队应基于自己的提示词和验收标准对模型进行测试。
当图像同时包含视觉和文字结构时,Qwen-Image 3.0 的功能集尤为相关。
一条长提示词可以在一个分镜板中描述多个镜头、角色、机位角度、对白备注和场景转场。
该模型可用于草拟:
所有事实和公式仍需专家审核。
潜在用途包括:
当产品或主体需要在不同变体中保持一致可识别性时,参考图编辑功能非常有用。
该模型可草拟:
这些图像属于视觉概念稿,而非可直接上线的前端代码。
更大的提示词预算和小字号文本渲染能力,使该模型适合探索复杂的编辑版式设计。
若最终发布时对文字准确性有严格要求,仍应在排版软件中替换或核验文本。
4.5K 字的限制并不意味着每条提示词都该写满 4.5K。
长提示词只有在结构清晰时效果才最好。
明确指定:
先描述信息内容,再描述视觉呈现方式。
内容:
- 主标题
- 三项产品优势
- 规格表
- 页脚免责声明
风格:
- 极简编辑设计
- 深藏青色背景
- 白色无衬线字体
- 柔和影棚灯光
避免给模型一组无序的短语清单。
应说明每个文本块属于哪个位置。
对需要出现在图像中的文字内容使用引号标注。
生成的拼写仍应进行核查。
对于嵌套式或多面板设计,说明哪个元素包含哪个元素。
当具体产品、人物、包装或物体至关重要时,基于参考图进行编辑通常比纯文本生成更可靠。
仅凭文字描述。
该 API 每次调用最多支持生成六张输出图片。生成多个备选方案比在没有对比的情况下反复修改单一提示词更高效。
本文审阅的阿里云 API 页面最初标记为有限预览,而8月5日的报道则称该模型已通过 Qwen 平台更广泛地开放。
因此,文档、访问要求、速率限制和模型别名可能会迅速变化。
公开的 Qwen Cloud 页面清晰地记载了 Qwen-Image 3.0 Pro。AIBase 报道称 Standard 版定价为每张图片 0.03 美元,但本次审阅中未找到对应的公开国际版模型页面。
Arena 实时列表将 Qwen-Image 3.0 Pro 标记为专有模型。未发现 3.0 版本有任何官方开源权重发布。
该模型的文字渲染能力是重大改进,但不能保证完美的排版或事实准确性。
API 生成的图片 URL 有效期为 24 小时。请立即保存所需文件。
在部署生成资产之前,请审查:
Qwen-Image 3.0 Pro 是阿里巴巴旗舰的第三代图像生成与编辑模型。它支持文生图、使用最多三张参考图片进行编辑、长提示词、多语言文字渲染以及密集视觉布局。
Qwen Cloud 目前标价 1K 输出每张图片 0.04 美元,2K 输出每张图片 0.075 美元。1K 和 2K 工作流程的输入图片均标价为每张 0.003 美元。
AIBase 报道称 Standard 版已推出,起价为每张图片 0.03 美元。本文撰写期间未找到带有完整官方价格表的对应公开国际版模型页面,因此在据此做预算前,开发者应核实当前的 Qwen Cloud 控制台。
阿里巴巴表示该模型支持最长约 4.5K 个 token 的输入。更大的限制是为了满足故事板、报纸、教育图形、嵌套界面和其他信息密集型图像的需求。
可以。同一个 qwen-image-3.0-pro API 模型支持使用一到三张参考图片加一条文字指令进行图像到图像转换和编辑请求。
阿里巴巴的演示显示了约 10 像素的可读文字以及复杂的 LaTeX 页面。结果仍会有所不同,因此重要的拼写、公式、价格、法律内容和品牌名称需要人工核实。
未发现 Qwen-Image 3.0 Pro 存在任何开源权重发布。
此处审阅的官方来源。Arena 目前将该模型标注为专有模型。
在 2026 年 8 月 4 日的 Text-to-Image Arena 快照中,它是排名最高的中国开发模型,初步显示的总排名为第五位,排名区间为第四至第九。随着新投票和新模型的加入,Arena 排名会发生变化。
Qwen-Image 3.0 Pro 专为将视觉质量与密集信息相结合的图像任务而设计。其 4.5K token 提示容量、小文本渲染、多语言输出、嵌套界面理解和逼真细节使其特别适用于故事板、海报、教育图表、界面和编辑排版。
同一 API 模型支持生成和编辑,包括一到三张参考图像。Qwen Cloud 目前将 Pro 输出的定价为 1K 图像 0.04 美元起,2K 输出定价为 0.075 美元。
该模型在实时 Text-to-Image Arena 上表现强劲,但当前排行榜不支持源标题中关于其排名的说法
整体排名第二。显示位置为第五,带有初步分数和重叠的排名区间。
主要进展不仅仅是生成更美观的图像;而是能够以相对较低的每张图像API成本,将更长、更结构化的指令转化为可编辑的视觉资产。
从一句话开始,几分钟内拿到完整网站。