引言
阿里巴巴已通过 Qwen Cloud 推出 Qwen-Image 3.0 Pro,将第三代图像模型以 API 工作流形式开放给国际开发者。
本次发布的重心不在于生成单张精美的图片,而在于产出能够应用于实际工作的图像。其核心改进包括:
- 提示词输入最高支持 4.5K tokens
- 支持报纸、故事板、菜单、试卷、嵌套界面等密集型布局
- 文字渲染最小可至约 10 像素
- 原生支持 12 种语言和 20 多种字体渲染
- 皮肤、毛发、材质和精细纹理更加真实
- 在同一模型中同时支持文生图和图像编辑
- Qwen Cloud 上 1K 输出图像 API 定价低至 0.04 美元
AIBase 还报道了价格更低的 Standard 版。本文所查阅的 Qwen Cloud 公开模型页面明确展示了 Pro 模型及其定价;但 Standard 版的国际模型页面和完整费率表未能在同一公开文档中独立找到。

该模型也已进入 Text-to-Image Arena 排行榜。截至 2026 年 8 月 4 日,Arena 将 qwen-image-3.0-pro 列为初步得分领先的专有图像模型之一。在该快照中,它是排名最高的中国开发模型,但在实时总榜上并未位列所有模型的第二名。
Qwen-Image 3.0 Pro 与 Standard 同步上线 API
AIBase 报道称,阿里巴巴发布了两个版本:
| 模型 | 定位 | 报道起步价 |
|---|---|---|
| Qwen-Image 3.0 Pro | 更高质量的旗舰版 | 每张图像 0.04 美元 |
| Qwen-Image 3.0 Standard | 更低成本的通用版 | 每张图像 0.03 美元 |
Qwen Cloud 官方 Pro 模型页面目前列出了更详细的国际定价:
| Qwen-Image 3.0 Pro 项目 | 官方 Qwen Cloud 价格 |
|---|---|
| 1K 图像输入 | 每张 0.003 美元 |
| 2K 图像输入 | 每张 0.003 美元 |
| 1K 图像输出 | 每张 0.04 美元 |
| 2K 图像输出 | 每张 0.075 美元 |
这意味着广泛报道的“每张图像 0.04 美元”指的是 Pro 版 1K 输出的起步价格。2K 输出价格更高。
定价页面随时可能变更,因此生产环境应用应读取当前 Qwen Cloud 或阿里云百炼的最新费率表,而不是将媒体报道的价格硬编码到长期预算中。
核心目标是生成有用且信息密集的图像
阿里巴巴用两个字概括 Qwen-Image 3.0 的主题:真实。
该公司将该理念分为三个维度:
- 内容丰富
- 细节真实
- 知识深入
这三个维度解释了为何 Qwen-Image 3.0 面向生产力场景,而不仅仅是艺术图像生成。
生成。
丰富内容:提示词最高支持 4.5K Token
Qwen-Image 3.0 支持最高约 4.5K Token 的指令输入。
更大的提示词预算允许用户在一次请求中指定多个区块、标签、角色、公式、布局规则、视觉风格和层级要求。
阿里巴巴的官方示例包括:
- 一个包含九种不同教育和专业信息图的 3×3 网格
- 一份文字密集的报纸风格版面
- 一个完整的故事板
- 一份试卷
- 嵌套在彼此内部的界面
- 数学图表和公式
- 包含图表、标签和插画的知识卡片
一项官方演示使用了约 3.7K Token 的提示词,生成了包含九个独立信息面板的单个 3×3 图像。每个面板都有自己的主题、布局、文字、图表和视觉语言。
横向与纵向复杂度
阿里巴巴描述了两种形式的复杂度。
横向复杂度指在同一画布上放置多个平行的元素,同时不让它们相互干扰。
示例包括:
- 九个信息图面板
- 包含多个类别的菜单
- 多镜头故事板
- 对比图
- 包含多个模块的知识海报
纵向复杂度指理解嵌套的视觉关系。
一项官方示例将以下界面嵌套在彼此内部:
VS Code 界面
└── Qwen 聊天界面
└── 微信界面
└── 手冲咖啡海报
模型需要保留每个界面可辨识的结构,同时遵循提示词中描述的层级关系。
当图像更接近设计文档而非传统插画时,这类生成方式尤为有用。
真实细节:小字号文字与逼真质感
第二个重点是渲染精度。
阿里巴巴表示,Qwen-Image 3.0 在其演示中能够生成约 10 像素大小的清晰可读文字。
官方示例包括:
- 文字密集的报纸内容
- 包含 LaTeX 公式的学术页面
- 上标和下标
- 希腊字母
- 定理编号
- 手写批注
- 教育图表中的精细标签
该公司还强调改进了物理细节,包括:
- 皮肤毛孔
- 单根发丝
- 织物纹理
- 天然材质
- 细微的表面损伤
- 水墨渐变
在一项编辑演示中,该模型修复了一幅受损传统绘画的缺失部分,同时试图保留原有的笔触和构图。
“10 像素文字”并非绝对保证
10 像素的指标来自阿里巴巴的产品演示。它不应被解读为每个 10 像素的文字在所有语言、字体、布局和生成场景中都一定准确无误。
在生产环境中,文字仍应检查以下方面:
- 拼写
- 缺字
- 标点符号
- 换行
- 字体一致性
- 公式准确性
- 品牌名称准确性
重要的法律、医疗、财务或产品文字应人工核对,生成后使用常规设计工具添加可能仍然更稳妥。
深度知识:12 种语言,
界面与世界上下文
阿里表示,该模型原生支持渲染12种语言和超过20种字体。
其官方发布示例包括日语、韩语、西班牙语、中文和英语内容。
该模型还旨在还原常见视觉系统,包括:
- 网页
- 软件界面
- 聊天窗口
- 游戏
- 直播间
- 教育图表
- 科学图形
这不仅仅需要匹配视觉风格。模型必须理解其所绘制对象的预期结构。
例如,天气面板应包含可识别的日期、地点、图标、温度和预报层级。代码编辑器应在合理位置具备面板、标签页、行号、代码区域和工具栏。
阿里的发布文章还描述了将生成过程与外部知识检索连接起来的工作流。不应假定模型在每次API调用中都拥有实时知识;当前信息取决于周围产品或代理工作流是否实际启用搜索或检索功能。
生成与编辑使用同一模型
最实用的变化之一是在qwen-image-3.0-pro模型中结合了生成和编辑功能。
阿里云官方API文档指出,同一模型支持:
- 文生图生成
- 图生图转换
- 使用1至3张参考图像进行图像编辑
这减少了为首次生成选择一个模型、为后续修改再选择另一个模型的必要性。
典型的工作流如下:
- 根据详细提示词生成第一张图像。
- 将结果作为输入图像。
- 要求模型更改所选内容。
- 保留主体、构图或风格的其余部分。
- 在需要时生成多个备选方案。
编辑任务可能包括:
- 更换服装
- 替换场景
- 添加或移除对象
- 将多张图像中的视觉元素进行组合
- 修正文字
- 修复损坏内容
- 风格迁移
- 在更换场景的同时保留主体
模型在图像编辑请求中接受1至3张参考图像。
官方API限制与输出格式
阿里云百炼当前的Qwen Image 3.0 API参考列出了qwen-image-3.0-pro的以下规格:
| API属性 | 当前文档值 |
|---|---|
| 生成模式 | 文生图和图生图/编辑 |
| 参考图像 | 图像编辑时为1–3张 |
| 输入图像格式 | JPG、JPEG、PNG、BMP、TIFF、WEBP、GIF |
| 推荐输入尺寸 | 宽高在384至2048像素之间 |
| 最大输入文件大小 | 每张图像10 MB |
| 输出像素范围 | 总分辨率从512×512到2048×2048 |
| 输出格式 | PNG |
| 每次请求图像数 | 1–6 |
| API参考中的提示词语言 | 中文和英语 |
| 结果URL保留时间 | 24小时 |
| Qwen Cloud显示的国际速率限制 | 每分钟1次请求 |
更广泛的产品发布说明指出,渲染图像可包含12种语言。这与API文档中正面提示词支持中文和英语的表述有所不同。
换句话说:
- 该
指令语言支持中文或英文文档。
- 生成的图像可以包含更广泛语言种类的文字。
使用 cURL 调用 Qwen-Image 3.0 Pro
阿里巴巴目前的国际 API 示例使用 DashScope 多模态生成端点。
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
将 {WorkspaceId} 替换为与 API 密钥关联的工作空间 ID。
阿里云对其中国和新加坡部署区域使用独立的 API 密钥和端点。密钥和端点不能跨区域混用。
使用 Python SDK 编辑图像
官方 SDK 使用 MultiModalConversation 调用 Qwen-Image 3.0 Pro。
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
生成的 URL 是临时的。阿里云表示结果链接仅保留 24 小时,因此应用程序应及时将审核通过的输出下载到自己的存储中。
Arena 性能:表现强劲,但排名需要结合背景理解
AIBase 头条报道称 Qwen-Image 3.0 Pro 在中国模型中排名第一,在主流模型中排名第二。
第一部分与本文审查的 Arena 实时快照一致:Qwen-Image 3.0 Pro 是整体文生图表中排名最高的中国开发模型。
第二部分在 2026 年 8 月 4 日的实时排行榜上未得到支持。
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
Arena 显示:
- 模型:
qwen-image-3.0-pro - 开发者:阿里巴巴
- 得分:1263 ± 11
- 状态:
初评结果
- 当前显示排名:第5名
- 排名区间:第4–9名
- 已展示投票数:2,801
该分数与多个竞争系统相近,置信区间存在重叠。“初评”标签也意味着随着更多投票的收集,排名可能会发生变化。
Arena 基于用户偏好对比,并非对所有生产需求的完整度量。
它本身不能证明以下方面的优越性:
- 文本准确性
- 产品一致性
- 图像编辑保真度
- 延迟
- API 可靠性
- 安全行为
- 每张合格素材的成本
- 商业授权适用性
团队应基于自己的提示词和验收标准对模型进行测试。
该模型最适用的场景
当图像同时包含视觉和文字结构时,Qwen-Image 3.0 的功能集尤为相关。
分镜脚本与短剧策划
一条长提示词可以在一个分镜板中描述多个镜头、角色、机位角度、对白备注和场景转场。
教育与知识类图形
该模型可用于草拟:
- 课程图示
- 公式表
- 科学海报
- 知识卡片
- 试卷排版
- 带标注的插图
所有事实和公式仍需专家审核。
电商与广告
潜在用途包括:
- 产品海报
- 多语言营销变体
- 菜单
- 产品描述图
- 促销横幅
- 社交媒体版式
当产品或主体需要在不同变体中保持一致可识别性时,参考图编辑功能非常有用。
界面与产品概念稿
该模型可草拟:
- 网页
- 应用界面
- 直播间
- 游戏界面
- 嵌套式 UI 概念
这些图像属于视觉概念稿,而非可直接上线的前端代码。
报纸、报告与密集编辑排版
更大的提示词预算和小字号文本渲染能力,使该模型适合探索复杂的编辑版式设计。
若最终发布时对文字准确性有严格要求,仍应在排版软件中替换或核验文本。
实用提示词建议
4.5K 字的限制并不意味着每条提示词都该写满 4.5K。
长提示词只有在结构清晰时效果才最好。
- 定义画布
明确指定:
- 宽高比
- 分辨率目标
- 横竖方向
- 板块数量
- 阅读顺序
- 将内容与风格分开描述
先描述信息内容,再描述视觉呈现方式。
内容:
- 主标题
- 三项产品优势
- 规格表
- 页脚免责声明
风格:
- 极简编辑设计
- 深藏青色背景
- 白色无衬线字体
- 柔和影棚灯光
- 将文本分配到具体区域
避免给模型一组无序的短语清单。
应说明每个文本块属于哪个位置。
- 标注精确文案
对需要出现在图像中的文字内容使用引号标注。
生成的拼写仍应进行核查。
- 描述元素间的层级关系
对于嵌套式或多面板设计,说明哪个元素包含哪个元素。
- 对身份关键型工作使用参考图
当具体产品、人物、包装或物体至关重要时,基于参考图进行编辑通常比纯文本生成更可靠。
仅凭文字描述。
- 生成多个候选
该 API 每次调用最多支持生成六张输出图片。生成多个备选方案比在没有对比的情况下反复修改单一提示词更高效。
当前限制与发布注意事项
官方文档仍在不断完善中
本文审阅的阿里云 API 页面最初标记为有限预览,而8月5日的报道则称该模型已通过 Qwen 平台更广泛地开放。
因此,文档、访问要求、速率限制和模型别名可能会迅速变化。
Pro 版与 Standard 版文档可见度不同
公开的 Qwen Cloud 页面清晰地记载了 Qwen-Image 3.0 Pro。AIBase 报道称 Standard 版定价为每张图片 0.03 美元,但本次审阅中未找到对应的公开国际版模型页面。
该模型为专有模型
Arena 实时列表将 Qwen-Image 3.0 Pro 标记为专有模型。未发现 3.0 版本有任何官方开源权重发布。
文字仍需人工校对
该模型的文字渲染能力是重大改进,但不能保证完美的排版或事实准确性。
图片 URL 有时效性
API 生成的图片 URL 有效期为 24 小时。请立即保存所需文件。
商业使用需审查相关政策
在部署生成资产之前,请审查:
- Qwen Cloud 服务条款
- 知识产权
- 商标使用
- 参考图片的权利
- 隐私权与肖像权
- 区域 AI 内容法规
- 必要的披露或水印要求
常见问题
什么是 Qwen-Image 3.0 Pro?
Qwen-Image 3.0 Pro 是阿里巴巴旗舰的第三代图像生成与编辑模型。它支持文生图、使用最多三张参考图片进行编辑、长提示词、多语言文字渲染以及密集视觉布局。
Qwen-Image 3.0 Pro 的费用是多少?
Qwen Cloud 目前标价 1K 输出每张图片 0.04 美元,2K 输出每张图片 0.075 美元。1K 和 2K 工作流程的输入图片均标价为每张 0.003 美元。
是否有 Qwen-Image 3.0 Standard 版模型?
AIBase 报道称 Standard 版已推出,起价为每张图片 0.03 美元。本文撰写期间未找到带有完整官方价格表的对应公开国际版模型页面,因此在据此做预算前,开发者应核实当前的 Qwen Cloud 控制台。
Qwen-Image 3.0 的提示词可以有多长?
阿里巴巴表示该模型支持最长约 4.5K 个 token 的输入。更大的限制是为了满足故事板、报纸、教育图形、嵌套界面和其他信息密集型图像的需求。
Qwen-Image 3.0 可以编辑现有图片吗?
可以。同一个 qwen-image-3.0-pro API 模型支持使用一到三张参考图片加一条文字指令进行图像到图像转换和编辑请求。
Qwen-Image 3.0 能准确渲染小号文字吗?
阿里巴巴的演示显示了约 10 像素的可读文字以及复杂的 LaTeX 页面。结果仍会有所不同,因此重要的拼写、公式、价格、法律内容和品牌名称需要人工核实。
Qwen-Image 3.0 是开源的吗?
未发现 Qwen-Image 3.0 Pro 存在任何开源权重发布。
此处审阅的官方来源。Arena 目前将该模型标注为专有模型。
Qwen-Image 3.0 Pro 在 Arena 上排名如何?
在 2026 年 8 月 4 日的 Text-to-Image Arena 快照中,它是排名最高的中国开发模型,初步显示的总排名为第五位,排名区间为第四至第九。随着新投票和新模型的加入,Arena 排名会发生变化。
相关工具
- Qwen Cloud:阿里云的国际模型平台,用于测试模型、获取 API 访问权限以及查看当前定价。
- Qwen-Image 3.0 Pro:官方模型页面,包含功能、速率限制、定价和 cURL 示例。
- 阿里云百炼:阿里云管理的平台,用于部署和调用 Qwen 及第三方模型。
- DashScope Python SDK:阿里云 Qwen API 示例中使用的官方 Python 包。
- Text-to-Image Arena:用于比较图像生成模型的实时偏好排行榜。
- Qwen Studio:Qwen 官方面向用户的平台,用于试用支持的模型功能。
相关链接
- Qwen-Image 3.0 官方发布文章:阿里云关于丰富内容、真实细节和深度知识的详细介绍。
- Qwen Cloud 上的 Qwen-Image 3.0 Pro:当前国际模型概览、定价、速率限制和 API 请求示例。
- Qwen 图像生成与编辑 3.0 API 参考:官方请求参数、端点、代码示例、支持的图像格式和响应模式。
- 阿里云多模态模型公告:关于 Qwen-Image 3.0 和 Qwen-Audio 3.0 系列的官方摘要。
- Text-to-Image Arena 排行榜:用于验证模型初步排名的实时排名。
- Arena 排行榜更新日志:显示 Qwen-Image 3.0 Pro 何时被添加到排行榜的官方记录。
摘要
Qwen-Image 3.0 Pro 专为将视觉质量与密集信息相结合的图像任务而设计。其 4.5K token 提示容量、小文本渲染、多语言输出、嵌套界面理解和逼真细节使其特别适用于故事板、海报、教育图表、界面和编辑排版。
同一 API 模型支持生成和编辑,包括一到三张参考图像。Qwen Cloud 目前将 Pro 输出的定价为 1K 图像 0.04 美元起,2K 输出定价为 0.075 美元。
该模型在实时 Text-to-Image Arena 上表现强劲,但当前排行榜不支持源标题中关于其排名的说法
整体排名第二。显示位置为第五,带有初步分数和重叠的排名区间。
主要进展不仅仅是生成更美观的图像;而是能够以相对较低的每张图像API成本,将更长、更结构化的指令转化为可编辑的视觉资产。



