阿里巴巴はQwen Cloudを通じてQwen-Image 3.0 Proを公開し、第3世代画像モデルを国際的な開発者向けAPIワークフローに組み込みました。今回のリリースは

AlibabaはQwen Cloudを通じて Qwen-Image 3.0 Pro をリリースし、第3世代画像モデルをAPIワークフローとして国際的な開発者に公開しました。
今回のリリースの重点は、単に美しい画像を1枚生成することではなく、実際の業務に活用できる画像を生み出すことにあります。その中核となる改善点は以下の通りです:
AIBaseは、より低価格のStandard版についても報じています。本稿で参照したQwen Cloudの公開モデルページにはProモデルとその価格が明確に表示されていますが、Standard版の国際モデルページと完全な料金表は、同じ公開ドキュメント内で単独では見つけることができませんでした。

このモデルはText-to-Image Arenaリーダーボードにも登場しています。2026年8月4日時点で、Arenaは qwen-image-3.0-pro を初期スコアでリードする専有画像モデルの一つとして挙げています。このスナップショットでは、中国発のモデルとしては最高位ですが、リアルタイムの総合ランキングでは全モデルの中で2位にはなっていません。
AIBaseの報道によると、Alibabaは2つのバージョンをリリースしました:
| モデル | 位置づけ | 報道での開始価格 |
|---|---|---|
| Qwen-Image 3.0 Pro | より高品質なフラッグシップ版 | 画像1枚あたり0.04ドル |
| Qwen-Image 3.0 Standard | より低コストな汎用版 | 画像1枚あたり0.03ドル |
Qwen Cloud公式のProモデルページには、現在より詳細な国際価格が掲載されています:
| Qwen-Image 3.0 Pro項目 | 公式Qwen Cloud価格 |
|---|---|
| 1K画像入力 | 1枚あたり0.003ドル |
| 2K画像入力 | 1枚あたり0.003ドル |
| 1K画像出力 | 1枚あたり0.04ドル |
| 2K画像出力 | 1枚あたり0.075ドル |
つまり、広く報じられている「画像1枚あたり0.04ドル」とは、Pro版の1K出力の開始価格を指しています。2K出力はより高額です。
価格ページは随時変更される可能性があるため、本番環境のアプリケーションは、報道での価格を長期的な予算にハードコードするのではなく、現在のQwen CloudまたはAlibaba Cloud Bailianの最新の料金表を参照する必要があります。
AlibabaはQwen-Image 3.0のテーマを「真实(リアル)」という言葉で総括しています。
同社はこの理念を3つの次元に分けています:
この3つの次元は、Qwen-Image 3.0が芸術的な画像生成だけでなく、生産性重視のシーンを対象としている理由を説明しています。
生成。
Qwen-Image 3.0は、最大約4.5Kトークンの命令入力に対応しています。
より大きなプロンプト予算により、ユーザーは1回のリクエストで複数のブロック、ラベル、役割、数式、レイアウトルール、ビジュアルスタイル、階層要件を指定できます。
Alibabaの公式例には以下のものがあります:
公式デモの1つでは、約3.7Kトークンのプロンプトを使用して、9つの独立した情報パネルを含む単一の3×3画像を生成しました。各パネルには独自のテーマ、レイアウト、テキスト、図表、ビジュアルランゲージがあります。
Alibabaは2つの形式の複雑さを説明しています。
横向きの複雑さとは、同一キャンバス上に複数の並列要素を配置しつつ、互いに干渉させないことを指します。
例としては以下のものがあります:
縦向きの複雑さとは、ネストされた視覚的関係を理解することを指します。
公式の例では、以下のインターフェースが互いにネストされています:
VS Code インターフェース
└── Qwen チャットインターフェース
└── WeChat インターフェース
└── ハンドドリップコーヒーのポスター
モデルは、プロンプトで記述された階層関係に従いながら、各インターフェースの認識可能な構造を保持する必要があります。
画像が従来のイラストレーションではなく設計ドキュメントに近い場合、この種の生成は特に有用です。
2つ目の重点はレンダリング精度です。
Alibabaは、Qwen-Image 3.0はデモにおいて約10ピクセルの鮮明で読み取り可能な文字を生成できると述べています。
公式の例には以下のものがあります:
同社はまた、以下の物理的ディテールの改善も強調しています:
編集デモでは、このモデルが損傷した伝統絵画の欠損部分を修復し、元の筆致と構図を保持しようとしました。
10ピクセルという指標はAlibabaの製品デモに由来します。これは、すべての10ピクセルの文字があらゆる言語、フォント、レイアウト、生成シーンで必ず正確に生成されることを意味するものではありません。
本番環境では、テキストは以下の点を引き続きチェックする必要があります:
重要な法的、医療、財務、製品テキストは手動で確認すべきであり、生成後に通常のデザインツールを使用して追加する方が安全な場合があります。
インターフェースと世界コンテキスト
Alibabaによると、このモデルは12言語と20以上のフォントのレンダリングをネイティブサポートしています。
公式リリースの例には、日本語、韓国語、スペイン語、中国語、英語のコンテンツが含まれます。
このモデルはまた、以下のような一般的なビジュアルシステムの再現を目指しています:
これは単にビジュアルスタイルを一致させるだけではありません。モデルは描いているオブジェクトの期待される構造を理解する必要があります。
例えば、天気パネルには認識可能な日付、場所、アイコン、気温、予報の階層が含まれるべきです。コードエディタには、合理的な位置にパネル、タブ、行番号、コード領域、ツールバーがあるべきです。
Alibabaの発表記事では、生成プロセスを外部知識検索に接続するワークフローについても説明されています。モデルが毎回のAPI呼び出しでリアルタイムの知識を持つとは想定すべきではありません。現在の情報は、周囲の製品やエージェントワークフローが実際に検索や取得機能を有効にしているかどうかに依存します。
最も実用的な変更の1つは、qwen-image-3.0-pro モデルに生成機能と編集機能の両方を統合したことです。
Alibaba Cloud公式APIドキュメントによると、同一モデルで以下のことがサポートされています:
テキストから画像への生成
图から図への変換
1~3枚の参照画像を使用した画像編集
これにより、最初の生成に1つのモデルを選び、その後の修正に別のモデルを選ぶ必要性が減ります。
典型的なワークフローは以下のとおりです。
編集タスクには以下が含まれる場合があります。
モデルは画像編集リクエストで1~3枚の参照画像を受け付けます。
阿里雲百煉の現在のQwen Image 3.0 APIリファレンスには、qwen-image-3.0-proの以下の仕様が記載されています。
| API属性 | 現在のドキュメント値 |
|---|---|
| 生成モード | 文生図および図生図/編集 |
| 参照画像 | 画像編集時は1~3枚 |
| 入力画像形式 | JPG、JPEG、PNG、BMP、TIFF、WEBP、GIF |
| 推奨入力サイズ | 幅と高さが384~2048ピクセル |
| 最大入力ファイルサイズ | 画像1枚あたり10 MB |
| 出力ピクセル範囲 | 総解像度512×512~2048×2048 |
| 出力形式 | PNG |
| リクエストごとの画像数 | 1~6 |
| APIリファレンスのプロンプト言語 | 中国語と英語 |
| 結果URLの保持時間 | 24時間 |
| Qwen Cloudが表示する国際レート制限 | 毎分1リクエスト |
より広範な製品リリースノートでは、レンダリング画像には12言語を含めることができると記載されています。これは、APIドキュメントでプロンプトが中国語と英語をサポートするという記述とは異なります。
言い換えると:
言語は中国語または英語のドキュメントをサポートします。
Alibabaの現在の国際APIの例では、DashScopeマルチモーダル生成エンドポイントを使用しています。
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
{WorkspaceId} をAPIキーに関連付けられたワークスペースIDに置き換えます。
Alibabaは中国とシンガポールのデプロイメントリージョンに対して、独立したAPIキーとエンドポイントを使用します。キーとエンドポイントはリージョンをまたいで混在させることはできません。
公式SDKはMultiModalConversationを使用してQwen-Image 3.0 Proを呼び出します。
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
生成されたURLは一時的なものです。Alibabaは結果リンクが24時間のみ保持されると述べているため、アプリケーションは審査済みの出力をタイムリーに自社のストレージにダウンロードする必要があります。
AIBaseのヘッドラインは、Qwen-Image 3.0 Proが中国モデルで第1位、主流モデルで第2位にランクされたと報じています。
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
最初の部分は、この記事でレビューしたArenaのリアルタイムスナップショットと一致しています。Qwen-Image 3.0 Proは、全体的な文生図テーブルで最高位にランクされた中国開発モデルです。
2番目の部分は、2026年8月4日のリアルタイムリーダーボードでは裏付けられていません。
Arenaが表示:
qwen-image-3.0-pro11
一次審査結果
このスコアは複数の競合システムと近く、信頼区間に重なりがあります。「一次審査」というラベルは、投票がさらに集まるにつれて順位が変動する可能性があることも意味しています。
Arenaはユーザーの好みに基づく比較であり、すべての本番運用ニーズを完全に測定するものではありません。
それ自体が以下を証明するものではありません:
チームは自社のプロンプトと受け入れ基準に基づいてモデルをテストする必要があります。
画像に視覚的構造と文字構造の両方が含まれる場合、Qwen-Image 3.0の機能セットが特に有効です。
長いプロンプトで、1つの絵コンテボードに複数のカット、キャラクター、カメラアングル、セリフのメモ、シーン転換を記述できます。
このモデルは以下を下書きできます:
すべての事実と公式は専門家によるレビューが必要です。
潜在的な用途には以下が含まれます:
製品や対象物を異なるバリエーションで一貫して認識可能に保つ必要がある場合、リファレンス画像編集機能が役立ちます。
このモデルは以下を下書きできます:
これらの画像は視覚的なコンセプト案であり、そのまま本番稼働するフロントエンドコードではありません。
より大きなプロンプト予算と小さな文字のテキストレンダリング機能により、このモデルは複雑な編集レイアウトデザインの探索に適しています。
最終公開時に文字の正確性に厳しい要件がある場合は、レイアウトソフトウェアでテキストを置換・検証する必要があります。
4.5K文字の制限は、すべてのプロンプトを4.5Kまで埋めるべきという意味ではありません。
長いプロンプトは構造が明確な場合に最も効果的です。
以下を明確に指定します:
まず情報内容を記述し、次に視覚表現を記述します。
内容:
- メインタイトル
- 3つの製品メリット
- 仕様表
- フッターの免責事項
スタイル:
- ミニマルな編集デザイン
- 濃紺の背景
- 白のサンセリフフォント
- 柔らかいスタジオ照明
モデルに順序のないフレーズのリストを与えるのは避けます。
各テキストブロックがどの位置に属するかを説明します。
画像に表示する必要がある文字には引用符を使用します。
生成されたスペルは常に確認する必要があります。
ネスト型やマルチパネルのデザインでは、どの要素がどの要素を含むかを説明します。
特定の製品、人物、パッケージ、物体が重要である場合、テキスト生成のみよりも、リファレンス画像に基づく編集の方が一般的に信頼性が高くなります。
このAPIは1回の呼び出しにつき最大6枚の出力画像を生成できます。比較なしに単一のプロンプトを繰り返し修正するよりも、複数の代替案を生成する方が効率的です。
本レビューで閲覧したAlibaba Cloud APIページは当初「限定プレビュー」と表示されていましたが、8月5日の報道ではQwenプラットフォームを通じてより広く公開されたとされています。
このため、ドキュメント、アクセス要件、レート制限、モデルエイリアスは急速に変更される可能性があります。
公開されているQwen CloudページにはQwen-Image 3.0 Proが明確に記載されています。AIBaseはStandard版の価格が画像1枚あたり0.03ドルと報じていますが、今回のレビューでは対応する公開の国際版モデルページは見つかりませんでした。
Arenaのリアルタイムリストでは、Qwen-Image 3.0 Proはプロプライエタリモデルとしてマークされています。3.0バージョンに関する公式のオープンソースウェイトの公開は見つかりませんでした。
このモデルの文字レンダリング機能は大幅に改善されていますが、完全なタイポグラフィや事実の正確性を保証するものではありません。
APIで生成された画像URLの有効期限は24時間です。必要なファイルはすぐに保存してください。
生成アセットをデプロイする前に以下を確認してください:
Qwen-Image 3.0 Proは、Alibabaのフラッグシップとなる第3世代画像生成・編集モデルです。テキストから画像への生成、最大3枚のリファレンス画像を使用した編集、長いプロンプト、多言語対応の文字レンダリング、高密度な視覚レイアウトをサポートしています。
Qwen Cloudは現在、1K出力で画像1枚あたり0.04ドル、2K出力で画像1枚あたり0.075ドルと表示しています。1K・2Kワークフローの入力画像は、いずれも1枚あたり0.003ドルと表示されています。
AIBaseはStandard版が公開され、画像1枚あたり0.03ドルから始まると報じています。本稿執筆時点では、完全な公式価格表を備えた対応する公開国際版モデルページは見つからなかったため、これに基づいて予算を立てる前に、開発者は現在のQwen Cloudコンソールを確認する必要があります。
Alibabaは、このモデルが最大約4,500トークンの入力に対応するとしています。この大きな制限は、ストーリーボード、新聞、教育用グラフィック、ネスト型インターフェース、その他の情報集約型画像のニーズを満たすためのものです。
はい。同じqwen-image-3.0-pro APIモデルは、1〜3枚のリファレンス画像と1つのテキスト指示を使用した、画像から画像への変換および編集リクエストをサポートしています。
Alibabaのデモでは、約10ピクセルの読みやすい文字と複雑なLaTeXページが示されています。結果は依然として異なる可能性があるため、重要なスペル、数式、価格、法的内容、ブランド名は人間による確認が必要です。
Qwen-Image 3.0 Proに関するオープンソースのウェイト公開は見つかりませんでした。
本レビューで確認した公式ソースです。Arenaは現在このモデルをプロプライエタリとしてマークしています。
2026年8月4日のText-to-Image Arenaスナップショットでは、中国開発モデルの中で最高位であり、初期表示の総合順位は5位、順位帯は4〜9位でした。新しい投票やモデルが追加されるにつれて、Arenaの順位は変動します。
Arena](https://arena.ai/leaderboard/text-to-image):画像生成モデルを比較するためのリアルタイム人気ランキングです。
Qwen-Image 3.0 Proは、視覚品質と密集した情報を組み合わせた画像タスク向けに設計されています。4.5Kトークンのプロンプト容量、小さなテキストレンダリング、多言語出力、ネストされたインターフェース理解、リアルなディテールにより、ストーリーボード、ポスター、教育用図表、インターフェース、編集用タイポグラフィに特に適しています。
同じAPIモデルで生成と編集の両方がサポートされ、1~3枚の参照画像に対応しています。Qwen Cloudでは現在、Pro出力の価格は1K画像あたり0.04ドルから、2K出力は0.075ドルに設定されています。
このモデルはリアルタイムのText-to-Image Arenaで好成績を収めていますが、現在のランキングでは、ソースタイトルに記載されている総合2位という順位はサポートされていません。表示上の位置は5位で、暫定スコアと重複する順位区間が示されています。
主な進歩は、より美しい画像を生成できることだけではありません。1枚あたりのAPIコストを比較的低く抑えながら、より長く構造化された指示を編集可能なビジュアルアセットに変換できることです。
ひとことから始めて、数分で完全なサイトを手に入れましょう。