Alibaba hat Qwen-Image 3.0 Pro über Qwen Cloud eingeführt und damit sein Bildmodell der dritten Generation in API-Workflows für internationa...

Alibaba hat über Qwen Cloud Qwen-Image 3.0 Pro veröffentlicht und damit die Bildmodelle der dritten Generation als API-Workflow für internationale Entwickler geöffnet.
Der Schwerpunkt dieser Veröffentlichung liegt nicht auf der Erzeugung einzelner ästhetischer Bilder, sondern auf der Produktion von Bildern, die in der praktischen Arbeit eingesetzt werden können. Die wichtigsten Verbesserungen umfassen:
AIBase berichtete außerdem über die günstigere Standard-Version. Die von uns eingesehene öffentliche Qwen-Cloud-Modellseite zeigt deutlich das Pro-Modell und dessen Preise; die internationale Modellseite der Standard-Version und die vollständige Preistabelle konnten jedoch nicht in demselben öffentlichen Dokument separat gefunden werden.

Das Modell wurde ebenfalls in die Text-to-Image-Arena-Rangliste aufgenommen. Stand 4. August 2026 führt die Arena qwen-image-3.0-pro als eines der führenden proprietären Bildmodelle nach vorläufiger Punktzahl. In dieser Momentaufnahme ist es das am höchsten platzierte chinesische Modell, rangiert jedoch in der laufenden Gesamttabelle nicht auf Platz zwei aller Modelle.
AIBase berichtete, dass Alibaba zwei Versionen veröffentlicht hat:
| Modell | Positionierung | Berichteter Einstiegspreis |
|---|---|---|
| Qwen-Image 3.0 Pro | Hochwertigere Flaggschiff-Version | 0,04 US-Dollar pro Bild |
| Qwen-Image 3.0 Standard | Kostengünstigere Allzweck-Version | 0,03 US-Dollar pro Bild |
Die offizielle Pro-Modellseite von Qwen Cloud listet derzeit detailliertere internationale Preise:
| Qwen-Image 3.0 Pro-Posten | Offizieller Qwen-Cloud-Preis |
|---|---|
| 1K-Bildeingabe | 0,003 US-Dollar pro Bild |
| 2K-Bildeingabe | 0,003 US-Dollar pro Bild |
| 1K-Bildausgabe | 0,04 US-Dollar pro Bild |
| 2K-Bildausgabe | 0,075 US-Dollar pro Bild |
Dies bedeutet, dass der weithin berichtete „Preis von 0,04 US-Dollar pro Bild“ den Einstiegspreis für die 1K-Ausgabe der Pro-Version bezeichnet. Die 2K-Ausgabe ist teurer.
Die Preisseite kann sich jederzeit ändern. Daher sollten Produktionsanwendungen die aktuellen Preistabellen von Qwen Cloud oder Alibaba Cloud Bailian lesen, anstatt in Medienberichten genannte Preise fest in langfristige Budgets zu kodieren.
Alibaba fasst das Thema von Qwen-Image 3.0 in zwei Wörtern zusammen: Authentizität.
Das Unternehmen unterteilt dieses Konzept in drei Dimensionen:
Diese drei Dimensionen erklären, warum Qwen-Image 3.0 auf Produktivitätsszenarien ausgerichtet ist und nicht nur auf künstlerische Bildgenerierung.
Qwen-Image 3.0 unterstützt Eingabeanweisungen von bis zu ca. 4,5K-Token.
Ein größeres Prompt-Budget ermöglicht es Benutzern, in einer einzigen Anfrage mehrere Blöcke, Beschriftungen, Rollen, Formeln, Layoutregeln, visuelle Stile und hierarchische Anforderungen anzugeben.
Offizielle Beispiele von Alibaba umfassen:
Eine offizielle Demonstration verwendete einen Prompt von ca. 3,7K-Token und erzeugte ein einzelnes 3×3-Bild mit neun separaten Informationspaneelen. Jedes Panel hatte sein eigenes Thema, Layout, Text, Diagramme und visuelle Sprache.
Alibaba beschreibt zwei Formen der Komplexität.
Horizontale Komplexität bezieht sich auf die Platzierung mehrerer paralleler Elemente auf derselben Leinwand, ohne dass diese sich gegenseitig stören.
Beispiele umfassen:
Vertikale Komplexität bezieht sich auf das Verständnis verschachtelter visueller Beziehungen.
Ein offizielles Beispiel verschachtelte folgende Oberflächen ineinander:
VS-Code-Oberfläche
└── Qwen-Chat-Oberfläche
└── WeChat-Oberfläche
└── Handfilterkaffee-Poster
Das Modell muss die erkennbare Struktur jeder Oberfläche bewahren und gleichzeitig die im Prompt beschriebenen hierarchischen Beziehungen befolgen.
Diese Art der Generierung ist besonders nützlich, wenn Bilder eher Design-Dokumenten als traditionellen Illustrationen ähneln.
Der zweite Schwerpunkt liegt auf der Darstellungspräzision.
Alibaba gibt an, dass Qwen-Image 3.0 in seinen Demonstrationen klar lesbaren Text von ca. 10 Pixeln erzeugen kann.
Offizielle Beispiele umfassen:
Das Unternehmen betont außerdem verbesserte physische Details, darunter:
In einer Bearbeitungsdemonstration reparierte das Modell fehlende Teile eines beschädigten traditionellen Gemäldes und versuchte dabei, die ursprünglichen Pinselstriche und die Komposition zu erhalten.
Die 10-Pixel-Angabe stammt aus Produktdemonstrationen von Alibaba. Sie sollte nicht so interpretiert werden, dass jeder 10-Pixel-Text in allen Sprachen, Schriftarten, Layouts und Generierungsszenarien garantiert korrekt ist.
In Produktionsumgebungen sollte Text weiterhin auf Folgendes geprüft werden:
Wichtige rechtliche, medizinische, finanzielle oder produktspezifische Texte sollten manuell überprüft werden; das nachträgliche Hinzufügen mit gängigen Designwerkzeugen nach der Generierung ist möglicherweise weiterhin der sicherere Weg.
Oberflächen und Weltkontext
Alibaba gibt an, dass das Modell nativ die Darstellung von 12 Sprachen und über 20 Schriftarten unterstützt.
Offizielle Veröffentlichungsbeispiele umfassen Inhalte auf Japanisch, Koreanisch, Spanisch, Chinesisch und Englisch.
Das Modell zielt außerdem darauf ab, gängige visuelle Systeme wiederzugeben, darunter:
Dies erfordert mehr als nur die Anpassung des visuellen Stils. Das Modell muss die erwartete Struktur des gezeichneten Objekts verstehen.
Beispielsweise sollte ein Wetterpanel erkennbare Daten, Orte, Symbole, Temperaturen und Vorhersageebenen enthalten. Ein Code-Editor sollte Paneele, Tabs, Zeilennummern, Codebereiche und Symbolleisten an vernünftigen Positionen aufweisen.
Alibabas Veröffentlichungsartikel beschreibt außerdem Workflows, die die Generierung mit externer Wissensabfrage verbinden. Es sollte nicht angenommen werden, dass das Modell bei jedem API-Aufruf über Echtzeitwissen verfügt; aktuelle Informationen hängen davon ab, ob das umgebende Produkt oder der Agent-Workflow die Such- oder Abruffunktion tatsächlich aktiviert.
Eine der praktischsten Änderungen ist die Kombination von Generierungs- und Bearbeitungsfunktionen im Modell qwen-image-3.0-pro.
Die offizielle API-Dokumentation von Alibaba Cloud gibt an, dass dasselbe Modell Folgendes unterstützt:
Text-zu-Bild-Generierung
Bild-zu-Bild-Konvertierung
Bildbearbeitung mit 1 bis 3 Referenzbildern
Dies reduziert die Notwendigkeit, für die erste Generierung ein Modell und für spätere Änderungen ein weiteres Modell auszuwählen.
Ein typischer Arbeitsablauf sieht wie folgt aus:
Bearbeitungsaufgaben können Folgendes umfassen:
Das Modell akzeptiert 1 bis 3 Referenzbilder für Bildbearbeitungsanfragen.
Die aktuelle Qwen Image 3.0 API-Referenz von Alibaba Cloud Bailian listet die folgenden Spezifikationen für qwen-image-3.0-pro auf:
| API-Eigenschaft | Aktueller Dokumentwert |
|---|---|
| Generierungsmodus | Text-zu-Bild und Bild-zu-Bild/Bearbeitung |
| Referenzbilder | 1–3 bei Bildbearbeitung |
| Eingabebildformate | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Empfohlene Eingabegröße | Breite und Höhe zwischen 384 und 2048 Pixeln |
| Maximale Eingabedateigröße | 10 MB pro Bild |
| Ausgabepixelbereich | Gesamtauflösung von 512×512 bis 2048×2048 |
| Ausgabeformat | PNG |
| Anzahl der Bilder pro Anfrage | 1–6 |
| Prompt-Sprachen in der API-Referenz | Chinesisch und Englisch |
| Aufbewahrungszeit der Ergebnis-URLs | 24 Stunden |
| Internationale Ratenbegrenzung laut Qwen Cloud | 1 Anfrage pro Minute |
Die breiteren Produktveröffentlichungshinweise geben an, dass gerenderte Bilder Text in 12 Sprachen enthalten können. Dies unterscheidet sich von der API-Dokumentation, die für positive Prompts Chinesisch und Englisch unterstützt.
Mit anderen Worten:
Das aktuelle internationale API-Beispiel von Alibaba verwendet den DashScope-Multimodal-Generierungsendpunkt.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Ersetzen Sie {WorkspaceId} durch die Workspace-ID, die mit Ihrem API-Schlüssel verknüpft ist.
Alibaba Cloud verwendet separate API-Schlüssel und Endpunkte für seine China- und Singapur-Bereitstellungsregionen. Schlüssel und Endpunkte können nicht regionsübergreifend gemischt werden.
Das offizielle SDK verwendet MultiModalConversation, um Qwen-Image 3.0 Pro aufzurufen.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
Die generierten URLs sind temporär. Alibaba Cloud gibt an, dass Ergebnislinks nur 24 Stunden aufbewahrt werden. Daher sollten Anwendungen genehmigte Ausgaben zeitnah in ihrem eigenen Speicher herunterladen.
AIBase Headlines berichtet, dass Qwen-Image 3.0 Pro den ersten Platz unter chinesischen Modellen und den zweiten Platz unter Mainstream-Modellen belegt.
Der erste Teil stimmt mit dem in diesem Artikel überprüften Arena-Live-Snapshot überein: Qwen-Image 3.0 Pro ist das am höchsten bewertete chinesisch entwickelte Modell in der Gesamttabelle für Text-zu-Bild.
Der zweite Teil wird auf der Live-Rangliste vom 4. August 2026 nicht unterstützt.
Beschreibe deine Idee einmal, und We0 AI erstellt eine Showcase-Website, Seiten und ein CMS und hilft nach dem Launch bei Kunden und Traffic.
Eine komplette Projektgeneration zur kostenlosen Registrierung
Am besten geeignet, um einen vollständigen Generierungsablauf auszuprobieren und schnell einen ersten Projektentwurf zu sehen.
Arena zeigt:
qwen-image-3.0-pro11
Erste Bewertungsergebnisse
Dieser Wert liegt nahe bei mehreren konkurrierenden Systemen, und die Konfidenzintervalle überlappen sich. Das Label „Erste Bewertung“ bedeutet auch, dass sich die Platzierung ändern kann, sobald weitere Stimmen gesammelt werden.
Arena basiert auf Nutzerpräferenzvergleichen und ist keine vollständige Messgröße für alle Produktionsanforderungen.
Es kann allein keine Überlegenheit in folgenden Bereichen belegen:
Teams sollten Modelle anhand ihrer eigenen Prompts und Abnahmekriterien testen.
Wenn Bilder sowohl visuelle als auch textliche Strukturen enthalten, ist die Funktionspalette von Qwen-Image 3.0 besonders relevant.
Ein langer Prompt kann in einem einzigen Storyboard mehrere Einstellungen, Charaktere, Kamerawinkel, Dialognotizen und Szenenübergänge beschreiben.
Das Modell kann verwendet werden, um Folgendes zu entwerfen:
Alle Fakten und Formeln müssen weiterhin von Experten geprüft werden.
Mögliche Anwendungen umfassen:
Die Referenzbildbearbeitungsfunktion ist nützlich, wenn ein Produkt oder Motiv über verschiedene Varianten hinweg konsistent erkennbar bleiben muss.
Das Modell kann Folgendes entwerfen:
Diese Bilder sind visuelle Konzeptentwürfe, kein direkt einsatzbereiter Frontend-Code.
Das größere Prompt-Budget und die Fähigkeit, kleine Schriftzeichen zu rendern, machen das Modell geeignet, um komplexe redaktionelle Layout-Designs zu erkunden.
Wenn am Ende strenge Anforderungen an die Textgenauigkeit bestehen, sollten Texte dennoch in Layout-Software ersetzt oder verifiziert werden.
Die 4,5K-Zeichenbegrenzung bedeutet nicht, dass jeder Prompt mit 4,5K gefüllt werden sollte.
Lange Prompts funktionieren nur dann am besten, wenn sie klar strukturiert sind.
Geben Sie ausdrücklich an:
Beschreiben Sie zuerst den Informationsinhalt, dann die visuelle Darstellung.
Inhalt:
- Haupttitel
- Drei Produktvorteile
- Spezifikationstabelle
- Fußzeilen-Haftungsausschluss
Stil:
- Minimalistisches Editorial-Design
- Dunkelmarineblauer Hintergrund
- Weiße serifenlose Schrift
- Weiche Studiolichtsetzung
Vermeiden Sie es, dem Modell eine ungeordnete Liste von Phrasen zu geben.
Erklären Sie, zu welcher Position jeder Textblock gehört.
Verwenden Sie Anführungszeichen für Textinhalte, die im Bild erscheinen sollen.
Die erzeugte Rechtschreibung sollte dennoch überprüft werden.
Bei verschachtelten oder mehrteiligen Designs geben Sie an, welches Element welches enthält.
Wenn ein bestimmtes Produkt, eine Person, eine Verpackung oder ein Objekt entscheidend ist, ist die Bearbeitung auf Basis von Referenzbildern oft zuverlässiger als die Generierung allein.
nur mit Textbeschreibung.
Die API unterstützt bis zu sechs Ausgabebilder pro Aufruf. Mehrere Alternativen zu generieren ist effizienter, als einen einzelnen Prompt wiederholt ohne Vergleich zu verfeinern.
Die in dieser Überprüfung untersuchte Alibaba-Cloud-API-Seite war ursprünglich als eingeschränkte Vorschau markiert, während Berichte vom 5. August besagen, dass das Modell über die Qwen-Plattform breiter verfügbar gemacht wurde.
Daher können sich Dokumentation, Zugriffsanforderungen, Ratenlimits und Modellaliase schnell ändern.
Die öffentliche Qwen-Cloud-Seite dokumentiert Qwen-Image 3.0 Pro deutlich. AIBase berichtet, dass die Standard-Version 0,03 USD pro Bild kostet, aber in dieser Überprüfung wurde keine entsprechende öffentlich zugängliche internationale Modellseite gefunden.
Die Arena-Live-Liste kennzeichnet Qwen-Image 3.0 Pro als proprietäres Modell. Es wurden keine offiziellen Open-Source-Gewichtsveröffentlichungen für Version 3.0 gefunden.
Die Textrendering-Fähigkeit des Modells ist eine erhebliche Verbesserung, aber perfekte Typografie oder faktenbasierte Genauigkeit sind nicht garantiert.
Die von der API generierten Bild-URLs sind 24 Stunden gültig. Speichern Sie benötigte Dateien sofort.
Vor der Bereitstellung generierter Assets prüfen Sie:
Qwen-Image 3.0 Pro ist das Flaggschiff-Modell der dritten Generation von Alibaba für Bilderzeugung und -bearbeitung. Es unterstützt Text-zu-Bild, Bearbeitung mit bis zu drei Referenzbildern, lange Prompts, mehrsprachiges Textrendering und dichte visuelle Layouts.
Qwen Cloud listet derzeit 0,04 USD pro Bild für 1K-Ausgabe und 0,075 USD pro Bild für 2K-Ausgabe auf. Eingabebilder werden für sowohl 1K- als auch 2K-Workflows mit 0,003 USD pro Bild bewertet.
AIBase berichtet, dass die Standard-Version mit einem Einstiegspreis von 0,03 USD pro Bild eingeführt wurde. Zum Zeitpunkt dieses Artikels wurde keine entsprechende öffentlich zugängliche internationale Modellseite mit vollständiger offizieller Preisliste gefunden. Entwickler sollten daher die aktuelle Qwen-Cloud-Konsole überprüfen, bevor sie Budgets darauf aufbauen.
Alibaba gibt an, dass das Modell Eingaben von bis zu etwa 4,5K Tokens unterstützt. Das größere Limit besteht, um Storyboards, Zeitungen, Bildungsgrafiken, verschachtelte Oberflächen und andere informationsdichte Bilder zu unterstützen.
Ja. Dasselbe qwen-image-3.0-pro-API-Modell unterstützt Bild-zu-Bild-Konvertierung und Bearbeitungsanfragen mit einem bis drei Referenzbildern plus einer Textanweisung.
Alibabas Demos zeigten lesbaren Text bei etwa 10 Pixeln sowie komplexe LaTeX-Seiten. Die Ergebnisse variieren weiterhin, daher müssen wichtige Rechtschreibungen, Formeln, Preise, rechtliche Inhalte und Markennamen manuell überprüft werden.
Es wurden keine Open-Source-Gewichtsveröffentlichungen für Qwen-Image 3.0 Pro gefunden.
aus den hier überprüften offiziellen Quellen. Arena kennzeichnet das Modell derzeit als proprietär.
Im Snapshot der Text-to-Image Arena vom 4. August 2026 ist es das am höchsten platzierte chinesische Entwicklungsmodell mit einer vorläufigen Gesamtplatzierung von Platz fünf und einem Platzierungsbereich von vier bis neun. Mit neuen Stimmen und Modellen ändern sich die Arena-Platzierungen.
Arena](https://arena.ai/leaderboard/text-to-image): Ein Echtzeit-Präferenz-Ranking zur Vergleiche von Bildgenerierungsmodellen.
Qwen-Image 3.0 Pro ist für Bildaufgaben konzipiert, die visuelle Qualität mit dichter Information verbinden. Seine 4,5K-Token-Prompt-Kapazität, die Darstellung kleiner Texte, mehrsprachige Ausgabe, das Verständnis verschachtelter Oberflächen und realistische Details machen ihn besonders geeignet für Storyboards, Poster, Bildungsdiagramme, Oberflächen und Bearbeitungstypografie.
Dieselbe API-Modell unterstützt Generierung und Bearbeitung, einschließlich ein bis drei Referenzbildern. Qwen Cloud bietet die Pro-Ausgabe derzeit ab 0,04 USD pro 1K-Bild an, wobei 2K-Ausgaben für 0,075 USD angeboten werden.
Das Modell schneidet auf der Echtzeit-Text-to-Image-Arena stark ab, aber die aktuelle Rangliste unterstützt die Behauptung im Quell-Header über seine Platzierung
insgesamt auf Platz zwei. Die Anzeige zeigt Platz fünf mit vorläufigen Punktzahlen und überlappenden Konfidenzintervallen.
Der Hauptfortschritt besteht nicht nur darin, ästhetischere Bilder zu erzeugen, sondern darin, längere, strukturiertere Anweisungen zu bearbeitbaren visuellen Assets zu je relativ geringen API-Kosten pro Bild umzuwandeln.
Starte mit einem Satz und erhalte in wenigen Minuten eine vollständige Website.