Alibaba a lancé Qwen-Image 3.0 Pro via Qwen Cloud, intégrant son modèle d'image de troisième génération dans les flux de travail API destiné...

Alibaba a lancé Qwen-Image 3.0 Pro via Qwen Cloud, mettant à la disposition des développeurs internationaux son modèle d’image de troisième génération sous forme de flux de travail API.
L’accent de ce lancement n’est pas mis sur la génération d’images individuelles spectaculaires, mais sur la production d’images adaptées aux applications réelles. Les améliorations clés comprennent :
AIBase a également évoqué la version Standard, moins chère. La page publique du modèle Qwen Cloud consultée dans le cadre de cet article présente clairement le modèle Pro et sa tarification ; en revanche, la page internationale du modèle Standard et la grille tarifaire complète n’ont pas pu être trouvées indépendamment dans un document public unique.

Le modèle est également entré dans le classement Text-to-Image Arena. Au 4 août 2026, Arena listait qwen-image-3.0-pro parmi les modèles d’image propriétaires en tête des scores préliminaires. Dans cet instantané, il s’agissait du modèle développé par une entreprise chinoise le mieux classé, mais il n’occupait pas la deuxième place sur l’ensemble des modèles du classement en temps réel.
Selon AIBase, Alibaba a publié deux versions :
| Modèle | Positionnement | Prix de départ rapporté |
|---|---|---|
| Qwen-Image 3.0 Pro | Version phare, qualité supérieure | 0,04 $ US par image |
| Qwen-Image 3.0 Standard | Version générale, coût réduit | 0,03 $ US par image |
La page officielle du modèle Pro sur Qwen Cloud indique actuellement une tarification internationale plus détaillée :
| Élément Qwen-Image 3.0 Pro | Prix officiel Qwen Cloud |
|---|---|
| Entrée d’image 1K | 0,003 $ US par image |
| Entrée d’image 2K | 0,003 $ US par image |
| Sortie d’image 1K | 0,04 $ US par image |
| Sortie d’image 2K | 0,075 $ US par image |
Cela signifie que le prix largement rapporté de « 0,04 $ US par image » correspond au tarif de départ de la sortie 1K de la version Pro. La sortie 2K est plus chère.
La page de tarification peut changer à tout moment. Par conséquent, les applications en production devraient lire la grille tarifaire actuelle de Qwen Cloud ou d’Alibaba Cloud Bailian plutôt que d’intégrer les prix rapportés dans des budgets à long terme.
Alibaba résume le thème de Qwen-Image 3.0 en deux mots : réalité.
L’entreprise décline cette philosophie en trois dimensions :
Ces trois dimensions expliquent pourquoi Qwen-Image 3.0 s’adresse aux scénarios de productivité, et non pas seulement à la génération d’images artistiques.
Génération.
Qwen-Image 3.0 prend en charge des instructions pouvant atteindre environ 4 500 jetons.
Un budget de prompt plus important permet à l’utilisateur de spécifier en une seule requête plusieurs sections, étiquettes, rôles, formules, règles de mise en page, styles visuels et exigences hiérarchiques.
Les exemples officiels d’Alibaba comprennent :
Une démonstration officielle a utilisé un prompt d’environ 3 700 jetons pour générer une seule image 3×3 contenant neuf panneaux d’information indépendants. Chaque panneau possédait son propre thème, sa mise en page, son texte, ses graphiques et son langage visuel.
Alibaba décrit deux formes de complexité.
Complexité horizontale : placer plusieurs éléments parallèles sur une même toile sans qu’ils interfèrent entre eux.
Exemples :
Complexité verticale : comprendre les relations visuelles imbriquées.
Un exemple officiel imbrique les interfaces suivantes les unes dans les autres :
Interface VS Code
└── Interface de chat Qwen
└── Interface WeChat
└── Affiche de café filtre
Le modèle doit conserver la structure identifiable de chaque interface tout en respectant les relations hiérarchiques décrites dans le prompt.
Ce type de génération est particulièrement utile lorsque l’image se rapproche d’un document de conception plutôt que d’une illustration traditionnelle.
Le deuxième axe porte sur la précision du rendu.
Alibaba indique que Qwen-Image 3.0 peut générer, dans ses démonstrations, un texte clair et lisible à partir d’environ 10 pixels.
Exemples officiels :
L’entreprise met également en avant des détails physiques améliorés, notamment :
Dans une démonstration d’édition, le modèle a restauré les parties manquantes d’une peinture traditionnelle endommagée, tout en s’efforçant de préserver les traits et la composition d’origine.
La mesure de 10 pixels provient de la démonstration produit d’Alibaba. Elle ne doit pas être interprétée comme garantissant que chaque texte de 10 pixels sera systématiquement précis dans toutes les langues, polices, mises en page et scénarios de génération.
En production, le texte doit toujours être vérifié pour :
Les textes juridiques, médicaux, financiers ou produits importants doivent être vérifiés manuellement. L’ajout de texte via des outils de conception classiques après génération peut rester plus sûr.
interfaces et contexte mondial
Alibaba indique que le modèle prend en charge nativement le rendu de 12 langues et de plus de 20 polices.
Ses exemples de lancement officiels comprennent des contenus en japonais, coréen, espagnol, chinois et anglais.
Le modèle vise également à restituer les systèmes visuels courants, notamment :
Il ne s’agit pas seulement de reproduire un style visuel. Le modèle doit comprendre la structure attendue de l’objet qu’il dessine.
Par exemple, un panneau météo doit contenir une date, un lieu, des icônes, une température et une hiérarchie de prévisions reconnaissables. Un éditeur de code doit comporter des panneaux, des onglets, des numéros de ligne, des zones de code et des barres d’outils à des emplacements logiques.
L’article de lancement d’Alibaba décrit également des flux de travail reliant la génération à la récupération de connaissances externes. Il ne faut pas supposer que le modèle dispose de connaissances en temps réel à chaque appel API ; l’information actuelle dépend de la question de savoir si le produit ou le flux de travail d’agent environnant active effectivement la recherche ou la récupération.
L’un des changements les plus pratiques est la combinaison des fonctions de génération et d’édition dans le modèle qwen-image-3.0-pro.
La documentation officielle de l’API Alibaba Cloud précise que le même modèle prend en charge :
Génération d’images à partir de texte
Conversion d'image en image
Édition d'images à l'aide de 1 à 3 images de référence
Cela réduit la nécessité de choisir un modèle pour la génération initiale, puis d'en sélectionner un autre pour les modifications ultérieures.
Le flux de travail typique est le suivant :
Les tâches d'édition peuvent inclure :
Le modèle accepte 1 à 3 images de référence pour les demandes d'édition d'images.
La référence API actuelle de Qwen Image 3.0 sur Alibaba Cloud Bailian répertorie les spécifications suivantes pour qwen-image-3.0-pro :
| Propriété de l'API | Valeur documentée actuelle |
|---|---|
| Mode de génération | Texte vers image et image vers image / édition |
| Images de référence | 1–3 pour l'édition d'images |
| Formats d'image d'entrée | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Taille d'entrée recommandée | Largeur et hauteur entre 384 et 2048 pixels |
| Taille de fichier d'entrée maximale | 10 Mo par image |
| Plage de pixels de sortie | Résolution totale de 512×512 à 2048×2048 |
| Format de sortie | PNG |
| Nombre d'images par requête | 1–6 |
| Langues des invites dans la référence API | Chinois et anglais |
| Durée de conservation des URL de résultats | 24 heures |
| Limite de débit international affichée par Qwen Cloud | 1 requête par minute |
Les notes de version produit plus larges indiquent que les images rendues peuvent contenir du texte dans 12 langues. Cela diffère de la formulation de la documentation API qui précise que les invites positives sont prises en charge en chinois et en anglais.
En d'autres termes :
L'exemple d'API international actuel d'Alibaba utilise le point de terminaison de génération multimodale DashScope.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Remplacez {WorkspaceId} par l'ID d'espace de travail associé à votre clé API.
Alibaba Cloud utilise des clés API et des points de terminaison distincts pour ses régions de déploiement en Chine et à Singapour. Les clés et les points de terminaison ne peuvent pas être mélangés entre les régions.
Le SDK officiel utilise MultiModalConversation pour appeler Qwen-Image 3.0 Pro.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
L'URL générée est temporaire. Alibaba Cloud indique que les liens de résultats ne sont conservés que 24 heures. Les applications doivent donc télécharger rapidement les sorties validées dans leur propre stockage.
Le titre d'AIBase rapporte que Qwen-Image 3.0 Pro se classe premier parmi les modèles chinois et deuxième parmi les modèles grand public.
La première partie correspond à l'instantané Arena en temps réel examiné dans cet article : Qwen-Image 3.0 Pro est le modèle développé en Chine le mieux classé dans le classement global texte-vers-image.
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
La deuxième partie n'est pas confirmée dans le classement en temps réel du 4 août 2026.
Arena affiche :
qwen-image-3.0-pro11
Ce score est proche de celui de plusieurs systèmes concurrents, avec des intervalles de confiance qui se chevauchent. Le badge « évaluation initiale » signifie également que le classement peut évoluer à mesure que davantage de votes sont collectés.
Arena est basé sur des comparaisons de préférences utilisateurs et ne constitue pas une mesure complète de tous les besoins en production.
Il ne peut pas à lui seul prouver la supériorité dans les domaines suivants :
Les équipes doivent tester le modèle avec leurs propres prompts et critères d'acceptation.
L'ensemble de fonctionnalités de Qwen-Image 3.0 est particulièrement pertinent lorsque l'image contient à la fois des structures visuelles et textuelles.
Un long prompt peut décrire plusieurs plans, personnages, angles de caméra, annotations de dialogues et transitions de scènes dans un seul panneau de storyboard.
Le modèle peut être utilisé pour rédiger des esquisses de :
Tous les faits et formules nécessitent encore une validation par des experts.
Les utilisations potentielles incluent :
La fonctionnalité d'édition avec image de référence est très utile lorsque le produit ou le sujet doit conserver une identité reconnaissable cohérente entre différentes variantes.
Le modèle peut esquisser :
Ces images sont des maquettes visuelles conceptuelles, et non du code frontend prêt à être mis en production.
Un budget de prompt plus important et la capacité de rendu des petits textes rendent ce modèle adapté à l'exploration de mises en page éditoriales complexes.
Si une exactitude textuelle stricte est requise pour la publication finale, les textes doivent toujours être remplacés ou vérifiés dans un logiciel de mise en page.
La limite de 4,5 K caractères ne signifie pas que chaque prompt doit atteindre 4,5 K.
Les longs prompts ne fonctionnent bien que lorsque leur structure est claire.
Spécifier clairement :
Décrire d'abord le contenu informationnel, puis la manière dont il sera présenté visuellement.
Contenu :
- Titre principal
- Trois avantages du produit
- Tableau de spécifications
- Mention de non-responsabilité en pied de page
Style :
- Design éditorial minimaliste
- Fond bleu marine foncé
- Police sans empattement blanche
- Éclairage de studio doux
Éviter de donner au modèle une liste désordonnée de phrases.
Indiquer à quel emplacement appartient chaque bloc de texte.
Utiliser des guillemets pour le contenu textuel devant apparaître dans l'image.
L'orthographe générée doit toujours être vérifiée.
Pour les conceptions imbriquées ou à plusieurs panneaux, préciser quel élément contient quel autre.
Lorsqu'un produit, une personne, un emballage ou un objet spécifique est essentiel, l'édition basée sur une image de référence est généralement plus fiable que la génération par description textuelle seule.
L'API prend en charge jusqu'à six images de sortie par appel. Générer plusieurs alternatives est plus efficace que de modifier sans cesse un seul prompt sans comparaison.
La page API Alibaba Cloud examinée dans cet article était initialement marquée comme étant en aperçu limité, tandis qu'un rapport du 5 août indique que le modèle est désormais plus largement accessible via la plateforme Qwen.
Par conséquent, la documentation, les exigences d'accès, les limites de débit et les alias du modèle peuvent changer rapidement.
La page publique Qwen Cloud documente clairement Qwen-Image 3.0 Pro. AIBase rapporte que la version Standard est facturée 0,03 $ par image, mais aucune page de modèle international public correspondante n'a été trouvée lors de cet examen.
La liste en temps réel d'Arena marque Qwen-Image 3.0 Pro comme un modèle propriétaire. Aucune version open source officielle des poids de la version 3.0 n'a été trouvée.
La capacité de rendu textuel de ce modèle constitue une amélioration majeure, mais ne garantit pas une typographie ou une exactitude factuelle parfaites.
Les URL d'images générées par l'API sont valables pendant 24 heures. Veuillez enregistrer immédiatement les fichiers nécessaires.
Avant de déployer des contenus générés, veuillez examiner :
Qwen-Image 3.0 Pro est le modèle de troisième génération d'Alibaba pour la génération et l'édition d'images. Il prend en charge la génération texte-image, l'édition avec jusqu'à trois images de référence, les prompts longs, le rendu de texte multilingue et les mises en page visuelles denses.
Qwen Cloud affiche actuellement un prix de 0,04 $ par image pour une sortie 1K et de 0,075 $ par image pour une sortie 2K. Les images d'entrée pour les flux de travail 1K et 2K sont toutes deux facturées 0,003 $ par image.
AIBase rapporte qu'une version Standard a été lancée à partir de 0,03 $ par image. Aucune page de modèle international public correspondante avec une grille tarifaire officielle complète n'a été trouvée au moment de la rédaction de cet article. Les développeurs doivent donc vérifier la console Qwen Cloud actuelle avant d'établir un budget.
Alibaba indique que le modèle prend en charge jusqu'à environ 4,5 K tokens en entrée. Cette plus grande limite vise à répondre aux besoins des storyboards, journaux, graphiques éducatifs, interfaces imbriquées et autres images riches en informations.
Oui. Le même modèle d'API qwen-image-3.0-pro prend en charge les requêtes d'édition et de transformation image-à-image en utilisant une à trois images de référence associées à une instruction textuelle.
Les démonstrations d'Alibaba montrent un texte lisible d'environ 10 pixels ainsi que des pages LaTeX complexes. Les résultats restent variables, aussi les orthographes importantes, formules, prix, contenus juridiques et noms de marque nécessitent une vérification humaine.
Aucune publication de poids ouverts pour Qwen-Image 3.0 Pro n'a été trouvée.
Arena classe actuellement ce modèle comme propriétaire.
Dans l'instantané Text-to-Image Arena du 4 août 2026, il s'agit du modèle développé en Chine le mieux classé, avec une position globale initiale de cinquième, dans une fourchette allant de la quatrième à la neuvième place. Les classements Arena évoluent à mesure que de nouveaux votes et modèles sont ajoutés.
Arena](https://arena.ai/leaderboard/text-to-image) : un classement de préférence en temps réel pour comparer les modèles de génération d'images.
Qwen-Image 3.0 Pro est conçu pour les tâches d'image qui combinent qualité visuelle et informations denses. Sa capacité de prompt de 4,5K tokens, le rendu de petits textes, la sortie multilingue, la compréhension d'interfaces imbriquées et les détails réalistes le rendent particulièrement adapté aux storyboards, affiches, schémas pédagogiques, interfaces et maquettes typographiques.
Le même modèle API prend en charge la génération et l'édition, y compris avec une à trois images de référence. Qwen Cloud facture actuellement les sorties Pro à partir de 0,04 $ par image 1K et 0,075 $ pour les sorties 2K.
Le modèle affiche de bonnes performances sur le Text-to-Image Arena en temps réel, mais le classement actuel ne prend pas en charge l'affirmation du titre source concernant
sa deuxième place globale. La position affichée est la cinquième, avec un score préliminaire et des intervalles de classement qui se chevauchent.
L'avancée principale ne consiste pas simplement à générer des images plus esthétiques ; il s'agit de pouvoir transformer des instructions plus longues et plus structurées en actifs visuels modifiables, à un coût API relativement faible par image.
Partez d’une phrase et obtenez un site complet en quelques minutes.