A Alibaba lançou o Qwen-Image 3.0 Pro por meio do Qwen Cloud, integrando seu modelo de imagem de terceira geração aos fluxos de trabalho de ...

A Alibaba lançou o Qwen-Image 3.0 Pro por meio do Qwen Cloud, disponibilizando o modelo de imagem de terceira geração para desenvolvedores internacionais por meio de fluxo de trabalho via API.
O foco deste lançamento não está em gerar imagens bonitas individuais, mas em produzir imagens que possam ser aplicadas em trabalhos reais. As principais melhorias incluem:
A AIBase também noticiou a versão Standard, de menor custo. A página pública de modelos do Qwen Cloud consultada neste artigo exibe claramente o modelo Pro e seus preços; no entanto, a página internacional do modelo Standard e a tabela completa de tarifas não puderam ser encontradas de forma independente no mesmo documento público.

O modelo também entrou no ranking Text-to-Image Arena. Até 4 de agosto de 2026, a Arena lista qwen-image-3.0-pro como um dos modelos de imagem proprietários com pontuação inicial líder. Nesse instantâneo, é o modelo desenvolvido na China com melhor classificação, mas não ocupa o segundo lugar entre todos os modelos no ranking geral em tempo real.
A AIBase informou que a Alibaba lançou duas versões:
| Modelo | Posicionamento | Preço inicial divulgado |
|---|---|---|
| Qwen-Image 3.0 Pro | Versão premium de maior qualidade | US$ 0,04 por imagem |
| Qwen-Image 3.0 Standard | Versão geral de menor custo | US$ 0,03 por imagem |
A página oficial do modelo Pro no Qwen Cloud atualmente lista preços internacionais mais detalhados:
| Item do Qwen-Image 3.0 Pro | Preço oficial no Qwen Cloud |
|---|---|
| Entrada de 1K imagens | US$ 0,003 por imagem |
| Entrada de 2K imagens | US$ 0,003 por imagem |
| Saída de 1K imagens | US$ 0,04 por imagem |
| Saída de 2K imagens | US$ 0,075 por imagem |
Isso significa que o amplamente divulgado "US$ 0,04 por imagem" se refere ao preço inicial da saída de 1K do modelo Pro. A saída de 2K tem preço mais alto.
A página de preços pode mudar a qualquer momento; portanto, aplicações em produção devem consultar as tabelas de tarifas mais recentes do Qwen Cloud ou do Bailian da Alibaba Cloud, em vez de fixar preços divulgados pela mídia em orçamentos de longo prazo.
A Alibaba resume o tema do Qwen-Image 3.0 em duas palavras: realismo.
A empresa divide esse conceito em três dimensões:
Essas três dimensões explicam por que o Qwen-Image 3.0 é voltado para cenários de produtividade, e não apenas para geração de imagens artísticas.
O Qwen-Image 3.0 suporta instruções de entrada de até aproximadamente 4,5K tokens.
Um orçamento maior de prompt permite que o usuário especifique em uma única solicitação múltiplos blocos, rótulos, personagens, fórmulas, regras de layout, estilos visuais e requisitos hierárquicos.
Os exemplos oficiais da Alibaba incluem:
Uma demonstração oficial usou um prompt de aproximadamente 3,7K tokens para gerar uma única imagem 3×3 contendo nove painéis de informação independentes. Cada painel tinha seu próprio tema, layout, texto, gráficos e linguagem visual.
A Alibaba descreveu duas formas de complexidade.
Complexidade horizontal refere-se a dispor múltiplos elementos paralelos em uma mesma tela sem que interfiram uns nos outros.
Exemplos incluem:
Complexidade vertical refere-se à compreensão de relações visuais aninhadas.
Um exemplo oficial aninha as seguintes interfaces umas dentro das outras:
Interface do VS Code
└── Interface de chat do Qwen
└── Interface do WeChat
└── Pôster de café coado
O modelo precisa preservar a estrutura reconhecível de cada interface enquanto segue a hierarquia descrita no prompt.
Esse tipo de geração é especialmente útil quando a imagem se aproxima mais de um documento de design do que de uma ilustração tradicional.
O segundo foco é a precisão da renderização.
A Alibaba afirma que o Qwen-Image 3.0 consegue gerar texto legível de aproximadamente 10 pixels em suas demonstrações.
Os exemplos oficiais incluem:
A empresa também destaca melhorias em detalhes físicos, incluindo:
Em uma demonstração de edição, o modelo restaurou partes ausentes de uma pintura tradicional danificada, tentando preservar as pinceladas e a composição originais.
A métrica de 10 pixels vem das demonstrações de produto da Alibaba. Não deve ser interpretada como garantia de que todos os textos de 10 pixels serão precisos em todos os idiomas, fontes, layouts e cenários de geração.
Em produção, o texto ainda deve ser verificado quanto a:
Textos legais, médicos, financeiros ou de produto importantes devem ser revisados manualmente; adicioná-los após a geração com ferramentas de design convencionais pode continuar sendo a opção mais segura.
A Alibaba afirma que o modelo suporta nativamente a renderização de 12 idiomas e mais de 20 fontes.
Seus exemplos oficiais de lançamento incluem conteúdo em japonês, coreano, espanhol, chinês e inglês.
O modelo também busca reproduzir sistemas visuais comuns, incluindo:
Isso não envolve apenas combinar o estilo visual. O modelo precisa compreender a estrutura esperada do objeto que está desenhando.
Por exemplo, um painel de clima deve conter data, local, ícones, temperatura e hierarquia de previsão reconhecíveis. Um editor de código deve ter painéis, abas, números de linha, área de código e barra de ferramentas em posições adequadas.
O artigo de lançamento da Alibaba também descreve fluxos de trabalho que conectam o processo de geração à recuperação de conhecimento externo. Não se deve presumir que o modelo tenha conhecimento em tempo real em todas as chamadas de API; informações atuais dependem de o produto ou fluxo de agente ao redor realmente habilitar busca ou recuperação.
Uma das mudanças mais práticas é a combinação de geração e edição no modelo qwen-image-3.0-pro.
A documentação oficial da API da Alibaba Cloud indica que o mesmo modelo suporta:
Geração de imagem a partir de texto
Conversão de imagem para imagem
Edição de imagem usando 1 a 3 imagens de referência
Isso reduz a necessidade de escolher um modelo para a primeira geração e outro modelo para modificações posteriores.
O fluxo de trabalho típico é o seguinte:
As tarefas de edição podem incluir:
O modelo aceita de 1 a 3 imagens de referência em solicitações de edição de imagem.
A referência atual da API Qwen Image 3.0 do Alibaba Cloud Bailian lista as seguintes especificações para qwen-image-3.0-pro:
| Atributo da API | Valor atual na documentação |
|---|---|
| Modo de geração | Texto para imagem e imagem para imagem/edição |
| Imagens de referência | 1–3 para edição de imagem |
| Formatos de imagem de entrada | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Tamanho de entrada recomendado | Largura e altura entre 384 e 2048 pixels |
| Tamanho máximo do arquivo de entrada | 10 MB por imagem |
| Faixa de pixels de saída | Resolução total de 512×512 a 2048×2048 |
| Formato de saída | PNG |
| Número de imagens por solicitação | 1–6 |
| Idioma do prompt na referência da API | Chinês e inglês |
| Tempo de retenção do URL do resultado | 24 horas |
| Limite de taxa internacional exibido pelo Qwen Cloud | 1 solicitação por minuto |
Notas de lançamento do produto mais amplas indicam que as imagens renderizadas podem conter texto em 12 idiomas. Isso difere da declaração na documentação da API de que os prompts positivos suportam chinês e inglês.
Em outras palavras:
O exemplo atual da API internacional da Alibaba usa o endpoint de geração multimodal do DashScope.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Substitua {WorkspaceId} pelo ID do espaço de trabalho associado à sua chave de API.
A Alibaba Cloud usa chaves de API e endpoints separados para suas regiões de implantação na China e em Singapura. As chaves e endpoints não podem ser usados de forma cruzada entre regiões.
O SDK oficial usa MultiModalConversation para chamar o Qwen-Image 3.0 Pro.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
O URL gerado é temporário. A Alibaba Cloud afirma que os links de resultados são mantidos por apenas 24 horas, portanto, os aplicativos devem baixar as saídas aprovadas para seu próprio armazenamento imediatamente.
A manchete da AIBase relatou que o Qwen-Image 3.0 Pro ficou em primeiro lugar entre os modelos chineses e em segundo lugar entre os modelos mainstream.
A primeira parte está alinhada com o snapshot ao vivo da Arena revisado neste artigo: o Qwen-Image 3.0 Pro é o modelo desenvolvido pela China com melhor classificação na tabela geral de texto para imagem.
A segunda parte não é suportada na tabela de classificação ao vivo em 4 de agosto de 2026.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
A Arena mostra:
qwen-image-3.0-pro11
Resultado da avaliação inicial
Essa pontuação é próxima à de vários sistemas concorrentes, com sobreposição nos intervalos de confiança. O rótulo "avaliação inicial" também indica que a classificação pode mudar à medida que mais votos forem coletados.
O Arena é baseado em comparações de preferência do usuário e não é uma métrica completa para todas as necessidades de produção.
Ele não prova, por si só, superioridade em:
As equipes devem testar o modelo com seus próprios prompts e critérios de aceitação.
O conjunto de recursos do Qwen-Image 3.0 é especialmente relevante quando a imagem contém estruturas visuais e textuais simultaneamente.
Um prompt longo pode descrever vários planos, personagens, ângulos de câmera, anotações de diálogo e transições de cena em um único storyboard.
O modelo pode ser usado para rascunhar:
Todos os fatos e fórmulas ainda precisam de revisão de especialistas.
Usos potenciais incluem:
O recurso de edição com imagem de referência é útil quando o produto ou assunto precisa manter identificação consistente em diferentes variações.
O modelo pode rascunhar:
Essas imagens são conceitos visuais, não código front-end pronto para produção.
O maior orçamento de prompt e a capacidade de renderizar texto em tamanho pequeno tornam o modelo adequado para explorar layouts editoriais complexos.
Se a precisão do texto for critério rigoroso na publicação final, o texto ainda deve ser substituído ou verificado em software de diagramação.
O limite de 4,5 mil caracteres não significa que todo prompt deva ser preenchido até esse valor.
Prompts longos funcionam melhor quando bem estruturados.
Especifique claramente:
Descreva primeiro o conteúdo informativo e depois a apresentação visual.
Conteúdo:
- Título principal
- Três vantagens do produto
- Tabela de especificações
- Aviso legal no rodapé
Estilo:
- Design editorial minimalista
- Fundo azul-marinho escuro
- Tipografia sem serifa branca
- Iluminação suave de estúdio
Evite fornecer ao modelo uma lista solta de frases.
Indique a qual posição cada bloco de texto pertence.
Use aspas para o conteúdo textual que deve aparecer na imagem.
A ortografia gerada ainda deve ser verificada.
Para designs aninhados ou com múltiplos painéis, indique qual elemento contém qual.
Quando um produto, pessoa, embalagem ou objeto específico for essencial, a edição baseada em referência costuma ser mais confiável do que a geração por texto puro.
Apenas com descrição textual.
A API suporta até seis imagens de saída por chamada. Gerar várias alternativas é mais eficiente do que ajustar repetidamente um único prompt sem comparação.
A página da API da Alibaba Cloud revisada neste texto foi inicialmente marcada como prévia limitada, enquanto reportagens de 5 de agosto indicam que o modelo foi disponibilizado de forma mais ampla pela plataforma Qwen.
Portanto, documentação, requisitos de acesso, limites de taxa e aliases de modelo podem mudar rapidamente.
A página pública do Qwen Cloud documenta claramente o Qwen-Image 3.0 Pro. A AIBase informou que a versão Standard custa US$ 0,03 por imagem, mas não foi encontrada uma página pública internacional correspondente do modelo durante esta revisão.
A lista em tempo real do Arena marca o Qwen-Image 3.0 Pro como um modelo proprietário. Não foram encontrados lançamentos oficiais de pesos de código aberto para a versão 3.0.
A capacidade de renderização de texto do modelo é uma grande melhoria, mas não garante tipografia perfeita ou precisão factual.
As URLs de imagens geradas pela API expiram em 24 horas. Salve os arquivos necessários imediatamente.
Antes de implantar ativos gerados, revise:
O Qwen-Image 3.0 Pro é o modelo de terceira geração da Alibaba para geração e edição de imagens. Ele suporta geração de imagem a partir de texto, edição com até três imagens de referência, prompts longos, renderização de texto multilíngue e layouts visuais densos.
O Qwen Cloud atualmente cobra US$ 0,04 por imagem para saída 1K e US$ 0,075 por imagem para saída 2K. As imagens de entrada são precificadas em US$ 0,003 por imagem para fluxos de trabalho de 1K e 2K.
A AIBase informou que a versão Standard foi lançada com preço inicial de US$ 0,03 por imagem. Durante a elaboração deste texto, não foi encontrada uma página pública internacional correspondente do modelo com tabela de preços oficial completa. Portanto, antes de fazer orçamentos com base nessa informação, os desenvolvedores devem verificar o console atual do Qwen Cloud.
A Alibaba afirma que o modelo suporta entradas de até aproximadamente 4,5 mil tokens. O limite maior atende às necessidades de storyboards, jornais, gráficos educacionais, interfaces aninhadas e outras imagens densas em informação.
Sim. O mesmo modelo de API qwen-image-3.0-pro suporta conversão de imagem para imagem e solicitações de edição usando uma a três imagens de referência com uma instrução de texto.
As demonstrações da Alibaba mostram texto legível em torno de 10 pixels e páginas complexas em LaTeX. Os resultados ainda variam, portanto, ortografia crítica, fórmulas, preços, conteúdo jurídico e nomes de marcas exigem verificação humana.
Não foram encontrados lançamentos de pesos de código aberto para o Qwen-Image 3.0 Pro.
Fontes oficiais revisadas neste texto. O Arena atualmente classifica o modelo como proprietário.
No instantâneo do Text-to-Image Arena de 4 de agosto de 2026, ele é o modelo de desenvolvimento chinês mais bem classificado, com classificação geral inicial de quinto lugar e faixa entre quarto e nono. As classificações do Arena mudam à medida que novos votos e modelos são adicionados.
Arena](https://arena.ai/leaderboard/text-to-image): um ranking de preferência em tempo real para comparar modelos de geração de imagens.
O Qwen-Image 3.0 Pro foi desenvolvido para tarefas de imagem que combinam qualidade visual com informações densas. Sua capacidade de prompt de 4.5K tokens, renderização de texto pequeno, saída multilíngue, compreensão de interfaces aninhadas e detalhes realistas o tornam especialmente útil para storyboards, pôsteres, diagramas educacionais, interfaces e composição tipográfica de edição.
O mesmo modelo de API suporta geração e edição, incluindo uma a três imagens de referência. O Qwen Cloud atualmente precifica as saídas Pro a partir de US$ 0,04 por 1K imagens, com saídas de 2K precificadas em US$ 0,075.
O modelo apresenta bom desempenho no Text-to-Image Arena em tempo real, mas o ranking atual não suporta a afirmação do título da fonte sobre sua posição geral em segundo lugar. A posição exibida é a quinta, com pontuações preliminares e intervalos de classificação sobrepostos.
O principal avanço não é apenas gerar imagens mais bonitas; é a capacidade de transformar instruções mais longas e estruturadas em ativos visuais editáveis a um custo relativamente baixo de API por imagem.
Comece com uma frase e tenha um site completo em minutos.