Introdução
A Alibaba lançou o Qwen-Image 3.0 Pro por meio do Qwen Cloud, disponibilizando o modelo de imagem de terceira geração para desenvolvedores internacionais por meio de fluxo de trabalho via API.
O foco deste lançamento não está em gerar imagens bonitas individuais, mas em produzir imagens que possam ser aplicadas em trabalhos reais. As principais melhorias incluem:
- Suporte a até 4,5K tokens de entrada de prompt
- Suporte a layouts densos, como jornais, storyboards, menus, provas e interfaces aninhadas
- Renderização de texto a partir de aproximadamente 10 pixels
- Suporte nativo a 12 idiomas e mais de 20 fontes
- Pele, cabelos, materiais e texturas finas mais realistas
- Geração de imagem a partir de texto e edição de imagem no mesmo modelo
- API de geração de 1K imagens a partir de US$ 0,04 no Qwen Cloud
A AIBase também noticiou a versão Standard, de menor custo. A página pública de modelos do Qwen Cloud consultada neste artigo exibe claramente o modelo Pro e seus preços; no entanto, a página internacional do modelo Standard e a tabela completa de tarifas não puderam ser encontradas de forma independente no mesmo documento público.

O modelo também entrou no ranking Text-to-Image Arena. Até 4 de agosto de 2026, a Arena lista qwen-image-3.0-pro como um dos modelos de imagem proprietários com pontuação inicial líder. Nesse instantâneo, é o modelo desenvolvido na China com melhor classificação, mas não ocupa o segundo lugar entre todos os modelos no ranking geral em tempo real.
Qwen-Image 3.0 Pro e Standard disponíveis simultaneamente na API
A AIBase informou que a Alibaba lançou duas versões:
| Modelo | Posicionamento | Preço inicial divulgado |
|---|---|---|
| Qwen-Image 3.0 Pro | Versão premium de maior qualidade | US$ 0,04 por imagem |
| Qwen-Image 3.0 Standard | Versão geral de menor custo | US$ 0,03 por imagem |
A página oficial do modelo Pro no Qwen Cloud atualmente lista preços internacionais mais detalhados:
| Item do Qwen-Image 3.0 Pro | Preço oficial no Qwen Cloud |
|---|---|
| Entrada de 1K imagens | US$ 0,003 por imagem |
| Entrada de 2K imagens | US$ 0,003 por imagem |
| Saída de 1K imagens | US$ 0,04 por imagem |
| Saída de 2K imagens | US$ 0,075 por imagem |
Isso significa que o amplamente divulgado "US$ 0,04 por imagem" se refere ao preço inicial da saída de 1K do modelo Pro. A saída de 2K tem preço mais alto.
A página de preços pode mudar a qualquer momento; portanto, aplicações em produção devem consultar as tabelas de tarifas mais recentes do Qwen Cloud ou do Bailian da Alibaba Cloud, em vez de fixar preços divulgados pela mídia em orçamentos de longo prazo.
O objetivo central é gerar imagens úteis e densas em informação
A Alibaba resume o tema do Qwen-Image 3.0 em duas palavras: realismo.
A empresa divide esse conceito em três dimensões:
- Conteúdo rico
- Detalhes realistas
- Conhecimento profundo
Essas três dimensões explicam por que o Qwen-Image 3.0 é voltado para cenários de produtividade, e não apenas para geração de imagens artísticas.
Conteúdo rico: prompts de até 4,5K tokens
O Qwen-Image 3.0 suporta instruções de entrada de até aproximadamente 4,5K tokens.
Um orçamento maior de prompt permite que o usuário especifique em uma única solicitação múltiplos blocos, rótulos, personagens, fórmulas, regras de layout, estilos visuais e requisitos hierárquicos.
Os exemplos oficiais da Alibaba incluem:
- Um grid 3×3 com nove infográficos educacionais e profissionais distintos
- Um layout de jornal com texto denso
- Um storyboard completo
- Uma prova
- Interfaces aninhadas umas dentro das outras
- Gráficos matemáticos e fórmulas
- Cartões de conhecimento com gráficos, rótulos e ilustrações
Uma demonstração oficial usou um prompt de aproximadamente 3,7K tokens para gerar uma única imagem 3×3 contendo nove painéis de informação independentes. Cada painel tinha seu próprio tema, layout, texto, gráficos e linguagem visual.
Complexidade horizontal e vertical
A Alibaba descreveu duas formas de complexidade.
Complexidade horizontal refere-se a dispor múltiplos elementos paralelos em uma mesma tela sem que interfiram uns nos outros.
Exemplos incluem:
- Nove painéis de infográfico
- Cardápios com múltiplas categorias
- Storyboards de múltiplas cenas
- Gráficos comparativos
- Cartazes de conhecimento com vários módulos
Complexidade vertical refere-se à compreensão de relações visuais aninhadas.
Um exemplo oficial aninha as seguintes interfaces umas dentro das outras:
Interface do VS Code
└── Interface de chat do Qwen
└── Interface do WeChat
└── Pôster de café coado
O modelo precisa preservar a estrutura reconhecível de cada interface enquanto segue a hierarquia descrita no prompt.
Esse tipo de geração é especialmente útil quando a imagem se aproxima mais de um documento de design do que de uma ilustração tradicional.
Detalhes realistas: texto pequeno e texturas fidedignas
O segundo foco é a precisão da renderização.
A Alibaba afirma que o Qwen-Image 3.0 consegue gerar texto legível de aproximadamente 10 pixels em suas demonstrações.
Os exemplos oficiais incluem:
- Conteúdo de jornal com texto denso
- Páginas acadêmicas com fórmulas LaTeX
- Sobrescritos e subscritos
- Letras gregas
- Numeração de teoremas
- Anotações manuscritas
- Rótulos finos em gráficos educacionais
A empresa também destaca melhorias em detalhes físicos, incluindo:
- Poros da pele
- Fios de cabelo individuais
- Texturas de tecido
- Materiais naturais
- Danos superficiais sutis
- Gradientes de nanquim
Em uma demonstração de edição, o modelo restaurou partes ausentes de uma pintura tradicional danificada, tentando preservar as pinceladas e a composição originais.
"Texto de 10 pixels" não é uma garantia absoluta
A métrica de 10 pixels vem das demonstrações de produto da Alibaba. Não deve ser interpretada como garantia de que todos os textos de 10 pixels serão precisos em todos os idiomas, fontes, layouts e cenários de geração.
Em produção, o texto ainda deve ser verificado quanto a:
- Ortografia
- Caracteres ausentes
- Pontuação
- Quebras de linha
- Consistência tipográfica
- Precisão de fórmulas
- Precisão de nomes de marcas
Textos legais, médicos, financeiros ou de produto importantes devem ser revisados manualmente; adicioná-los após a geração com ferramentas de design convencionais pode continuar sendo a opção mais segura.
Conhecimento profundo: 12 idiomas, interfaces e contexto mundial
A Alibaba afirma que o modelo suporta nativamente a renderização de 12 idiomas e mais de 20 fontes.
Seus exemplos oficiais de lançamento incluem conteúdo em japonês, coreano, espanhol, chinês e inglês.
O modelo também busca reproduzir sistemas visuais comuns, incluindo:
- Páginas web
- Interfaces de software
- Janelas de chat
- Jogos
- Transmissões ao vivo
- Gráficos educacionais
- Gráficos científicos
Isso não envolve apenas combinar o estilo visual. O modelo precisa compreender a estrutura esperada do objeto que está desenhando.
Por exemplo, um painel de clima deve conter data, local, ícones, temperatura e hierarquia de previsão reconhecíveis. Um editor de código deve ter painéis, abas, números de linha, área de código e barra de ferramentas em posições adequadas.
O artigo de lançamento da Alibaba também descreve fluxos de trabalho que conectam o processo de geração à recuperação de conhecimento externo. Não se deve presumir que o modelo tenha conhecimento em tempo real em todas as chamadas de API; informações atuais dependem de o produto ou fluxo de agente ao redor realmente habilitar busca ou recuperação.
Geração e edição usando o mesmo modelo
Uma das mudanças mais práticas é a combinação de geração e edição no modelo qwen-image-3.0-pro.
A documentação oficial da API da Alibaba Cloud indica que o mesmo modelo suporta:
-
Geração de imagem a partir de texto
-
Conversão de imagem para imagem
-
Edição de imagem usando 1 a 3 imagens de referência
Isso reduz a necessidade de escolher um modelo para a primeira geração e outro modelo para modificações posteriores.
O fluxo de trabalho típico é o seguinte:
- Gere a primeira imagem com base em um prompt detalhado.
- Use o resultado como imagem de entrada.
- Peça ao modelo para alterar o conteúdo selecionado.
- Mantenha o restante do sujeito, composição ou estilo.
- Gere múltiplas alternativas quando necessário.
As tarefas de edição podem incluir:
- Trocar roupas
- Substituir o cenário
- Adicionar ou remover objetos
- Combinar elementos visuais de múltiplas imagens
- Corrigir texto
- Reparar conteúdo danificado
- Transferência de estilo
- Preservar o sujeito ao trocar o cenário
O modelo aceita de 1 a 3 imagens de referência em solicitações de edição de imagem.
Limitações oficiais da API e formato de saída
A referência atual da API Qwen Image 3.0 do Alibaba Cloud Bailian lista as seguintes especificações para qwen-image-3.0-pro:
| Atributo da API | Valor atual na documentação |
|---|---|
| Modo de geração | Texto para imagem e imagem para imagem/edição |
| Imagens de referência | 1–3 para edição de imagem |
| Formatos de imagem de entrada | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Tamanho de entrada recomendado | Largura e altura entre 384 e 2048 pixels |
| Tamanho máximo do arquivo de entrada | 10 MB por imagem |
| Faixa de pixels de saída | Resolução total de 512×512 a 2048×2048 |
| Formato de saída | PNG |
| Número de imagens por solicitação | 1–6 |
| Idioma do prompt na referência da API | Chinês e inglês |
| Tempo de retenção do URL do resultado | 24 horas |
| Limite de taxa internacional exibido pelo Qwen Cloud | 1 solicitação por minuto |
Notas de lançamento do produto mais amplas indicam que as imagens renderizadas podem conter texto em 12 idiomas. Isso difere da declaração na documentação da API de que os prompts positivos suportam chinês e inglês.
Em outras palavras:
- O idioma das instruções suporta documentação em chinês ou inglês.
- As imagens geradas podem conter texto em uma variedade mais ampla de idiomas.
Usando cURL para chamar o Qwen-Image 3.0 Pro
O exemplo atual da API internacional da Alibaba usa o endpoint de geração multimodal do DashScope.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Substitua {WorkspaceId} pelo ID do espaço de trabalho associado à sua chave de API.
A Alibaba Cloud usa chaves de API e endpoints separados para suas regiões de implantação na China e em Singapura. As chaves e endpoints não podem ser usados de forma cruzada entre regiões.
Editando imagens com o SDK Python
O SDK oficial usa MultiModalConversation para chamar o Qwen-Image 3.0 Pro.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
O URL gerado é temporário. A Alibaba Cloud afirma que os links de resultados são mantidos por apenas 24 horas, portanto, os aplicativos devem baixar as saídas aprovadas para seu próprio armazenamento imediatamente.
Desempenho na Arena: forte, mas o ranking precisa ser interpretado com contexto
A manchete da AIBase relatou que o Qwen-Image 3.0 Pro ficou em primeiro lugar entre os modelos chineses e em segundo lugar entre os modelos mainstream.
A primeira parte está alinhada com o snapshot ao vivo da Arena revisado neste artigo: o Qwen-Image 3.0 Pro é o modelo desenvolvido pela China com melhor classificação na tabela geral de texto para imagem.
A segunda parte não é suportada na tabela de classificação ao vivo em 4 de agosto de 2026.
A Arena mostra:
Crie um site de apresentacao e gere leads em minutos
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
- Modelo:
qwen-image-3.0-pro - Desenvolvedor: Alibaba
- Pontuação: 1263 ±
11
- Status:
Resultado da avaliação inicial
- Classificação atual exibida: 5º lugar
- Faixa de classificação: 4º–9º lugar
- Votos exibidos: 2.801
Essa pontuação é próxima à de vários sistemas concorrentes, com sobreposição nos intervalos de confiança. O rótulo "avaliação inicial" também indica que a classificação pode mudar à medida que mais votos forem coletados.
O Arena é baseado em comparações de preferência do usuário e não é uma métrica completa para todas as necessidades de produção.
Ele não prova, por si só, superioridade em:
- Precisão do texto
- Consistência do produto
- Fidelidade na edição de imagens
- Latência
- Confiabilidade da API
- Comportamento de segurança
- Custo por material qualificado
- Adequação de licenciamento comercial
As equipes devem testar o modelo com seus próprios prompts e critérios de aceitação.
Cenários mais adequados para este modelo
O conjunto de recursos do Qwen-Image 3.0 é especialmente relevante quando a imagem contém estruturas visuais e textuais simultaneamente.
Storyboards e planejamento de curtas
Um prompt longo pode descrever vários planos, personagens, ângulos de câmera, anotações de diálogo e transições de cena em um único storyboard.
Gráficos educacionais e de conhecimento
O modelo pode ser usado para rascunhar:
- Diagramas de aula
- Tabelas de fórmulas
- Pôsteres científicos
- Cartões de conhecimento
- Layout de provas
- Ilustrações anotadas
Todos os fatos e fórmulas ainda precisam de revisão de especialistas.
E-commerce e publicidade
Usos potenciais incluem:
- Pôsteres de produtos
- Variações de marketing multilíngue
- Cardápios
- Imagens de descrição de produtos
- Banners promocionais
- Layouts para redes sociais
O recurso de edição com imagem de referência é útil quando o produto ou assunto precisa manter identificação consistente em diferentes variações.
Interfaces e conceitos de produtos
O modelo pode rascunhar:
- Páginas web
- Interfaces de aplicativos
- Salas de transmissão ao vivo
- Interfaces de jogos
- Conceitos de UI aninhada
Essas imagens são conceitos visuais, não código front-end pronto para produção.
Jornais, relatórios e layouts editoriais densos
O maior orçamento de prompt e a capacidade de renderizar texto em tamanho pequeno tornam o modelo adequado para explorar layouts editoriais complexos.
Se a precisão do texto for critério rigoroso na publicação final, o texto ainda deve ser substituído ou verificado em software de diagramação.
Recomendações práticas de prompt
O limite de 4,5 mil caracteres não significa que todo prompt deva ser preenchido até esse valor.
Prompts longos funcionam melhor quando bem estruturados.
- Defina a tela
Especifique claramente:
- Proporção de aspecto
- Resolução alvo
- Orientação horizontal ou vertical
- Número de blocos/seções
- Ordem de leitura
- Separe conteúdo e estilo
Descreva primeiro o conteúdo informativo e depois a apresentação visual.
Conteúdo:
- Título principal
- Três vantagens do produto
- Tabela de especificações
- Aviso legal no rodapé
Estilo:
- Design editorial minimalista
- Fundo azul-marinho escuro
- Tipografia sem serifa branca
- Iluminação suave de estúdio
- Distribua o texto em áreas específicas
Evite fornecer ao modelo uma lista solta de frases.
Indique a qual posição cada bloco de texto pertence.
- Marque o texto exato
Use aspas para o conteúdo textual que deve aparecer na imagem.
A ortografia gerada ainda deve ser verificada.
- Descreva a hierarquia entre elementos
Para designs aninhados ou com múltiplos painéis, indique qual elemento contém qual.
- Use imagens de referência para trabalhos críticos de identidade
Quando um produto, pessoa, embalagem ou objeto específico for essencial, a edição baseada em referência costuma ser mais confiável do que a geração por texto puro.
Apenas com descrição textual.
- Gere múltiplas opções
A API suporta até seis imagens de saída por chamada. Gerar várias alternativas é mais eficiente do que ajustar repetidamente um único prompt sem comparação.
Limitações atuais e observações de lançamento
A documentação oficial ainda está em evolução
A página da API da Alibaba Cloud revisada neste texto foi inicialmente marcada como prévia limitada, enquanto reportagens de 5 de agosto indicam que o modelo foi disponibilizado de forma mais ampla pela plataforma Qwen.
Portanto, documentação, requisitos de acesso, limites de taxa e aliases de modelo podem mudar rapidamente.
Visibilidade diferente da documentação das versões Pro e Standard
A página pública do Qwen Cloud documenta claramente o Qwen-Image 3.0 Pro. A AIBase informou que a versão Standard custa US$ 0,03 por imagem, mas não foi encontrada uma página pública internacional correspondente do modelo durante esta revisão.
O modelo é proprietário
A lista em tempo real do Arena marca o Qwen-Image 3.0 Pro como um modelo proprietário. Não foram encontrados lançamentos oficiais de pesos de código aberto para a versão 3.0.
O texto ainda requer revisão humana
A capacidade de renderização de texto do modelo é uma grande melhoria, mas não garante tipografia perfeita ou precisão factual.
URLs de imagem têm validade temporária
As URLs de imagens geradas pela API expiram em 24 horas. Salve os arquivos necessários imediatamente.
Uso comercial requer revisão das políticas aplicáveis
Antes de implantar ativos gerados, revise:
- Termos de serviço do Qwen Cloud
- Propriedade intelectual
- Uso de marcas registradas
- Direitos das imagens de referência
- Privacidade e direitos de imagem
- Regulamentações regionais de conteúdo de IA
- Requisitos de divulgação ou marca d'água
Perguntas frequentes
O que é o Qwen-Image 3.0 Pro?
O Qwen-Image 3.0 Pro é o modelo de terceira geração da Alibaba para geração e edição de imagens. Ele suporta geração de imagem a partir de texto, edição com até três imagens de referência, prompts longos, renderização de texto multilíngue e layouts visuais densos.
Quanto custa o Qwen-Image 3.0 Pro?
O Qwen Cloud atualmente cobra US$ 0,04 por imagem para saída 1K e US$ 0,075 por imagem para saída 2K. As imagens de entrada são precificadas em US$ 0,003 por imagem para fluxos de trabalho de 1K e 2K.
Existe uma versão Standard do Qwen-Image 3.0?
A AIBase informou que a versão Standard foi lançada com preço inicial de US$ 0,03 por imagem. Durante a elaboração deste texto, não foi encontrada uma página pública internacional correspondente do modelo com tabela de preços oficial completa. Portanto, antes de fazer orçamentos com base nessa informação, os desenvolvedores devem verificar o console atual do Qwen Cloud.
Qual é o tamanho máximo do prompt no Qwen-Image 3.0?
A Alibaba afirma que o modelo suporta entradas de até aproximadamente 4,5 mil tokens. O limite maior atende às necessidades de storyboards, jornais, gráficos educacionais, interfaces aninhadas e outras imagens densas em informação.
O Qwen-Image 3.0 pode editar imagens existentes?
Sim. O mesmo modelo de API qwen-image-3.0-pro suporta conversão de imagem para imagem e solicitações de edição usando uma a três imagens de referência com uma instrução de texto.
O Qwen-Image 3.0 consegue renderizar texto pequeno com precisão?
As demonstrações da Alibaba mostram texto legível em torno de 10 pixels e páginas complexas em LaTeX. Os resultados ainda variam, portanto, ortografia crítica, fórmulas, preços, conteúdo jurídico e nomes de marcas exigem verificação humana.
O Qwen-Image 3.0 é open source?
Não foram encontrados lançamentos de pesos de código aberto para o Qwen-Image 3.0 Pro.
Fontes oficiais revisadas neste texto. O Arena atualmente classifica o modelo como proprietário.
Qual é a classificação do Qwen-Image 3.0 Pro no Arena?
No instantâneo do Text-to-Image Arena de 4 de agosto de 2026, ele é o modelo de desenvolvimento chinês mais bem classificado, com classificação geral inicial de quinto lugar e faixa entre quarto e nono. As classificações do Arena mudam à medida que novos votos e modelos são adicionados.
Ferramentas relacionadas
- Qwen Cloud: Plataforma internacional de modelos da Alibaba Cloud para testar modelos, obter acesso à API e consultar preços atuais.
- Qwen-Image 3.0 Pro: Página oficial do modelo com recursos, limites de taxa, preços e exemplos de cURL.
- Alibaba Cloud Model Studio: Plataforma gerenciada da Alibaba Cloud para implantar e chamar modelos Qwen e de terceiros.
- DashScope Python SDK: Pacote Python oficial usado nos exemplos da API Qwen da Alibaba Cloud.
- [Text-to-Image
Arena](https://arena.ai/leaderboard/text-to-image): um ranking de preferência em tempo real para comparar modelos de geração de imagens.
- Qwen Studio: plataforma oficial da Qwen voltada para usuários, para testar os recursos dos modelos suportados.
Links relacionados
- Publicação oficial do Qwen-Image 3.0: apresentação detalhada da Alibaba Cloud sobre conteúdo rico, detalhes autênticos e conhecimento profundo.
- Qwen-Image 3.0 Pro no Qwen Cloud: visão geral atual do modelo internacional, preços, limites de taxa e exemplos de solicitações de API.
- Referência da API de geração e edição de imagens Qwen 3.0: parâmetros oficiais de solicitação, endpoints, exemplos de código, formatos de imagem suportados e modos de resposta.
- Anúncio dos modelos multimodais da Alibaba Cloud: resumo oficial sobre as séries Qwen-Image 3.0 e Qwen-Audio 3.0.
- Ranking Text-to-Image Arena: classificação em tempo real para validar o posicionamento preliminar do modelo.
- Registro de alterações do ranking Arena: registro oficial que mostra quando o Qwen-Image 3.0 Pro foi adicionado ao ranking.
Resumo
O Qwen-Image 3.0 Pro foi desenvolvido para tarefas de imagem que combinam qualidade visual com informações densas. Sua capacidade de prompt de 4.5K tokens, renderização de texto pequeno, saída multilíngue, compreensão de interfaces aninhadas e detalhes realistas o tornam especialmente útil para storyboards, pôsteres, diagramas educacionais, interfaces e composição tipográfica de edição.
O mesmo modelo de API suporta geração e edição, incluindo uma a três imagens de referência. O Qwen Cloud atualmente precifica as saídas Pro a partir de US$ 0,04 por 1K imagens, com saídas de 2K precificadas em US$ 0,075.
O modelo apresenta bom desempenho no Text-to-Image Arena em tempo real, mas o ranking atual não suporta a afirmação do título da fonte sobre sua posição geral em segundo lugar. A posição exibida é a quinta, com pontuações preliminares e intervalos de classificação sobrepostos.
O principal avanço não é apenas gerar imagens mais bonitas; é a capacidade de transformar instruções mais longas e estruturadas em ativos visuais editáveis a um custo relativamente baixo de API por imagem.



