For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/es/articles/qwen-image-3-0-pro-launches.md.
Alibaba ha lanzado Qwen-Image 3.0 Pro a través de Qwen Cloud, incorporando su modelo de imagen de tercera generación en los flujos de trabaj...

Alibaba ha lanzado Qwen-Image 3.0 Pro a través de Qwen Cloud, poniendo la tercera generación de su modelo de imágenes a disposición de desarrolladores internacionales mediante un flujo de trabajo API.
El enfoque de este lanzamiento no está en generar imágenes individuales llamativas, sino en producir imágenes que puedan aplicarse al trabajo real. Sus mejoras principales incluyen:
AIBase también informó sobre la versión Standard, de menor precio. La página pública del modelo en Qwen Cloud consultada para este artículo muestra claramente el modelo Pro y sus precios; sin embargo, la página internacional del modelo Standard y su tarifa completa no pudieron localizarse de forma independiente en el mismo documento público.

El modelo también ha entrado en la clasificación de la arena Text-to-Image Arena. Hasta el 4 de agosto de 2026, Arena lista qwen-image-3.0-pro como uno de los modelos de imágenes propietarios con puntuación inicial líder. En esa instantánea, es el modelo de desarrollo chino mejor clasificado, aunque no ocupa el segundo puesto entre todos los modelos en la clasificación general en tiempo real.
AIBase informó que Alibaba lanzó dos versiones:
| Modelo | Posicionamiento | Precio inicial reportado |
|---|---|---|
| Qwen-Image 3.0 Pro | Edición insignia de mayor calidad | 0,04 USD por imagen |
| Qwen-Image 3.0 Standard | Edición general de menor coste | 0,03 USD por imagen |
La página oficial del modelo Pro en Qwen Cloud enumera actualmente precios internacionales más detallados:
| Elemento de Qwen-Image 3.0 Pro | Precio oficial en Qwen Cloud |
|---|---|
| Entrada de imagen 1K | 0,003 USD por imagen |
| Entrada de imagen 2K | 0,003 USD por imagen |
| Salida de imagen 1K | 0,04 USD por imagen |
| Salida de imagen 2K | 0,075 USD por imagen |
Esto significa que el ampliamente citado "0,04 USD por imagen" se refiere al precio inicial de salida de 1K del modelo Pro. La salida de 2K tiene un precio más alto.
La página de precios puede verse modificada en cualquier momento, por lo que las aplicaciones en producción deberían leer las tarifas vigentes de Qwen Cloud o de Alibaba Cloud Bailian, en lugar de fijar en sus presupuestos a largo plazo los precios reportados por los medios.
Alibaba resume el tema de Qwen-Image 3.0 en dos palabras: realismo.
La compañía divide esta idea en tres dimensiones:
Estas tres dimensiones explican por qué Qwen-Image 3.0 está orientado a escenarios de productividad, y no solo a la generación de imágenes artísticas.
Generar.
Qwen-Image 3.0 admite entradas de instrucciones de hasta aproximadamente 4.5K tokens.
Un mayor presupuesto de indicaciones permite al usuario especificar en una sola solicitud múltiples bloques, etiquetas, personajes, fórmulas, reglas de diseño, estilos visuales y requisitos jerárquicos.
Los ejemplos oficiales de Alibaba incluyen:
Una demostración oficial utilizó una indicación de aproximadamente 3.7K tokens para generar una única imagen de 3×3 con nueve paneles de información independientes. Cada panel tenía su propio tema, diseño, texto, gráficos y lenguaje visual.
Alibaba describe dos formas de complejidad.
La complejidad horizontal se refiere a colocar múltiples elementos paralelos en el mismo lienzo sin que interfieran entre sí.
Ejemplos incluyen:
La complejidad vertical se refiere a comprender relaciones visuales anidadas.
Un ejemplo oficial anida las siguientes interfaces unas dentro de otras:
Interfaz de VS Code
└── Interfaz de chat de Qwen
└── Interfaz de WeChat
└── Póster de café de filtrado manual
El modelo debe conservar la estructura reconocible de cada interfaz a la vez que sigue la relación jerárquica descrita en la indicación.
Este tipo de generación resulta especialmente útil cuando la imagen se aproxima más a un documento de diseño que a una ilustración tradicional.
El segundo foco está en la precisión de la renderización.
Alibaba afirma que Qwen-Image 3.0 puede generar texto claro y legible de aproximadamente 10 píxeles en sus demostraciones.
Los ejemplos oficiales incluyen:
La compañía también destaca mejoras en los detalles físicos, incluyendo:
En una demostración de edición, el modelo restauró las partes faltantes de una pintura tradicional dañada, intentando preservar las pinceladas y la composición originales.
La métrica de 10 píxeles proviene de la demostración de producto de Alibaba. No debe interpretarse como que cada texto de 10 píxeles será siempre preciso en todos los idiomas, tipografías, diseños y escenarios de generación.
En producción, el texto debería revisarse en los siguientes aspectos:
El texto importante de carácter legal, médico, financiero o de producto debe comprobarse manualmente, y puede que siga siendo más seguro añadirlo después de la generación con herramientas de diseño convencionales.
interfaces y contexto mundial
Alibaba afirma que el modelo admite de forma nativa la renderización de 12 idiomas y más de 20 tipografías.
Sus ejemplos oficiales de lanzamiento incluyen contenido en japonés, coreano, español, chino e inglés.
El modelo también tiene como objetivo reproducir sistemas visuales comunes, incluyendo:
Esto no requiere únicamente igualar el estilo visual. El modelo debe comprender la estructura prevista del objeto que dibuja.
Por ejemplo, un panel meteorológico debería incluir fecha, ubicación, iconos, temperatura y jerarquía de pronóstico reconocibles. Un editor de código debería tener paneles, pestañas, números de línea, área de código y barra de herramientas en posiciones razonables.
El artículo de lanzamiento de Alibaba también describe flujos de trabajo que conectan el proceso de generación con la recuperación de conocimiento externo. No debe asumirse que el modelo posee conocimiento en tiempo real en cada llamada API; la información actual depende de si el producto circundante o el flujo de trabajo del agente habilita realmente funciones de búsqueda o recuperación.
Uno de los cambios más prácticos es la combinación de generación y edición en el modelo qwen-image-3.0-pro.
La documentación oficial de API de Alibaba Cloud indica que el mismo modelo admite:
Generación de imagen a partir de texto
Conversión de imagen a imagen
Edición de imágenes utilizando de 1 a 3 imágenes de referencia
Esto reduce la necesidad de seleccionar un modelo para la generación inicial y otro modelo diferente para modificaciones posteriores.
El flujo de trabajo típico es el siguiente:
Las tareas de edición pueden incluir:
El modelo acepta de 1 a 3 imágenes de referencia en solicitudes de edición de imágenes.
La referencia actual de la API de Qwen Image 3.0 en Alibaba Cloud Bailian enumera las siguientes especificaciones para qwen-image-3.0-pro:
| Propiedad de la API | Valor documentado actual |
|---|---|
| Modo de generación | Texto a imagen e imagen a imagen/edición |
| Imágenes de referencia | 1–3 para edición de imágenes |
| Formato de imagen de entrada | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Tamaño de entrada recomendado | Ancho y alto entre 384 y 2048 píxeles |
| Tamaño máximo de archivo de entrada | 10 MB por imagen |
| Rango de píxeles de salida | Resolución total de 512×512 a 2048×2048 |
| Formato de salida | PNG |
| Número de imágenes por solicitud | 1–6 |
| Idioma de los prompts en la referencia de la API | Chino e inglés |
| Tiempo de retención de URL de resultados | 24 horas |
| Límite de velocidad internacional mostrado por Qwen Cloud | 1 solicitud por minuto |
Las notas de lanzamiento más amplias del producto indican que las imágenes renderizadas pueden contener texto en 12 idiomas. Esto difiere de la afirmación en la documentación de la API de que los prompts positivos admiten chino e inglés.
En otras palabras:
idioma de las instrucciones admite documentación en chino o inglés.
El ejemplo actual de la API internacional de Alibaba utiliza el endpoint de generación multimodal de DashScope.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Reemplace {WorkspaceId} con el ID del espacio de trabajo asociado a su clave de API.
Alibaba Cloud utiliza claves de API y endpoints independientes para sus regiones de implementación en China y Singapur. Las claves y los endpoints no pueden combinarse entre regiones.
El SDK oficial usa MultiModalConversation para llamar a Qwen-Image 3.0 Pro.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
Las URL generadas son temporales. Alibaba Cloud indica que los enlaces de resultados solo se conservan durante 24 horas, por lo que las aplicaciones deben descargar rápidamente las salidas aprobadas a su propio almacenamiento.
AIBase Headline informó que Qwen-Image 3.0 Pro ocupa el primer lugar entre los modelos chinos y el segundo entre los modelos convencionales.
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
La primera parte coincide con la instantánea en vivo de Arena revisada en este artículo: Qwen-Image 3.0 Pro es el modelo desarrollado en China con la puntuación más alta en la tabla general de texto a imagen.
La segunda parte no está respaldada en la clasificación en vivo del 4 de agosto de 2026.
Arena muestra:
qwen-image-3.0-pro11
Resultados de la evaluación inicial
Esta puntuación es similar a la de varios sistemas competidores, con intervalos de confianza superpuestos. La etiqueta de "evaluación inicial" también implica que la clasificación puede cambiar a medida que se recopilen más votos.
Arena se basa en comparaciones de preferencia de los usuarios y no es una métrica completa para todas las necesidades de producción.
Por sí solo, no demuestra superioridad en:
Los equipos deben probar el modelo con sus propias indicaciones (prompts) y criterios de aceptación.
El conjunto de funciones de Qwen-Image 3.0 es especialmente relevante cuando la imagen contiene estructura visual y textual a la vez.
Una indicación larga puede describir múltiples planos, personajes, ángulos de cámara, anotaciones de diálogo y transiciones de escena en un solo guion gráfico.
El modelo puede utilizarse para esbozar:
Todos los datos y fórmulas requieren revisión de expertos.
Los usos potenciales incluyen:
La función de edición con imagen de referencia es muy útil cuando el producto o el sujeto debe mantener una identificación consistente en diferentes variantes.
El modelo puede esbozar:
Estas imágenes son propuestas conceptuales, no código front-end listo para producción.
Un mayor presupuesto de indicaciones y la capacidad de renderizar texto en tamaños pequeños hacen que este modelo sea adecuado para explorar diseños editoriales complejos.
Si la precisión del texto es un requisito estricto en la publicación final, el texto debe sustituirse o verificarse en el software de maquetación.
El límite de 4.5K caracteres no implica que cada indicación deba agotarlos.
Las indicaciones largas funcionan mejor solo cuando están bien estructuradas.
Especificar claramente:
Primero describir el contenido informativo y después la presentación visual.
Contenido:
- Título principal
- Tres ventajas del producto
- Tabla de especificaciones
- Aviso legal al pie
Estilo:
- Diseño editorial minimalista
- Fondo azul marino oscuro
- Tipografía sans-serif blanca
- Iluminación de estudio suave
Evitar entregar al modelo una lista desordenada de frases sueltas.
Indicar a qué ubicación pertenece cada bloque de texto.
Usar comillas para el contenido textual que debe aparecer en la imagen.
La ortografía generada debe comprobarse igualmente.
Para diseños anidados o de múltiples paneles, indicar qué elemento contiene a cuál.
Cuando un producto, persona, envase u objeto específico es esencial, la edición basada en imágenes de referencia suele ser más fiable que la generación únicamente a partir de descripción de texto.
La API admite hasta seis imágenes de salida por llamada. Generar varias opciones suele ser más eficiente que iterar repetidamente sobre una sola indicación sin comparación.
La página de la API de Alibaba Cloud revisada estaba inicialmente marcada como vista previa limitada, mientras que los informes del 5 de agosto indican que el modelo se ha abierto de forma más amplia a través de la plataforma Qwen.
Por lo tanto, la documentación, los requisitos de acceso, los límites de tasa y los alias del modelo pueden cambiar rápidamente.
La página pública de Qwen Cloud documenta claramente Qwen-Image 3.0 Pro. AIBase informa que la versión Standard tiene un precio de 0,03 USD por imagen, pero no se encontró ninguna página pública internacional correspondiente durante esta revisión.
La lista en vivo de Arena marca Qwen-Image 3.0 Pro como modelo propietario. No se ha encontrado ningún lanzamiento oficial de pesos de código abierto para la versión 3.0.
La capacidad de renderizado de texto del modelo es una mejora significativa, pero no garantiza una tipografía ni una precisión factual perfectas.
Las URL de las imágenes generadas por la API son válidas durante 24 horas. Guarde los archivos necesarios de inmediato.
Antes de desplegar activos generados, revise:
Qwen-Image 3.0 Pro es el modelo de tercera generación insignia de Alibaba para generación y edición de imágenes. Admite texto a imagen, edición con hasta tres imágenes de referencia, indicaciones largas, renderizado de texto multilingüe y diseños visuales densos.
Qwen Cloud fija actualmente el precio en 0,04 USD por imagen para salida 1K y 0,075 USD por imagen para salida 2K. Las imágenes de entrada para los flujos de trabajo 1K y 2K se facturan a 0,003 USD por imagen.
AIBase informa que la versión Standard ya está disponible, con un precio inicial de 0,03 USD por imagen. No se encontró una página pública internacional correspondiente con la tabla de precios oficial completa al momento de escribir este artículo, por lo que los desarrolladores deben verificar la consola actual de Qwen Cloud antes de presupuestar en consecuencia.
Alibaba afirma que el modelo admite entradas de hasta aproximadamente 4,5 mil tokens. El límite ampliado está diseñado para satisfacer las necesidades de guiones gráficos, periódicos, gráficos educativos, interfaces anidadas y otras imágenes con alta densidad de información.
Sí. El mismo modelo API qwen-image-3.0-pro admite conversión de imagen a imagen y solicitudes de edición con una a tres imágenes de referencia más una instrucción de texto.
Las demostraciones de Alibaba muestran texto legible de aproximadamente 10 píxeles y páginas complejas con formato LaTeX. Los resultados siguen variando, por lo que la ortografía, fórmulas, precios, contenido legal y nombres de marca importantes requieren verificación manual.
No se ha encontrado ningún lanzamiento de pesos de código abierto para Qwen-Image 3.0 Pro.
Fuentes oficiales revisadas aquí. Arena marca actualmente el modelo como propietario.
En la instantánea del Text-to-Image Arena del 4 de agosto de 2026, es el modelo desarrollado en China con la clasificación más alta, con un puesto general preliminar de quinto lugar y un rango de entre el cuarto y el noveno. Las clasificaciones de Arena cambian a medida que se añaden nuevos votos y nuevos modelos.
Arena: una clasificación en tiempo real de preferencias para comparar modelos de generación de imágenes.
Qwen-Image 3.0 Pro está diseñado para tareas de imagen que combinan calidad visual con información densa. Su capacidad de prompts de 4.5K tokens, renderizado de texto pequeño, salida multilingüe, comprensión de interfaces anidadas y detalles realistas lo hacen especialmente adecuado para storyboards, carteles, diagramas educativos, interfaces y maquetación tipográfica.
El mismo modelo de API admite generación y edición, incluyendo de una a tres imágenes de referencia. Qwen Cloud actualmente fija el precio de las salidas Pro en 0,04 USD por 1K imágenes, y las salidas 2K en 0,075 USD.
El modelo muestra un rendimiento sólido en el Text-to-Image Arena en tiempo real, pero la clasificación actual no respalda la afirmación del título de la fuente sobre su posición general en segundo lugar. Se muestra en quinto lugar, con puntuaciones preliminares e intervalos de clasificación superpuestos.
El avance principal no es solo generar imágenes más estéticas; sino la capacidad de transformar instrucciones más largas y estructuradas en activos visuales editables a un costo relativamente bajo por imagen de API.
Empieza con una sola frase y obtén un sitio completo en minutos.