Introducción
Alibaba ha lanzado Qwen-Image 3.0 Pro a través de Qwen Cloud, poniendo la tercera generación de su modelo de imágenes a disposición de desarrolladores internacionales mediante un flujo de trabajo API.
El enfoque de este lanzamiento no está en generar imágenes individuales llamativas, sino en producir imágenes que puedan aplicarse al trabajo real. Sus mejoras principales incluyen:
- Entrada de hasta 4.5K tokens en las indicaciones
- Soporte para diseños de alta densidad como periódicos, guiones gráficos, menús, exámenes e interfaces anidadas
- Renderización de texto de hasta aproximadamente 10 píxeles
- Soporte nativo para 12 idiomas y más de 20 tipografías
- Piel, cabello, materiales y texturas finas más realistas
- Generación de imágenes y edición de imágenes en un mismo modelo
- Precios de API desde 0,04 USD por 1K imágenes de salida en Qwen Cloud
AIBase también informó sobre la versión Standard, de menor precio. La página pública del modelo en Qwen Cloud consultada para este artículo muestra claramente el modelo Pro y sus precios; sin embargo, la página internacional del modelo Standard y su tarifa completa no pudieron localizarse de forma independiente en el mismo documento público.

El modelo también ha entrado en la clasificación de la arena Text-to-Image Arena. Hasta el 4 de agosto de 2026, Arena lista qwen-image-3.0-pro como uno de los modelos de imágenes propietarios con puntuación inicial líder. En esa instantánea, es el modelo de desarrollo chino mejor clasificado, aunque no ocupa el segundo puesto entre todos los modelos en la clasificación general en tiempo real.
Qwen-Image 3.0 Pro y Standard llegan a la API al mismo tiempo
AIBase informó que Alibaba lanzó dos versiones:
| Modelo | Posicionamiento | Precio inicial reportado |
|---|---|---|
| Qwen-Image 3.0 Pro | Edición insignia de mayor calidad | 0,04 USD por imagen |
| Qwen-Image 3.0 Standard | Edición general de menor coste | 0,03 USD por imagen |
La página oficial del modelo Pro en Qwen Cloud enumera actualmente precios internacionales más detallados:
| Elemento de Qwen-Image 3.0 Pro | Precio oficial en Qwen Cloud |
|---|---|
| Entrada de imagen 1K | 0,003 USD por imagen |
| Entrada de imagen 2K | 0,003 USD por imagen |
| Salida de imagen 1K | 0,04 USD por imagen |
| Salida de imagen 2K | 0,075 USD por imagen |
Esto significa que el ampliamente citado "0,04 USD por imagen" se refiere al precio inicial de salida de 1K del modelo Pro. La salida de 2K tiene un precio más alto.
La página de precios puede verse modificada en cualquier momento, por lo que las aplicaciones en producción deberían leer las tarifas vigentes de Qwen Cloud o de Alibaba Cloud Bailian, en lugar de fijar en sus presupuestos a largo plazo los precios reportados por los medios.
El objetivo principal es generar imágenes útiles y densas en información
Alibaba resume el tema de Qwen-Image 3.0 en dos palabras: realismo.
La compañía divide esta idea en tres dimensiones:
- Contenido rico
- Detalles realistas
- Conocimiento profundo
Estas tres dimensiones explican por qué Qwen-Image 3.0 está orientado a escenarios de productividad, y no solo a la generación de imágenes artísticas.
Generar.
Contenido rico: indicaciones de hasta 4.5K tokens
Qwen-Image 3.0 admite entradas de instrucciones de hasta aproximadamente 4.5K tokens.
Un mayor presupuesto de indicaciones permite al usuario especificar en una sola solicitud múltiples bloques, etiquetas, personajes, fórmulas, reglas de diseño, estilos visuales y requisitos jerárquicos.
Los ejemplos oficiales de Alibaba incluyen:
- Una cuadrícula de 3×3 con nueve infografías educativas y profesionales diferentes
- Un diseño de estilo periodístico denso en texto
- Un guion gráfico completo
- Un examen
- Interfaces anidadas unas dentro de otras
- Gráficos y fórmulas matemáticas
- Tarjetas de conocimiento con diagramas, etiquetas e ilustraciones
Una demostración oficial utilizó una indicación de aproximadamente 3.7K tokens para generar una única imagen de 3×3 con nueve paneles de información independientes. Cada panel tenía su propio tema, diseño, texto, gráficos y lenguaje visual.
Complejidad horizontal y vertical
Alibaba describe dos formas de complejidad.
La complejidad horizontal se refiere a colocar múltiples elementos paralelos en el mismo lienzo sin que interfieran entre sí.
Ejemplos incluyen:
- Nueve paneles de infografía
- Menús con múltiples categorías
- Guiones gráficos de múltiples planos
- Gráficos comparativos
- Pósteres de conocimiento con múltiples módulos
La complejidad vertical se refiere a comprender relaciones visuales anidadas.
Un ejemplo oficial anida las siguientes interfaces unas dentro de otras:
Interfaz de VS Code
└── Interfaz de chat de Qwen
└── Interfaz de WeChat
└── Póster de café de filtrado manual
El modelo debe conservar la estructura reconocible de cada interfaz a la vez que sigue la relación jerárquica descrita en la indicación.
Este tipo de generación resulta especialmente útil cuando la imagen se aproxima más a un documento de diseño que a una ilustración tradicional.
Detalles realistas: texto pequeño y texturas fieles
El segundo foco está en la precisión de la renderización.
Alibaba afirma que Qwen-Image 3.0 puede generar texto claro y legible de aproximadamente 10 píxeles en sus demostraciones.
Los ejemplos oficiales incluyen:
- Contenido periodístico denso en texto
- Páginas académicas con fórmulas LaTeX
- Superíndices y subíndices
- Letras griegas
- Numeración de teoremas
- Anotaciones manuscritas
- Etiquetas finas en gráficos educativos
La compañía también destaca mejoras en los detalles físicos, incluyendo:
- Poros de la piel
- Hebras de cabello individuales
- Texturas de tejidos
- Materiales naturales
- Daños superficiales sutiles
- Degradados de tinta china
En una demostración de edición, el modelo restauró las partes faltantes de una pintura tradicional dañada, intentando preservar las pinceladas y la composición originales.
El "texto de 10 píxeles" no es una garantía absoluta
La métrica de 10 píxeles proviene de la demostración de producto de Alibaba. No debe interpretarse como que cada texto de 10 píxeles será siempre preciso en todos los idiomas, tipografías, diseños y escenarios de generación.
En producción, el texto debería revisarse en los siguientes aspectos:
- Ortografía
- Caracteres faltantes
- Puntuación
- Saltos de línea
- Consistencia tipográfica
- Precisión de fórmulas
- Exactitud de nombres de marca
El texto importante de carácter legal, médico, financiero o de producto debe comprobarse manualmente, y puede que siga siendo más seguro añadirlo después de la generación con herramientas de diseño convencionales.
Conocimiento profundo: 12 idiomas,
interfaces y contexto mundial
Alibaba afirma que el modelo admite de forma nativa la renderización de 12 idiomas y más de 20 tipografías.
Sus ejemplos oficiales de lanzamiento incluyen contenido en japonés, coreano, español, chino e inglés.
El modelo también tiene como objetivo reproducir sistemas visuales comunes, incluyendo:
- Páginas web
- Interfaces de software
- Ventanas de chat
- Juegos
- Transmisiones en vivo
- Gráficos educativos
- Gráficos científicos
Esto no requiere únicamente igualar el estilo visual. El modelo debe comprender la estructura prevista del objeto que dibuja.
Por ejemplo, un panel meteorológico debería incluir fecha, ubicación, iconos, temperatura y jerarquía de pronóstico reconocibles. Un editor de código debería tener paneles, pestañas, números de línea, área de código y barra de herramientas en posiciones razonables.
El artículo de lanzamiento de Alibaba también describe flujos de trabajo que conectan el proceso de generación con la recuperación de conocimiento externo. No debe asumirse que el modelo posee conocimiento en tiempo real en cada llamada API; la información actual depende de si el producto circundante o el flujo de trabajo del agente habilita realmente funciones de búsqueda o recuperación.
Generación y edición usan el mismo modelo
Uno de los cambios más prácticos es la combinación de generación y edición en el modelo qwen-image-3.0-pro.
La documentación oficial de API de Alibaba Cloud indica que el mismo modelo admite:
-
Generación de imagen a partir de texto
-
Conversión de imagen a imagen
-
Edición de imágenes utilizando de 1 a 3 imágenes de referencia
Esto reduce la necesidad de seleccionar un modelo para la generación inicial y otro modelo diferente para modificaciones posteriores.
El flujo de trabajo típico es el siguiente:
- Generar la primera imagen basándose en un prompt detallado.
- Usar el resultado como imagen de entrada.
- Solicitar al modelo que cambie el contenido seleccionado.
- Conservar el resto del sujeto, la composición o el estilo.
- Generar múltiples alternativas cuando sea necesario.
Las tareas de edición pueden incluir:
- Cambiar la vestimenta
- Reemplazar la escena
- Añadir o eliminar objetos
- Combinar elementos visuales de múltiples imágenes
- Corregir texto
- Reparar contenido dañado
- Transferencia de estilo
- Conservar el sujeto mientras se cambia la escena
El modelo acepta de 1 a 3 imágenes de referencia en solicitudes de edición de imágenes.
Límites oficiales de la API y formato de salida
La referencia actual de la API de Qwen Image 3.0 en Alibaba Cloud Bailian enumera las siguientes especificaciones para qwen-image-3.0-pro:
| Propiedad de la API | Valor documentado actual |
|---|---|
| Modo de generación | Texto a imagen e imagen a imagen/edición |
| Imágenes de referencia | 1–3 para edición de imágenes |
| Formato de imagen de entrada | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| Tamaño de entrada recomendado | Ancho y alto entre 384 y 2048 píxeles |
| Tamaño máximo de archivo de entrada | 10 MB por imagen |
| Rango de píxeles de salida | Resolución total de 512×512 a 2048×2048 |
| Formato de salida | PNG |
| Número de imágenes por solicitud | 1–6 |
| Idioma de los prompts en la referencia de la API | Chino e inglés |
| Tiempo de retención de URL de resultados | 24 horas |
| Límite de velocidad internacional mostrado por Qwen Cloud | 1 solicitud por minuto |
Las notas de lanzamiento más amplias del producto indican que las imágenes renderizadas pueden contener texto en 12 idiomas. Esto difiere de la afirmación en la documentación de la API de que los prompts positivos admiten chino e inglés.
En otras palabras:
- El
idioma de las instrucciones admite documentación en chino o inglés.
- Las imágenes generadas pueden incluir texto en un espectro más amplio de idiomas.
Uso de cURL para llamar a Qwen-Image 3.0 Pro
El ejemplo actual de la API internacional de Alibaba utiliza el endpoint de generación multimodal de DashScope.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
Reemplace {WorkspaceId} con el ID del espacio de trabajo asociado a su clave de API.
Alibaba Cloud utiliza claves de API y endpoints independientes para sus regiones de implementación en China y Singapur. Las claves y los endpoints no pueden combinarse entre regiones.
Edición de imágenes con el SDK de Python
El SDK oficial usa MultiModalConversation para llamar a Qwen-Image 3.0 Pro.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
Las URL generadas son temporales. Alibaba Cloud indica que los enlaces de resultados solo se conservan durante 24 horas, por lo que las aplicaciones deben descargar rápidamente las salidas aprobadas a su propio almacenamiento.
Rendimiento en Arena: sólido, pero el ranking requiere contexto
AIBase Headline informó que Qwen-Image 3.0 Pro ocupa el primer lugar entre los modelos chinos y el segundo entre los modelos convencionales.
La primera parte coincide con la instantánea en vivo de Arena revisada en este artículo: Qwen-Image 3.0 Pro es el modelo desarrollado en China con la puntuación más alta en la tabla general de texto a imagen.
La segunda parte no está respaldada en la clasificación en vivo del 4 de agosto de 2026.
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Arena muestra:
- Modelo:
qwen-image-3.0-pro - Desarrollador: Alibaba
- Puntuación: 1263 ±
11
- Estado:
Resultados de la evaluación inicial
- Ranking actual mostrado: 5.º puesto
- Rango de clasificación: 4.º–9.º puesto
- Votos mostrados: 2801
Esta puntuación es similar a la de varios sistemas competidores, con intervalos de confianza superpuestos. La etiqueta de "evaluación inicial" también implica que la clasificación puede cambiar a medida que se recopilen más votos.
Arena se basa en comparaciones de preferencia de los usuarios y no es una métrica completa para todas las necesidades de producción.
Por sí solo, no demuestra superioridad en:
- Precisión del texto
- Consistencia del producto
- Fidelidad en la edición de imágenes
- Latencia
- Fiabilidad de la API
- Comportamiento de seguridad
- Coste por activo elegible
- Idoneidad para licencias comerciales
Los equipos deben probar el modelo con sus propias indicaciones (prompts) y criterios de aceptación.
Escenarios más adecuados para este modelo
El conjunto de funciones de Qwen-Image 3.0 es especialmente relevante cuando la imagen contiene estructura visual y textual a la vez.
Guiones gráficos y planificación de series cortas
Una indicación larga puede describir múltiples planos, personajes, ángulos de cámara, anotaciones de diálogo y transiciones de escena en un solo guion gráfico.
Gráficos educativos y de divulgación del conocimiento
El modelo puede utilizarse para esbozar:
- Diagramas de cursos
- Tablas de fórmulas
- Pósteres científicos
- Tarjetas didácticas
- Maquetación de exámenes
- Ilustraciones anotadas
Todos los datos y fórmulas requieren revisión de expertos.
Comercio electrónico y publicidad
Los usos potenciales incluyen:
- Pósteres de producto
- Variantes de marketing multilingüe
- Menús
- Imágenes descriptivas de producto
- Banners promocionales
- Formatos para redes sociales
La función de edición con imagen de referencia es muy útil cuando el producto o el sujeto debe mantener una identificación consistente en diferentes variantes.
Interfaz y conceptos de producto
El modelo puede esbozar:
- Páginas web
- Interfaces de aplicación
- Salas de transmisión en directo
- Interfaces de juego
- Conceptos de UI anidados
Estas imágenes son propuestas conceptuales, no código front-end listo para producción.
Periódicos, informes y maquetación editorial de alta densidad
Un mayor presupuesto de indicaciones y la capacidad de renderizar texto en tamaños pequeños hacen que este modelo sea adecuado para explorar diseños editoriales complejos.
Si la precisión del texto es un requisito estricto en la publicación final, el texto debe sustituirse o verificarse en el software de maquetación.
Consejos prácticos para las indicaciones
El límite de 4.5K caracteres no implica que cada indicación deba agotarlos.
Las indicaciones largas funcionan mejor solo cuando están bien estructuradas.
- Definir el lienzo
Especificar claramente:
- Relación de aspecto
- Resolución objetivo
- Orientación horizontal o vertical
- Número de paneles o secciones
- Orden de lectura
- Describir contenido y estilo por separado
Primero describir el contenido informativo y después la presentación visual.
Contenido:
- Título principal
- Tres ventajas del producto
- Tabla de especificaciones
- Aviso legal al pie
Estilo:
- Diseño editorial minimalista
- Fondo azul marino oscuro
- Tipografía sans-serif blanca
- Iluminación de estudio suave
- Asignar el texto a zonas específicas
Evitar entregar al modelo una lista desordenada de frases sueltas.
Indicar a qué ubicación pertenece cada bloque de texto.
- Indicar textos exactos
Usar comillas para el contenido textual que debe aparecer en la imagen.
La ortografía generada debe comprobarse igualmente.
- Describir la jerarquía entre elementos
Para diseños anidados o de múltiples paneles, indicar qué elemento contiene a cuál.
- Usar imágenes de referencia para trabajos críticos de identidad
Cuando un producto, persona, envase u objeto específico es esencial, la edición basada en imágenes de referencia suele ser más fiable que la generación únicamente a partir de descripción de texto.
- Generar múltiples candidatos
La API admite hasta seis imágenes de salida por llamada. Generar varias opciones suele ser más eficiente que iterar repetidamente sobre una sola indicación sin comparación.
Limitaciones actuales y consideraciones de publicación
La documentación oficial sigue en desarrollo
La página de la API de Alibaba Cloud revisada estaba inicialmente marcada como vista previa limitada, mientras que los informes del 5 de agosto indican que el modelo se ha abierto de forma más amplia a través de la plataforma Qwen.
Por lo tanto, la documentación, los requisitos de acceso, los límites de tasa y los alias del modelo pueden cambiar rápidamente.
Visibilidad documental diferente entre las versiones Pro y Standard
La página pública de Qwen Cloud documenta claramente Qwen-Image 3.0 Pro. AIBase informa que la versión Standard tiene un precio de 0,03 USD por imagen, pero no se encontró ninguna página pública internacional correspondiente durante esta revisión.
El modelo es propietario
La lista en vivo de Arena marca Qwen-Image 3.0 Pro como modelo propietario. No se ha encontrado ningún lanzamiento oficial de pesos de código abierto para la versión 3.0.
El texto requiere verificación humana
La capacidad de renderizado de texto del modelo es una mejora significativa, pero no garantiza una tipografía ni una precisión factual perfectas.
Las URL de las imágenes caducan
Las URL de las imágenes generadas por la API son válidas durante 24 horas. Guarde los archivos necesarios de inmediato.
Revisar las políticas antes de uso comercial
Antes de desplegar activos generados, revise:
- Términos de servicio de Qwen Cloud
- Propiedad intelectual
- Uso de marcas comerciales
- Derechos de las imágenes de referencia
- Privacidad y derechos de imagen
- Normativas regionales sobre contenido de IA
- Requisitos de divulgación o marcas de agua
Preguntas frecuentes
¿Qué es Qwen-Image 3.0 Pro?
Qwen-Image 3.0 Pro es el modelo de tercera generación insignia de Alibaba para generación y edición de imágenes. Admite texto a imagen, edición con hasta tres imágenes de referencia, indicaciones largas, renderizado de texto multilingüe y diseños visuales densos.
¿Cuánto cuesta Qwen-Image 3.0 Pro?
Qwen Cloud fija actualmente el precio en 0,04 USD por imagen para salida 1K y 0,075 USD por imagen para salida 2K. Las imágenes de entrada para los flujos de trabajo 1K y 2K se facturan a 0,003 USD por imagen.
¿Existe una versión Standard de Qwen-Image 3.0?
AIBase informa que la versión Standard ya está disponible, con un precio inicial de 0,03 USD por imagen. No se encontró una página pública internacional correspondiente con la tabla de precios oficial completa al momento de escribir este artículo, por lo que los desarrolladores deben verificar la consola actual de Qwen Cloud antes de presupuestar en consecuencia.
¿Cuánto puede durar una indicación en Qwen-Image 3.0?
Alibaba afirma que el modelo admite entradas de hasta aproximadamente 4,5 mil tokens. El límite ampliado está diseñado para satisfacer las necesidades de guiones gráficos, periódicos, gráficos educativos, interfaces anidadas y otras imágenes con alta densidad de información.
¿Puede Qwen-Image 3.0 editar imágenes existentes?
Sí. El mismo modelo API qwen-image-3.0-pro admite conversión de imagen a imagen y solicitudes de edición con una a tres imágenes de referencia más una instrucción de texto.
¿Puede Qwen-Image 3.0 renderizar texto pequeño con precisión?
Las demostraciones de Alibaba muestran texto legible de aproximadamente 10 píxeles y páginas complejas con formato LaTeX. Los resultados siguen variando, por lo que la ortografía, fórmulas, precios, contenido legal y nombres de marca importantes requieren verificación manual.
¿Es Qwen-Image 3.0 de código abierto?
No se ha encontrado ningún lanzamiento de pesos de código abierto para Qwen-Image 3.0 Pro.
Fuentes oficiales revisadas aquí. Arena marca actualmente el modelo como propietario.
¿Cómo se clasifica Qwen-Image 3.0 Pro en Arena?
En la instantánea del Text-to-Image Arena del 4 de agosto de 2026, es el modelo desarrollado en China con la clasificación más alta, con un puesto general preliminar de quinto lugar y un rango de entre el cuarto y el noveno. Las clasificaciones de Arena cambian a medida que se añaden nuevos votos y nuevos modelos.
Herramientas relacionadas
- Qwen Cloud: Plataforma internacional de modelos de Alibaba Cloud para probar el modelo, obtener acceso a la API y consultar los precios actuales.
- Qwen-Image 3.0 Pro: Página oficial del modelo con funciones, límites de tasa, precios y ejemplos de cURL.
- Alibaba Cloud Bailian: Plataforma gestionada de Alibaba Cloud para desplegar e invocar modelos Qwen y de terceros.
- DashScope Python SDK: Paquete oficial de Python utilizado en los ejemplos de la API Qwen de Alibaba Cloud.
- [Text-to-Image Arena](https
Arena: una clasificación en tiempo real de preferencias para comparar modelos de generación de imágenes.
- Qwen Studio: la plataforma oficial orientada al usuario de Qwen para probar las funciones compatibles de los modelos.
Enlaces relacionados
- Artículo de lanzamiento oficial de Qwen-Image 3.0: la introducción detallada de Alibaba Cloud sobre contenido enriquecido, detalles auténticos y conocimiento profundo.
- Qwen-Image 3.0 Pro en Qwen Cloud: descripción general del modelo internacional actual, precios, límites de velocidad y ejemplos de solicitudes de API.
- Referencia de API de generación y edición de imágenes Qwen 3.0: parámetros de solicitud oficiales, endpoints, ejemplos de código, formatos de imagen compatibles y modos de respuesta.
- Anuncio de modelos multimodales de Alibaba Cloud: resumen oficial sobre las series Qwen-Image 3.0 y Qwen-Audio 3.0.
- Clasificación de Text-to-Image Arena: ranking en tiempo real para verificar la posición preliminar del modelo.
- Registro de cambios de la clasificación de Arena: registro oficial que muestra cuándo se añadió Qwen-Image 3.0 Pro a la clasificación.
Resumen
Qwen-Image 3.0 Pro está diseñado para tareas de imagen que combinan calidad visual con información densa. Su capacidad de prompts de 4.5K tokens, renderizado de texto pequeño, salida multilingüe, comprensión de interfaces anidadas y detalles realistas lo hacen especialmente adecuado para storyboards, carteles, diagramas educativos, interfaces y maquetación tipográfica.
El mismo modelo de API admite generación y edición, incluyendo de una a tres imágenes de referencia. Qwen Cloud actualmente fija el precio de las salidas Pro en 0,04 USD por 1K imágenes, y las salidas 2K en 0,075 USD.
El modelo muestra un rendimiento sólido en el Text-to-Image Arena en tiempo real, pero la clasificación actual no respalda la afirmación del título de la fuente sobre su posición general en segundo lugar. Se muestra en quinto lugar, con puntuaciones preliminares e intervalos de clasificación superpuestos.
El avance principal no es solo generar imágenes más estéticas; sino la capacidad de transformar instrucciones más largas y estructuradas en activos visuales editables a un costo relativamente bajo por imagen de API.



