Introducción
MiniMax ha lanzado oficialmente MiniMax H3, un modelo universal de generación de video multimodal capaz de comprender texto, imágenes, video y audio dentro de un mismo flujo de trabajo generativo.
Este lanzamiento marca un cambio respecto a tratar la generación de video a partir de texto, la generación de video a partir de imágenes, la generación con video de referencia, la sincronización de audio y la edición como tareas independientes. En su lugar, H3 está diseñado para recibir simultáneamente múltiples tipos de contexto y utilizar instrucciones en lenguaje natural para describir cómo deben interactuar entre sí estos contenidos de referencia.
Según MiniMax, H3 admite salida de video con audio estéreo nativo, puede generar clips de hasta 15 segundos y ofrece salida en resolución 2K a través de la API actual.
La compañía posiciona este modelo en el ámbito de la creación de contenido comercial, incluyendo publicidad, branding, comercio electrónico, diseño de productos, UI/UX y videojuegos.

El lanzamiento también hace especial hincapié en el costo de generación. MiniMax afirma que H3, manteniendo capacidades de referencia multimodal y salida de alta resolución, tiene un costo por segundo de generación inferior al de muchos sistemas de generación de video convencionales.
H3: de tareas de video especializadas a la generación multimodal unificada
Los primeros modelos de video solían organizarse en torno a flujos de trabajo independientes.
Los creadores podían elegir un modelo o interfaz para generar video a partir de texto, otro para animar imágenes, y utilizar un proceso diferente para la edición con video de referencia o la sincronización de audio.
H3 intenta unificar estos casos de uso en un contexto multimodal compartido.
La documentación actual de la API de MiniMax describe tres modos principales de generación:
| Modo de generación | Entrada | Uso típico |
|---|---|---|
| Video a partir de texto | Prompt de texto | Generar un video nuevo a partir de una descripción textual |
| Video a partir de imagen (primer/último fotograma) | Prompt más primer y/o último fotograma | Animar imágenes o controlar el inicio y el final de un clip de video |
| Generación con referencia | Prompt más imágenes, video y/o audio | Conservar sujetos, movimientos, estilo de cámara, sonido o ritmo de edición |
Por lo tanto, el modelo no se limita a convertir una frase en un video.
También puede incorporar medios de referencia como parte del contexto de generación.
Para la generación con referencia, la API de MiniMax admite las siguientes combinaciones:
- Hasta 9 imágenes de referencia
- Hasta 3 videos de referencia
- Hasta 3 clips de audio de referencia
- Un máximo total de 12 archivos multimedia
Los videos de referencia pueden tener una duración total de hasta 15 segundos, y el audio debe ir acompañado de al menos una imagen o un video de referencia.
Esta estructura permite a los creadores describir las relaciones entre diferentes entradas sin necesidad de procesar manualmente cada modalidad como una etapa independiente.
El lenguaje natural se convierte en el puente entre modalidades
Las fuentes de AIBase describen una de las ideas centrales de H3 como Representación Omni Contextual (Contextual Omni Representation).
El concepto consiste en utilizar el lenguaje natural como vínculo entre los diferentes
tipos de medios.
Los usuarios pueden proporcionar simultáneamente múltiples materiales de referencia y describir en lenguaje cotidiano las relaciones previstas entre ellos.
Por ejemplo, un flujo de trabajo podría pedir conceptualmente a H3 que:
- Reutilice el movimiento de cámara de un video de referencia
- Conserve a la persona que aparece en una imagen de referencia
- Siga el ritmo o el sonido de una referencia de audio
- Aplique todas estas restricciones simultáneamente a una escena recién generada
Esto difiere fundamentalmente de un simple prompt de texto a video.
El modelo no solo debe comprender qué contiene cada entrada multimedia, sino también qué papel debe desempeñar cada entrada en la generación final.
La API pública de MiniMax refleja este diseño mediante entradas multimodales basadas en roles, como por ejemplo:
first_frame(primer fotograma)last_frame(último fotograma)reference_image(imagen de referencia)reference_video(video de referencia)reference_audio(audio de referencia)
Los usuarios todavía deben proporcionar un prompt de texto, pero este puede actuar como una capa de instrucciones por encima de múltiples fuentes multimedia.
H3 admite audio estéreo nativo y salida 2K de hasta 15 segundos
MiniMax afirma que H3 puede generar directamente video con audio estéreo nativo, sin necesidad de recurrir posteriormente a un flujo de generación de audio independiente.
La documentación actual para desarrolladores incluye la siguiente información:
- Nombre del modelo:
MiniMax-H3 - Resolución de salida: 2K
- Duración de salida: hasta 15 segundos
- Relaciones de aspecto comunes: admitidas
- Relación de aspecto adaptativa: aplicable a flujos de trabajo de referencia adecuados
La referencia de la API acepta actualmente duraciones enteras de 4 a 15 segundos, mientras que las guías más avanzadas para desarrolladores indican un rango normal de salida de 5 a 15 segundos.
Esta sutil diferencia en la documentación merece atención al desarrollar con la API: los desarrolladores deben seguir el patrón de endpoint actual correspondiente a su cuenta y SDK.
Para la generación puramente a partir de texto, es necesario especificar explícitamente la relación de aspecto.
Las relaciones de aspecto admitidas en la referencia actual de la API incluyen:
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
Los flujos de trabajo con referencia también pueden utilizar tamaños adaptativos.
Las primeras pruebas se centran en la creación de contenido comercial
MiniMax afirma que las primeras pruebas muestran un sólido rendimiento en múltiples ámbitos de aplicación práctica.
Estos ámbitos incluyen:
- Seguimiento de instrucciones
- Presentación de marca y texto
- Transferencia de movimiento de video a video
- Generación multimodal
- Edición controlada
- Producción creativa comercial
La compañía destaca especialmente los siguientes casos de aplicación:
- Publicidad
- Construcción de marca
- Comercio electrónico
- Diseño de productos
- UI/UX (interfaz de usuario/experiencia de usuario)
- Videojuegos
Estas descripciones de rendimiento provienen de la propia MiniMax y de informes relacionados con el lanzamiento, no de evaluaciones comparativas públicas independientes.
Esta distinción es importante.
La calidad de la generación de video difícilmente puede resumirse en una sola puntuación. Un modelo puede destacar en transferencia de movimiento, pero ser más débil en detalles faciales finos, tipografía, consistencia de identidad a largo plazo o interacciones complejas entre múltiples objetos.
Por lo tanto, la forma más fiable de evaluar si H3 es adecuado para la producción es probarlo con el contenido que el equipo realmente necesita crear.
H3 adopta una nueva arquitectura tecnológica multimodal
El informe de AIBase y los materiales de lanzamiento de MiniMax describen varias tecnologías detrás de H3:
- Representación Omni Contextual (Contextual Omni Representation)
- H3-VAE
- H3-Omni Transformer (Transformador Omni)
- Regeneración en contexto (In-Context Regeneration)
La documentación pública de la API se centra actualmente más en cómo utilizar H3 que en publicar detalles técnicos completos.
Los artículos de investigación relacionados con estos componentes aún no se han hecho públicos, por lo que las descripciones arquitectónicas detalladas deben considerarse como especificaciones de producto de MiniMax, a menos que un informe técnico proporcione detalles adicionales reproducibles.
Representación Omni Contextual
Este componente está diseñado para representar conjuntamente texto, imágenes, video y audio en un contexto compartido.
Su función es ayudar a H3 a comprender la relación entre múltiples fuentes de referencia y las instrucciones en lenguaje natural.
H3-VAE
H3-VAE se describe como parte de la pila de representación y generación de video del modelo.
Un VAE de video normalmente comprime información de video de alta dimensión en una representación latente más manejable para la generación y decodificación.
En la documentación revisada al momento de redactar este artículo, MiniMax aún no ha publicado suficientes detalles técnicos públicos para describir de forma independiente el diseño exacto de H3-VAE.
H3-Omni Transformer
El H3-Omni Transformer se presenta como el componente del modelo responsable de la generación multimodal unificada.
Su nombre refleja el objetivo más amplio del modelo: un solo sistema capaz de manejar el razonamiento sobre múltiples tipos de medios, en lugar de alternar entre diferentes modelos expertos independientes.
Regeneración en contexto
MiniMax también enumera la Regeneración en contexto como parte de la pila tecnológica de H3.
Su función prevista es aprovechar la información ya presente en el contexto multimodal para mejorar la generación.
Al igual que con otros nombres de arquitectura, el flujo de entrenamiento detallado y los resultados de los experimentos de ablación no se proporcionaron en la documentación pública de la API en el momento del lanzamiento.
El precio de H3 se basa en la duración del video
El artículo de AIBase destacó la rentabilidad de H3.
Los precios oficiales actuales de pago por uso de MiniMax ofrecen referencias numéricas más claras.
| Resolución | Precio oficial de la API |
|---|---|
| 2K | $0.13 por segundo generado |
| 768P | $0.09 por segundo generado |
Los materiales de referencia de entrada tienen reglas de facturación separadas.
MiniMax enumera actualmente:
- Referencia de audio: gratuita
- Primeras 5 imágenes de referencia: gratuitas
- Imágenes de referencia adicionales: $0.04 cada una
- Referencia de video: facturada según la duración del video de entrada y la resolución de salida objetivo
MiniMax indicó que, por segundo, el costo de H3 en resolución 2K es menos de un tercio del de los principales modelos competidores, y en resolución 768P es menos de la mitad del precio de las alternativas 720P más comunes.
Estas comparaciones relativas son afirmaciones del fabricante, ya que los resultados dependen en gran medida de los modelos competidores incluidos, los planes, las resoluciones y los métodos de facturación.
Al planificar presupuestos, los desarrolladores deben basarse primero en las tarifas publicadas de la API de H3 y luego comparar con precisión con las alternativas que realmente utilizan.
Por qué el costo por segundo es importante para el video con IA
El costo de generar video aumenta linealmente con la duración de la salida, por lo que los gastos pueden acumularse rápidamente.
Esto cambia la economía de la iteración por prueba y error.
Los creadores rara vez generan el fragmento perfecto al primer intento.
Un flujo de producción completo puede implicar:
- Múltiples experimentos con indicaciones
- Múltiples intentos de mantener la consistencia del personaje
- Variaciones en el movimiento de la cámara
- Diferentes relaciones de aspecto
- Correcciones de marca o producto
- Generación final en alta resolución
Incluso una pequeña reducción en el costo por segundo genera ahorros considerables cuando los equipos crean decenas o cientos de versiones alternativas.
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Esto es especialmente importante en escenarios como:
Publicidad y comercio electrónico, donde una campaña puede requerir:
- Múltiples productos
- Múltiples mercados
- Diferentes idiomas
- Formatos horizontales y verticales
- Múltiples variantes creativas
Por lo tanto, el posicionamiento de precios de H3 no solo considera el costo del video final individual, sino que se centra en la economía de la iteración.
La generación con referencia es una de las capacidades más importantes de H3
La API actual de MiniMax admite generación con referencia combinando imágenes, videos y audio.
Esto permite flujos de trabajo como:
- Mantener la consistencia del producto o personaje a partir de una imagen
- Seguir el movimiento de un video de referencia
- Tomar prestado el comportamiento de cámara de otro clip de video
- Usar una pista de audio de referencia para control temporal o doblaje
- Combinar múltiples tipos de materiales de referencia en una sola solicitud
MiniMax afirmó que H3 puede preservar las características del sujeto o material de referencia en toda la salida generada.
Esto es especialmente importante para trabajos comerciales.
Las indicaciones de texto generales pueden generar clips de video visualmente atractivos, pero aún pueden alterar:
- Logotipos
- Proporciones del producto
- Vestimenta
- Identidad del personaje
- Empaques
- Colores de marca
Los flujos de trabajo basados en referencia ofrecen más control sobre estas variables.
Sin embargo, esto no garantiza una preservación perfecta de la identidad, por lo que los equipos deben revisar cada material generado antes de publicarlo.
El control del primer y último fotograma añade otro flujo de producción
H3 también admite el uso del primer fotograma, el último fotograma o ambos.
Esto es útil cuando los creadores ya saben cómo debe comenzar o terminar la toma.
Los usos típicos incluyen:
- Animar una imagen estática de producto
- Crear transiciones entre dos imágenes
- Hacer coincidir el inicio de una toma con el final de otra
- Controlar el estado final de una transformación
- Construir secuencias de edición más predecibles
La API de MiniMax trata la generación con primer/último fotograma y la generación con referencia como dos modos independientes.
Una solicitud no puede mezclar los roles first_frame o last_frame con los roles reference_image, reference_video o reference_audio en la misma tarea.
Esta limitación es muy importante para los desarrolladores que integran la API.
MiniMax planea publicar los pesos del modelo H3
Una de las partes más llamativas del anuncio es que MiniMax planea publicar los pesos del modelo H3.
La compañía indicó que los pesos se publicarán en los próximos días, sujeto a las leyes y regulaciones aplicables.
MiniMax cree que publicar los pesos ayuda a:
- Expandir el ecosistema de modelos abiertos
- Apoyar versiones personalizadas
- Acelerar la adaptación a diferentes hardware
- Reducir la dependencia de un único servicio alojado
- Fomentar la experimentación en investigación e implementación
La compañía también afirmó que la compatibilidad de hardware se consideró desde el diseño inicial de H3, incluida la compatibilidad con una gama más amplia de hardware de IA.
Al momento de redactar este artículo, las páginas oficiales de GitHub y Hugging Face de MiniMax son accesibles públicamente, pero no se han vinculado repositorios confirmados de pesos públicos de H3 en la documentación oficial de la API de H3 revisada aquí.
Esto significa que los desarrolladores deben esperar los enlaces oficiales de MiniMax en lugar de descargar pesos de espejos no autorizados.
Corrección sobre la afirmación del "primer modelo de video chino con pesos de código abierto"
AIBase
Este artículo afirmó que el anuncio de lanzamiento de H3 fue la primera vez que un modelo de base de generación de video chino abrió sus pesos a la comunidad.
En términos generales, esta afirmación es históricamente inexacta.
Alibaba publicó los pesos y el código de inferencia de su modelo de generación de video Wan2.1 en febrero de 2025, y las variantes posteriores de Wan2.1 también se han lanzado públicamente.
El punto de diferenciación más sólido de H3 es su arquitectura unificada multimodal general, que incluye texto, imagen, video y audio como referencia, así como salida nativa de audio y video—no que sea el primer modelo de video chino con pesos abiertos.
Los pesos abiertos facilitan la adaptación al hardware
En mercados donde las organizaciones desean más control sobre la infraestructura, los pesos abiertos de los modelos son cruciales.
Las API alojadas son más fáciles de empezar, pero los pesos abiertos permiten:
- Despliegue en infraestructura privada
- Optimización de kernels para hardware local
- Cuantización de modelos
- Construcción de tiempos de ejecución de inferencia especializados
- Ajuste fino o adaptación de componentes dentro de lo que permita la licencia
- Integración con aceleradores nacionales
- Mantener datos sensibles en entornos controlados
Si H3 puede alojarse realmente de forma autónoma dependerá de información aún no publicada en el artículo fuente, incluyendo:
- Número de parámetros
- Requisitos de memoria de video
- Precisión de inferencia
- Requisitos de paralelización
- Configuración mínima de hardware
- Términos de licencia
- Soporte para entrenamiento o ajuste fino
Hasta que se publiquen los pesos oficiales y la documentación técnica, las afirmaciones sobre compatibilidad con GPU de consumo o costos de alojamiento autónomo son especulativas.
MiniMax reconoce que H3 aún tiene margen de mejora
MiniMax también indicó que este modelo no es el punto final de la serie H.
La compañía señaló las siguientes direcciones:
- Detalles de imagen finos
- Escala general del modelo
- Expansión adicional de capacidades
MiniMax afirmó que planea continuar expandiendo la serie H y eventualmente integrar las capacidades de las familias de modelos H y M.
La familia H se centra actualmente en generación multimodal, especialmente video.
La familia M incluye los modelos de lenguaje y agentes de MiniMax.
Una fusión futura podría apuntar a un sistema donde una sola familia de modelos pueda manejar:
- Razonamiento del lenguaje
- Ejecución de agentes
- Comprensión de imágenes
- Comprensión de video
- Audio
- Creación de video
- Edición
Esto sigue siendo una dirección prospectiva, no un producto unificado ya lanzado.
El cambio de H3 en los flujos de trabajo de generación de video
La contribución más importante de H3 no es solo una mayor resolución.
El cambio más grande es que varias operaciones de creación que antes eran independientes ahora pueden completarse en un solo contexto.
Los creadores pueden pasar de:
Genera un video a partir de esta frase.
A:
Usa a esta persona, sigue el movimiento de este video, mantén esta identidad visual,
obtén pistas de ritmo de este audio y crea una nueva escena según esta indicación.
Esto cambia el papel del modelo de video.
Ya no actúa como un generador de un solo propósito, sino más bien como un motor creativo multimodal.
Para los equipos comerciales, el valor dependerá de en qué medida H3 pueda mantener consistentemente la coherencia de referencia, seguir instrucciones complejas, renderizar mensajes de marca y mantenerse rentable.
A través de generaciones de evolución.
Preguntas frecuentes
¿Qué es MiniMax H3?
MiniMax H3 es un modelo multimodal de generación de video lanzado por MiniMax. Acepta texto, imagen, video y audio como contexto, y admite generación de video a partir de texto, generación de video a partir de imagen, generación basada en materiales de referencia y creación de video controlada.
¿Qué resoluciones admite MiniMax H3?
La documentación actual de la API de MiniMax enumera 2K como la resolución principal de salida de H3. Su página de precios también enumera un nivel de facturación de 768P.
¿Cuál es la duración máxima del video de MiniMax H3?
La documentación oficial de H3 admite salidas de video de hasta 15 segundos. La referencia de la API actualmente acepta valores de duración enteros entre 4 y 15 segundos.
¿MiniMax H3 genera audio?
Sí. MiniMax describe H3 como compatible con salida de video estéreo nativa, por lo que el audio puede generarse como parte del flujo de trabajo de video sin depender siempre de un modelo de postproducción separado.
¿Cuál es el costo de la API de MiniMax H3?
Actualmente, MiniMax fija el precio de H3 en $0.13 por segundo para generación a resolución 2K y $0.09 por segundo para resolución 768P. Según las reglas de facturación publicadas, los videos de referencia y las imágenes adicionales pueden aumentar los costos de materiales de entrada.
¿H3 puede usar simultáneamente imágenes de referencia, videos y audio?
Sí. La API oficial admite imágenes de referencia, videos y audio en el mismo flujo de trabajo de generación con referencia, sujeto a límites de cantidad de archivos, duración, tamaño y combinaciones de entrada.
¿MiniMax H3 es de código abierto?
MiniMax ha anunciado planes para publicar los pesos del modelo H3 en los próximos días, sujeto a las regulaciones aplicables. Al momento de redactar este artículo, la API oficial ya está disponible, pero en la documentación oficial consultada no se ha confirmado un enlace a un repositorio público de pesos de H3.
¿Es H3 el primer modelo de video con pesos de código abierto de China?
No, no en un sentido histórico amplio. Alibaba publicó los pesos del modelo de generación de video Wan2.1 en
2025. Lo que hace más notable a H3 es que combina referencias multimodales y capacidades nativas de generación de audio y video en un modelo de video general.
Herramientas relacionadas
- API de MiniMax H3: Documentación oficial para flujos de trabajo de texto a video, imagen a video y generación con referencia de H3.
- Plataforma abierta de MiniMax: Plataforma para desarrolladores de MiniMax, que ofrece claves API, acceso a modelos, facturación y recursos para desarrolladores.
- GitHub de MiniMax: Organización oficial de GitHub de la empresa para proyectos de código y modelos públicos.
- Hugging Face de MiniMax: Organización oficial de Hugging Face de MiniMax para recursos públicos de modelos.
- Wan2.1: Serie de modelos de generación de video de código abierto de Alibaba, útil como referencia histórica para modelos de video con pesos abiertos.
Enlaces relacionados
- Sitio web oficial de MiniMax: Sitio web oficial de MiniMax, que actualmente lista H3 como su nuevo modelo de generación de video.
- Guía de generación de video MiniMax H3: Documentación oficial de especificaciones del modelo, modos compatibles, límites de entrada y flujos de trabajo.
- Referencia de API de MiniMax H3: Especificación oficial del endpoint V2 para crear tareas de generación de video H3.
- Precios de API de MiniMax: Precios oficiales actuales de pago por uso para H3 y sus reglas de facturación de medios de referencia.
- GitHub oficial de MiniMax: Organización oficial para seguir el código y los recursos de modelos publicados.
- Alibaba: modelo de video de código abierto Wan 2.1: Confirmación histórica oficial de que los modelos de video con pesos abiertos de China ya estaban disponibles antes de H3.
- Repositorio de GitHub de Wan 2.1: Código de inferencia público y pesos de la familia anterior de generación de video de código abierto de Alibaba.
Resumen
MiniMax H3 integra texto, imágenes, video y audio en un único flujo de trabajo general de generación de video. Admite salidas de hasta 15 segundos a 2K, audio estéreo nativo, control del primer y último fotograma, y generación con referencia usando múltiples tipos de medios.
Su propuesta comercial se centra en dos aspectos: control y costo. MiniMax afirma que H3 tiene un buen desempeño en el seguimiento de instrucciones, presentación de marca y transferencia de movimiento, mientras que su API oficial actualmente fija el precio de generación 2K en $0.13 por segundo y 768P en $0.09 por segundo.
MiniMax también planea publicar los pesos del modelo, aunque al momento de la revisión de la documentación oficial, no había un enlace a un repositorio confirmado de pesos de H3.
El cambio más importante de H3 no es solo el video 2K, sino el avance hacia un sistema de generación multimodal unificado que entiende cómo deben funcionar juntos el texto, las imágenes, el video y el audio.



