MiniMax lanza oficialmente MiniMax H3, un modelo multimodal universal de generación de video capaz de comprender texto, imágenes, video y au...

MiniMax ha lanzado oficialmente MiniMax H3, un modelo universal de generación de video multimodal capaz de comprender texto, imágenes, video y audio dentro de un mismo flujo de trabajo generativo.
Este lanzamiento marca un cambio respecto a tratar la generación de video a partir de texto, la generación de video a partir de imágenes, la generación con video de referencia, la sincronización de audio y la edición como tareas independientes. En su lugar, H3 está diseñado para recibir simultáneamente múltiples tipos de contexto y utilizar instrucciones en lenguaje natural para describir cómo deben interactuar entre sí estos contenidos de referencia.
Según MiniMax, H3 admite salida de video con audio estéreo nativo, puede generar clips de hasta 15 segundos y ofrece salida en resolución 2K a través de la API actual.
La compañía posiciona este modelo en el ámbito de la creación de contenido comercial, incluyendo publicidad, branding, comercio electrónico, diseño de productos, UI/UX y videojuegos.

El lanzamiento también hace especial hincapié en el costo de generación. MiniMax afirma que H3, manteniendo capacidades de referencia multimodal y salida de alta resolución, tiene un costo por segundo de generación inferior al de muchos sistemas de generación de video convencionales.
Los primeros modelos de video solían organizarse en torno a flujos de trabajo independientes.
Los creadores podían elegir un modelo o interfaz para generar video a partir de texto, otro para animar imágenes, y utilizar un proceso diferente para la edición con video de referencia o la sincronización de audio.
H3 intenta unificar estos casos de uso en un contexto multimodal compartido.
La documentación actual de la API de MiniMax describe tres modos principales de generación:
| Modo de generación | Entrada | Uso típico |
|---|---|---|
| Video a partir de texto | Prompt de texto | Generar un video nuevo a partir de una descripción textual |
| Video a partir de imagen (primer/último fotograma) | Prompt más primer y/o último fotograma | Animar imágenes o controlar el inicio y el final de un clip de video |
| Generación con referencia | Prompt más imágenes, video y/o audio | Conservar sujetos, movimientos, estilo de cámara, sonido o ritmo de edición |
Por lo tanto, el modelo no se limita a convertir una frase en un video.
También puede incorporar medios de referencia como parte del contexto de generación.
Para la generación con referencia, la API de MiniMax admite las siguientes combinaciones:
Los videos de referencia pueden tener una duración total de hasta 15 segundos, y el audio debe ir acompañado de al menos una imagen o un video de referencia.
Esta estructura permite a los creadores describir las relaciones entre diferentes entradas sin necesidad de procesar manualmente cada modalidad como una etapa independiente.
Las fuentes de AIBase describen una de las ideas centrales de H3 como Representación Omni Contextual (Contextual Omni Representation).
El concepto consiste en utilizar el lenguaje natural como vínculo entre los diferentes
tipos de medios.
Los usuarios pueden proporcionar simultáneamente múltiples materiales de referencia y describir en lenguaje cotidiano las relaciones previstas entre ellos.
Por ejemplo, un flujo de trabajo podría pedir conceptualmente a H3 que:
Esto difiere fundamentalmente de un simple prompt de texto a video.
El modelo no solo debe comprender qué contiene cada entrada multimedia, sino también qué papel debe desempeñar cada entrada en la generación final.
La API pública de MiniMax refleja este diseño mediante entradas multimodales basadas en roles, como por ejemplo:
first_frame (primer fotograma)last_frame (último fotograma)reference_image (imagen de referencia)reference_video (video de referencia)reference_audio (audio de referencia)Los usuarios todavía deben proporcionar un prompt de texto, pero este puede actuar como una capa de instrucciones por encima de múltiples fuentes multimedia.
MiniMax afirma que H3 puede generar directamente video con audio estéreo nativo, sin necesidad de recurrir posteriormente a un flujo de generación de audio independiente.
La documentación actual para desarrolladores incluye la siguiente información:
MiniMax-H3La referencia de la API acepta actualmente duraciones enteras de 4 a 15 segundos, mientras que las guías más avanzadas para desarrolladores indican un rango normal de salida de 5 a 15 segundos.
Esta sutil diferencia en la documentación merece atención al desarrollar con la API: los desarrolladores deben seguir el patrón de endpoint actual correspondiente a su cuenta y SDK.
Para la generación puramente a partir de texto, es necesario especificar explícitamente la relación de aspecto.
Las relaciones de aspecto admitidas en la referencia actual de la API incluyen:
Los flujos de trabajo con referencia también pueden utilizar tamaños adaptativos.
MiniMax afirma que las primeras pruebas muestran un sólido rendimiento en múltiples ámbitos de aplicación práctica.
Estos ámbitos incluyen:
La compañía destaca especialmente los siguientes casos de aplicación:
Estas descripciones de rendimiento provienen de la propia MiniMax y de informes relacionados con el lanzamiento, no de evaluaciones comparativas públicas independientes.
Esta distinción es importante.
La calidad de la generación de video difícilmente puede resumirse en una sola puntuación. Un modelo puede destacar en transferencia de movimiento, pero ser más débil en detalles faciales finos, tipografía, consistencia de identidad a largo plazo o interacciones complejas entre múltiples objetos.
Por lo tanto, la forma más fiable de evaluar si H3 es adecuado para la producción es probarlo con el contenido que el equipo realmente necesita crear.
El informe de AIBase y los materiales de lanzamiento de MiniMax describen varias tecnologías detrás de H3:
La documentación pública de la API se centra actualmente más en cómo utilizar H3 que en publicar detalles técnicos completos.
Los artículos de investigación relacionados con estos componentes aún no se han hecho públicos, por lo que las descripciones arquitectónicas detalladas deben considerarse como especificaciones de producto de MiniMax, a menos que un informe técnico proporcione detalles adicionales reproducibles.
Este componente está diseñado para representar conjuntamente texto, imágenes, video y audio en un contexto compartido.
Su función es ayudar a H3 a comprender la relación entre múltiples fuentes de referencia y las instrucciones en lenguaje natural.
H3-VAE se describe como parte de la pila de representación y generación de video del modelo.
Un VAE de video normalmente comprime información de video de alta dimensión en una representación latente más manejable para la generación y decodificación.
En la documentación revisada al momento de redactar este artículo, MiniMax aún no ha publicado suficientes detalles técnicos públicos para describir de forma independiente el diseño exacto de H3-VAE.
El H3-Omni Transformer se presenta como el componente del modelo responsable de la generación multimodal unificada.
Su nombre refleja el objetivo más amplio del modelo: un solo sistema capaz de manejar el razonamiento sobre múltiples tipos de medios, en lugar de alternar entre diferentes modelos expertos independientes.
MiniMax también enumera la Regeneración en contexto como parte de la pila tecnológica de H3.
Su función prevista es aprovechar la información ya presente en el contexto multimodal para mejorar la generación.
Al igual que con otros nombres de arquitectura, el flujo de entrenamiento detallado y los resultados de los experimentos de ablación no se proporcionaron en la documentación pública de la API en el momento del lanzamiento.
El artículo de AIBase destacó la rentabilidad de H3.
Los precios oficiales actuales de pago por uso de MiniMax ofrecen referencias numéricas más claras.
| Resolución | Precio oficial de la API |
|---|---|
| 2K | $0.13 por segundo generado |
| 768P | $0.09 por segundo generado |
Los materiales de referencia de entrada tienen reglas de facturación separadas.
MiniMax enumera actualmente:
MiniMax indicó que, por segundo, el costo de H3 en resolución 2K es menos de un tercio del de los principales modelos competidores, y en resolución 768P es menos de la mitad del precio de las alternativas 720P más comunes.
Estas comparaciones relativas son afirmaciones del fabricante, ya que los resultados dependen en gran medida de los modelos competidores incluidos, los planes, las resoluciones y los métodos de facturación.
Al planificar presupuestos, los desarrolladores deben basarse primero en las tarifas publicadas de la API de H3 y luego comparar con precisión con las alternativas que realmente utilizan.
El costo de generar video aumenta linealmente con la duración de la salida, por lo que los gastos pueden acumularse rápidamente.
Esto cambia la economía de la iteración por prueba y error.
Los creadores rara vez generan el fragmento perfecto al primer intento.
Un flujo de producción completo puede implicar:
Incluso una pequeña reducción en el costo por segundo genera ahorros considerables cuando los equipos crean decenas o cientos de versiones alternativas.
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Esto es especialmente importante en escenarios como:
Publicidad y comercio electrónico, donde una campaña puede requerir:
Por lo tanto, el posicionamiento de precios de H3 no solo considera el costo del video final individual, sino que se centra en la economía de la iteración.
La API actual de MiniMax admite generación con referencia combinando imágenes, videos y audio.
Esto permite flujos de trabajo como:
MiniMax afirmó que H3 puede preservar las características del sujeto o material de referencia en toda la salida generada.
Esto es especialmente importante para trabajos comerciales.
Las indicaciones de texto generales pueden generar clips de video visualmente atractivos, pero aún pueden alterar:
Los flujos de trabajo basados en referencia ofrecen más control sobre estas variables.
Sin embargo, esto no garantiza una preservación perfecta de la identidad, por lo que los equipos deben revisar cada material generado antes de publicarlo.
H3 también admite el uso del primer fotograma, el último fotograma o ambos.
Esto es útil cuando los creadores ya saben cómo debe comenzar o terminar la toma.
Los usos típicos incluyen:
La API de MiniMax trata la generación con primer/último fotograma y la generación con referencia como dos modos independientes.
Una solicitud no puede mezclar los roles first_frame o last_frame con los roles reference_image, reference_video o reference_audio en la misma tarea.
Esta limitación es muy importante para los desarrolladores que integran la API.
Una de las partes más llamativas del anuncio es que MiniMax planea publicar los pesos del modelo H3.
La compañía indicó que los pesos se publicarán en los próximos días, sujeto a las leyes y regulaciones aplicables.
MiniMax cree que publicar los pesos ayuda a:
La compañía también afirmó que la compatibilidad de hardware se consideró desde el diseño inicial de H3, incluida la compatibilidad con una gama más amplia de hardware de IA.
Al momento de redactar este artículo, las páginas oficiales de GitHub y Hugging Face de MiniMax son accesibles públicamente, pero no se han vinculado repositorios confirmados de pesos públicos de H3 en la documentación oficial de la API de H3 revisada aquí.
Esto significa que los desarrolladores deben esperar los enlaces oficiales de MiniMax en lugar de descargar pesos de espejos no autorizados.
AIBase
Este artículo afirmó que el anuncio de lanzamiento de H3 fue la primera vez que un modelo de base de generación de video chino abrió sus pesos a la comunidad.
En términos generales, esta afirmación es históricamente inexacta.
Alibaba publicó los pesos y el código de inferencia de su modelo de generación de video Wan2.1 en febrero de 2025, y las variantes posteriores de Wan2.1 también se han lanzado públicamente.
El punto de diferenciación más sólido de H3 es su arquitectura unificada multimodal general, que incluye texto, imagen, video y audio como referencia, así como salida nativa de audio y video—no que sea el primer modelo de video chino con pesos abiertos.
En mercados donde las organizaciones desean más control sobre la infraestructura, los pesos abiertos de los modelos son cruciales.
Las API alojadas son más fáciles de empezar, pero los pesos abiertos permiten:
Si H3 puede alojarse realmente de forma autónoma dependerá de información aún no publicada en el artículo fuente, incluyendo:
Hasta que se publiquen los pesos oficiales y la documentación técnica, las afirmaciones sobre compatibilidad con GPU de consumo o costos de alojamiento autónomo son especulativas.
MiniMax también indicó que este modelo no es el punto final de la serie H.
La compañía señaló las siguientes direcciones:
MiniMax afirmó que planea continuar expandiendo la serie H y eventualmente integrar las capacidades de las familias de modelos H y M.
La familia H se centra actualmente en generación multimodal, especialmente video.
La familia M incluye los modelos de lenguaje y agentes de MiniMax.
Una fusión futura podría apuntar a un sistema donde una sola familia de modelos pueda manejar:
Esto sigue siendo una dirección prospectiva, no un producto unificado ya lanzado.
La contribución más importante de H3 no es solo una mayor resolución.
El cambio más grande es que varias operaciones de creación que antes eran independientes ahora pueden completarse en un solo contexto.
Los creadores pueden pasar de:
Genera un video a partir de esta frase.
A:
Usa a esta persona, sigue el movimiento de este video, mantén esta identidad visual,
obtén pistas de ritmo de este audio y crea una nueva escena según esta indicación.
Esto cambia el papel del modelo de video.
Ya no actúa como un generador de un solo propósito, sino más bien como un motor creativo multimodal.
Para los equipos comerciales, el valor dependerá de en qué medida H3 pueda mantener consistentemente la coherencia de referencia, seguir instrucciones complejas, renderizar mensajes de marca y mantenerse rentable.
A través de generaciones de evolución.
MiniMax H3 es un modelo multimodal de generación de video lanzado por MiniMax. Acepta texto, imagen, video y audio como contexto, y admite generación de video a partir de texto, generación de video a partir de imagen, generación basada en materiales de referencia y creación de video controlada.
La documentación actual de la API de MiniMax enumera 2K como la resolución principal de salida de H3. Su página de precios también enumera un nivel de facturación de 768P.
La documentación oficial de H3 admite salidas de video de hasta 15 segundos. La referencia de la API actualmente acepta valores de duración enteros entre 4 y 15 segundos.
¿MiniMax H3 genera audio?
Sí. MiniMax describe H3 como compatible con salida de video estéreo nativa, por lo que el audio puede generarse como parte del flujo de trabajo de video sin depender siempre de un modelo de postproducción separado.
Actualmente, MiniMax fija el precio de H3 en $0.13 por segundo para generación a resolución 2K y $0.09 por segundo para resolución 768P. Según las reglas de facturación publicadas, los videos de referencia y las imágenes adicionales pueden aumentar los costos de materiales de entrada.
Sí. La API oficial admite imágenes de referencia, videos y audio en el mismo flujo de trabajo de generación con referencia, sujeto a límites de cantidad de archivos, duración, tamaño y combinaciones de entrada.
MiniMax ha anunciado planes para publicar los pesos del modelo H3 en los próximos días, sujeto a las regulaciones aplicables. Al momento de redactar este artículo, la API oficial ya está disponible, pero en la documentación oficial consultada no se ha confirmado un enlace a un repositorio público de pesos de H3.
No, no en un sentido histórico amplio. Alibaba publicó los pesos del modelo de generación de video Wan2.1 en 2025. Lo que hace más notable a H3 es que combina referencias multimodales y capacidades nativas de generación de audio y video en un modelo de video general.
MiniMax H3 integra texto, imágenes, video y audio en un único flujo de trabajo general de generación de video. Admite salidas de hasta 15 segundos a 2K, audio estéreo nativo, control del primer y último fotograma, y generación con referencia usando múltiples tipos de medios.
Su propuesta comercial se centra en dos aspectos: control y costo. MiniMax afirma que H3 tiene un buen desempeño en el seguimiento de instrucciones, presentación de marca y transferencia de movimiento, mientras que su API oficial actualmente fija el precio de generación 2K en $0.13 por segundo y 768P en $0.09 por segundo.
MiniMax también planea publicar los pesos del modelo, aunque al momento de la revisión de la documentación oficial, no había un enlace a un repositorio confirmado de pesos de H3.
El cambio más importante de H3 no es solo el video 2K, sino el avance hacia un sistema de generación multimodal unificado que entiende cómo deben funcionar juntos el texto, las imágenes, el video y el audio.
Empieza con una sola frase y obtén un sitio completo en minutos.