MiniMax H3 是一款统一理解文本、图像、视频和音频的通用多模态视频模型,支持 2K 输出与原生立体声。本文梳理其生成、参考、编辑和音频同步能力。

MiniMax 正式发布 MiniMax H3,这是一款通用多模态视频生成模型,能够在同一生成工作流中理解文本、图像、视频和音频。
此次发布标志着不再将文生视频、图生视频、参考视频生成、音频同步和编辑视为相互独立的任务。相反,H3 被设计为能够同时接收多种类型的上下文,并使用自然语言指令来描述这些参考内容之间应如何交互。
据 MiniMax 介绍,H3 支持原生立体声音视频输出,可生成最长15秒的片段,并通过当前 API 提供2K分辨率输出。
该公司将该模型定位于商业内容创作领域,包括广告、品牌推广、电子商务、产品设计、UI/UX 和游戏。

此次发布还着重强调了生成成本。MiniMax 表示,H3 在保持多模态参考和高分辨率输出能力的同时,其每秒生成成本低于许多主流视频生成系统。
早期的视频模型往往围绕独立的工作流进行组织。
创作者可能会选择一种模型或接口用于文生视频,另一种用于图像动画,再采用不同的流程来处理参考视频编辑或音频同步。
H3 试图将这些用例统一到共享的多模态上下文中。
MiniMax 当前的 API 文档描述了三种主要的生成模式:
| 生成模式 | 输入 | 典型用途 |
|---|---|---|
| 文生视频 | 文本提示词 | 根据文字描述生成新视频 |
| 首/尾帧图生视频 | 提示词加首帧和/或尾帧 | 让图像动起来,或控制视频片段的开头和结尾 |
| 参考生成 | 提示词加图像、视频和/或音频 | 保留主体、动作、镜头风格、声音或剪辑节奏 |
因此,该模型不仅限于将一句话转化为视频。
它还可以将参考媒体作为生成上下文的一部分。
对于参考生成,MiniMax 的 API 支持以下组合:
参考视频总时长可达15秒,而音频必须附带至少一个图像或视频参考。
这种结构允许创作者描述不同输入之间的关系,而无需将每种模态作为独立阶段进行手动处理。
AIBase 消息源将 H3 的核心理念之一描述为 上下文全模态表示(Contextual Omni Representation)。
其概念是使用自然语言作为连接各
不同类型的媒体。
用户可以同时提供多个参考资料,并用日常语言描述它们之间预期的关系。
例如,一个工作流在概念上可能要求H3做到:
这与简单的文本生视频提示有着本质上的区别。
模型不仅要理解每个媒体输入包含什么内容,还要理解每个输入在最终生成中应当扮演什么角色。
MiniMax的公开API通过基于角色的多模态输入体现了这一设计,例如:
first_frame(首帧)last_frame(末帧)reference_image(参考图像)reference_video(参考视频)reference_audio(参考音频)用户仍然需要提供文本提示,但此时提示可以充当多个媒体源之上的指令层。
MiniMax表示,H3可以直接生成带有原生立体声音频的视频,而无需在后续额外使用独立的音频生成流程。
当前开发者文档列出的信息包括:
MiniMax-H3API参考目前接受4到15秒的整数时长,而更高级的开发者指南则介绍正常输出范围为5到15秒。
这个文档上的细微差异在基于API开发时值得注意:开发者应当遵循自己账户和SDK所对应的当前端点模式。
对于纯文本生成,必须明确指定宽高比。
当前API参考中支持的宽高比包括:
参考工作流还可以使用自适应尺寸。
MiniMax表示,早期测试在多个实际应用领域展现出强劲表现。
这些领域包括:
该公司特别强调了以下应用场景:
这些性能描述来自MiniMax自身以及相关发布报道,而不是来自独立的公开基准测试。
这一区别很重要。
视频生成质量很难用一个分数来简单概括。一个模型可能在运动迁移方面表现出色,但在精细的面部细节、字体排版、长期身份一致性或复杂的多物体交互方面却相对薄弱。
因此,评估H3是否适合投入生产最可靠的方式,就是拿它去测试团队实际需要创作的内容。
AIBase的报道和MiniMax的发布材料描述了H3背后的多项技术:
公开的API文档目前更多侧重于如何使用H3,而非发布完整的技术细节。
这些组件的相关研究论文尚未公开,因此详细的架构描述应视为 MiniMax 的产品说明,除非有技术报告提供额外的可复现细节。
该组件旨在将文本、图像、视频和音频共同表示在一个共享上下文中。
其作用是帮助 H3 理解多个参考来源与自然语言指令之间的关联。
H3-VAE 被描述为模型视频表示和生成栈的一部分。
视频 VAE 通常将高维视频信息压缩为更易管理的潜在表示,用于生成和解码。
在本文撰写时审查的文档中,MiniMax 尚未发布足够公开的技术细节,因此无法独立描述 H3-VAE 的确切设计。
H3-Omni Transformer 被定位为负责统一多模态生成的模型组件。
其命名反映了模型的更广泛目标:一个系统应能处理多种媒体类型的推理,而非在不同独立专家模型之间切换。
MiniMax 还将上下文内再生成列为 H3 技术栈的一部分。
其预期作用是利用多模态上下文中已有的信息来改进生成效果。
与其他架构名称一样,详细的训练流程和消融实验结果在发布时的公开 API 文档中并未提供。
AIBase 文章强调了 H3 的性价比。
MiniMax 当前官方的按量付费定价提供了更清晰的数值参考。
| 分辨率 | 官方 API 标价 |
|---|---|
| 2K | 每生成一秒 $0.13 |
| 768P | 每生成一秒 $0.09 |
输入参考材料有单独的计费规则。
MiniMax 目前列出:
MiniMax 表示,按每秒计算,H3 在 2K 分辨率下的成本不到主流竞品模型的三分之一,768P 分辨率下的成本不到主流 720P 替代方案价格的一半。
这些相对比较属于厂商宣称,因为结果在很大程度上取决于所包含的竞品模型、套餐、分辨率和计费方式。
在预算规划时,开发者应首先依据已公布的 H3 API 费率,然后与自身实际使用的替代方案进行精确对比。
视频生成的成本会随着输出时长而线性增长,因此费用可能迅速变得高昂。
这改变了迭代试错的经济性。
创作者很少一次就能生成完美的片段。
一个完整的生产流程可能涉及:
即使每秒生成成本仅有小幅降低,当团队创建数十乃至数百个备选版本时,累积节省也会相当可观。
这一点在以下场景中尤其重要——
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
广告和电子商务领域,一个营销活动可能需要:
因此,H3的定价定位不仅考虑单个最终视频的成本,更着眼于迭代经济性。
当前MiniMax API支持使用图像、视频和音频混合的参考生成。
这支持如下工作流程:
MiniMax表示,H3可以在整个生成输出中保留参考主体或素材的特征。
这对商业工作尤为重要。
一般的文本提示可以生成视觉上吸引人的视频片段,但仍可能改变:
参考驱动的工作流程对这些变量提供了更多控制。
但这并不能保证完美的身份保留,因此团队在发布每个生成素材前仍应进行审查。
H3还支持使用首帧、末帧或两者同时使用。
当创作者已经知道镜头应如何开始或结束时,这非常有用。
典型用途包括:
MiniMax的API将首帧/末帧生成和参考生成视为两种独立的模式。
一个请求不能在同一任务中混用first_frame或last_frame角色与reference_image、reference_video或reference_audio角色。
这一限制对集成该API的开发者来说非常重要。
该公告中最引人注目的部分之一是MiniMax计划公开H3模型权重。
该公司表示,权重计划在未来几天内发布,需遵守适用法律法规。
MiniMax认为,发布权重有助于:
该公司还表示,从H3设计之初就考虑了硬件兼容性,包括对更广泛的AI硬件兼容。
在本文撰写时,MiniMax的官方GitHub和Hugging Face组织页面可公开访问,但在此处审查的官方H3 API文档中尚未链接确认的公开H3权重仓库。
这意味着开发者应等待MiniMax官方发布链接,而不是从未经授权的镜像下载权重。
AIBase
这篇文章称H3的发布计划是中国视频生成基础模型首次向社区开放其权重。
从广义上讲,这一说法在历史上并不准确。
阿里巴巴于2025年2月发布了其Wan2.1视频生成模型的权重和推理代码,后续的Wan2.1变体也已公开释出。
H3更站得住脚的差异化点在于其通用统一多模态视频架构,包括文本、图像、视频和音频参考,以及原生音视频输出——而非它是首个开放权重的中国视频模型。
在组织希望更多掌控基础设施的市场中,开放模型权重至关重要。
托管API更易于上手,但开放权重可以实现:
H3能否实际自主托管,将取决于源文章中尚未公开的信息,包括:
在官方权重和技术文档发布之前,关于消费级GPU兼容性或自主托管成本的声称都只是推测。
MiniMax还表示,该模型并非H系列的最终终点。
公司指出了以下方向:
MiniMax表示计划继续扩展H系列模型,并最终整合H和M模型家族的能力。
H家族目前专注于多模态生成,尤其是视频。
M家族包括MiniMax的语言和智能体模型。
未来的融合可能指向这样一种系统:一个模型家族即可处理:
这仍然是一个前瞻性的方向,而非目前已发布的统一产品。
H3最重要的贡献不仅仅是更高的分辨率。
更大的转变在于,此前多个相互独立的创作操作现在可以在一个上下文中完成。
创作者可以从:
根据这句话生成一段视频。
走向:
使用这个人,跟随这段视频中的动作,保持这种视觉身份,
从这段音频中获取节奏提示,并根据此提示词创建新场景。
这改变了视频模型的角色。
它不再像一个单一用途的生成器,而更像一个多模态创意引擎。
对于商业团队而言,其价值将取决于H3在多大程度上能够一致地保持参考一致性、遵循复杂指令、渲染品牌信息,并保持经济高效。
历经数代传承。
MiniMax H3 是 MiniMax 推出的一款通用多模态视频生成模型。它可接受文本、图像、视频和音频作为上下文,并支持文生视频、图生视频、基于参考素材的生成以及受控视频创作。
MiniMax 当前的 API 文档将 2K 列为 H3 的主要输出分辨率。其定价页面还列出了 768P 的计费档位。
官方 H3 文档支持最长 15 秒的视频输出。API 参考当前接受 4 到 15 秒之间的整数时长值。
会。MiniMax 将 H3 描述为支持原生立体声音视频输出,因此音频可以作为视频工作流程的一部分生成,而不必总是依赖单独的后期制作模型。
MiniMax 目前将 H3 定价为 2K 分辨率每秒生成 $0.13,768P 分辨率每秒 $0.09。根据已公布的计费规则,参考视频和附加图片可能会增加输入素材费用。
能。官方 API 在同一个参考生成工作流程中支持参考图像、视频和音频,但需遵守文件数量、时长、大小和输入组合限制。
MiniMax 已宣布计划在未来几天内发布 H3 模型权重,具体需遵守适用法规。在本文撰写时,官方 API 已上线,但在此次查阅的官方文档中尚未确认链接到公开的 H3 权重仓库。
不是,从广义历史意义上讲并非如此。阿里巴巴于 2025 年发布了 Wan2.1 视频生成模型权重。H3 更值得关注的是它在一个通用视频模型中结合了多模态参考和原生音视频生成能力。
io/docs/api-reference/video-generation-v2-create):用于创建 H3 视频生成任务的官方 V2 端点规范。
MiniMax H3 将文本、图像、视频和音频整合到一个通用视频生成流程中。它支持最高 15 秒 2K 输出、原生立体声音频、首帧/末帧控制,以及使用多种媒体类型进行参考生成。
其商业卖点集中在两方面:控制能力和成本。MiniMax 表示,H3 在指令遵循、品牌呈现和动作迁移方面表现良好,而其官方 API 目前将 2K 生成定价为每秒 0.13 美元,768P 为每秒 0.09 美元。
MiniMax 还计划发布模型权重,不过在发布时审阅的官方文档中,尚未链接到已确认的 H3 权重仓库。
H3 最重要的转变不仅仅是 2K 视频——而是走向一个能够理解文本、图像、视频和音频应如何协同工作的统一多模态生成系统。
从一句话开始,几分钟内拿到完整网站。