MiniMax H3 上线 MetaSo 后,创作者可以按每秒 0.09 元的价格生成 768p AI 视频,无需自行部署模型。本文介绍 H3 的多模态能力、MetaSo 的使用方式与成本,并比较云端使用和本地部署的实际取舍。

MiniMax H3 才刚发布,关于它的讨论就已从模型质量转向了一个更实际的问题:普通创作者真正用起来到底有多便宜、多方便?
该模型因统一的文本、图像、视频和音频条件控制、原生立体声、视频编辑、基于参考的生成以及最高 2K 的输出而备受关注。同时它也是开源权重模型,开发者可以选择自行部署。
然而,开源并不意味着本地部署就能轻松搞定。
运行一个大型多模态视频模型仍然需要处理模型文件、推理框架、GPU 显存、依赖项、环境配置以及生成延迟等问题。MiniMax 官方开源文档推荐使用 SGLang、vLLM、Diffusers 和 ComfyUI 等框架,其 SGLang 部署示例就用了四块 GPU。
对于那些只想把想法变成一段视频的创作者来说,这跟“做视频”完全是两码事。
源文章重点介绍了一条第三方路径:MetaSo(秘塔AI) 已在其基于浏览器的视频生成产品中接入 MiniMax H3。在源文章展示的界面中,用户无需搭建本地环境即可直接使用 H3。
最引人注目的是测试时显示的平台专属定价:
这些是源文章中 MetaSo 展示的价格,并非 MiniMax 的通用官方 API 价格。第三方定价可能存在促销、补贴或后续调整,因此在正式生产使用前务必再次核实。

MiniMax H3 是一个能力出众的开源权重视频模型,但“开源”和“易于运行”并不是一回事。
MiniMax 官方仓库将 H3 描述为一个通用的全模态生成系统,能够理解由以下内容构成的上下文:
它可以为 4 至 15 秒的片段生成同步视频和原生立体声。
当前开源版本提供两个主要的基础模型变体:
| 模型变体 | 主要用途 | 输入 |
|---|---|---|
| H3-Base-FL2VA | 文生视频及首帧/末帧生成 | 文本加零张、一张或两张图像 |
| H3-Base-Ref2VA | 多参考音视频生成 | 文本加参考图像、视频和/或音频 |
参考模型最多支持:
MiniMax 还文档化了一套完整的 2K 工作流,将 H3-Base 与 H3-Context-IR 和 H3-Regenerate-2K 结合使用。
源文章提到 MiniMax H3 在 Artificial
分析平台(Artificial Analysis)上线后不久发布的视频编辑排行榜。
该陈述可通过2026年8月7日审查的当前快照进行验证。
Artificial Analysis 将MiniMax H3列为当前带音频视频编辑排行榜的第一名,在该视图中领先于Gemini Omni Flash。由于这些是基于用户偏好的实时排名,随着更多样本的提交,确切顺序可能会发生变化。

这是H3在编辑质量上具备竞争力的有力证据,但不应将其过度引申为H3在所有视频生成类别中永久排名第一的更广泛声明。
文生视频、图生视频、参考生成和视频编辑是各自独立的任务,排名取决于所选的筛选条件、日期、音频设置和用户投票。
来源文章提出了一个在开放模型讨论中容易被忽视的观点:许多创作者不想为了测试一个创意想法而成为推理工程师。
自托管H3工作流可能涉及:
MiniMax的官方代码仓库提供了一个类似这样的SGLang示例:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
参考生成变体使用相同的四GPU示例,只是模型变体和端口不同。
这并不意味着所有可能的H3部署都必须恰好需要四块GPU。硬件需求取决于框架、精度、并行度、分辨率、视频时长和优化方法。
但它确实表明,官方参考部署并非面向典型的消费级笔记本电脑。
模型权重可以获取,但推理仍然需要大量计算资源。
使用本地硬件的创作者需要考虑:
来源中包含一条社区帖子,一位用户在本地下载H3后遇到了内存不足的错误。
这则轶事不应被当作通用的硬件基准,但更重要的观点是成立的:能够下载模型并不等于能够流畅运行它。
来源报道称,本地生成一段大约10秒的
在某些硬件配置上,生成一个短片可能需要20到40分钟。
这并非MiniMax官方的延迟规格,实际耗时将因硬件和软件配置的不同而有显著差异。
尽管如此,对于创意工作而言,延迟仍然至关重要。
视频生成是一个迭代过程。用户可能需要多次尝试才能修正以下问题:
如果每次尝试都需要很长时间,即使模型本身可以免费下载,实验和探索的难度也会大大增加。
源文中重点介绍的工作流程,省去了本地部署的大部分步骤。
MetaSo 的主页目前在原有搜索和生产力产品旁边,新增了一个 视频生成 入口。
根据源文测试,基本流程如下:
无需在制作第一个视频前下载 H3 代码库或配置 CUDA 环境。
文章中展示的界面包含了创作者期望从 H3 中获得的主要工作流:
截图还展示了一个 H3 Context IR 选项,这与 MiniMax 的官方架构相符。
H3-Context-IR 是 MiniMax 托管的预处理和编排系统,用于解释自由形式的多模态指令。它分析文本、图像、音频和参考视频之间的关系,然后将该上下文转换为 H3-Base 能更有效利用的表示形式。
MiniMax 并未 在开源权重中提供完整的 H3-Context-IR 托管系统。它提供了一个 API 来复现官方工作流程。
这一区别有助于解释为什么托管服务可能比纯粹的本地开源权重安装更容易上手。
源文作者通过 MetaSo 测试了 H3,使用了一个简短的西部风格寻宝概念。
生成的视频片段包含:
作者报告称,从打开生成页面到收到完成的 15 秒结果,整个过程大约耗时三分钟。
这是一个单独的测试结果,并非保证的服务级别延迟。
实际生成时间可能因以下因素而异:
实际的区别在于,用户无需自己管理推理基础设施。
对于许多创作者来说,这比模型在技术上是否开源权重更为重要。
源文称,高级用户可以将该服务连接到 ComfyUI 工作流程。
这在一体化网页生成器和完全自托管模型之间提供了一个有用的中间方案。
ComfyUI 是一个开源的、基于节点的生成式 AI 工作流系统。MiniMax 官方的 H3 代码库也将 ComfyUI 列为推荐的 H3 推理/工作流选项之一。
以及H3模板的链接。
节点式工作流让用户对以下方面拥有更多控制:
实际操作中的分工如下:
| 用户类型 | 适用的工作流 |
|---|---|
| 测试创意的创作者 | 浏览器提示词界面 |
| 使用参考素材的创作者 | 浏览器多参考工作流 |
| 高级用户 | ComfyUI 或 API 工作流 |
| 基础设施团队 | 本地或云端部署开源权重 |
这也是托管访问与开源权重相辅相成而非相互排斥的原因之一。
原文后半部分聚焦于价格。
在作者测试时,MetaSo显示:
| 分辨率 | 来源中MetaSo显示的价格 |
|---|---|
| 768p | 0.09元/秒 |
| 2K | 0.15元/秒 |

这些费率产生的是非常小的单条视频成本。
| 时长 | 按0.09元/秒计算的费用 |
|---|---|
| 5秒 | 0.45元 |
| 10秒 | 0.90元 |
| 15秒 | 1.35元 |
| 时长 | 按0.15元/秒计算的费用 |
|---|---|
| 5秒 | 0.75元 |
| 10秒 | 1.50元 |
| 15秒 | 2.25元 |
这就是为什么原文将AI视频描述为以人民币计算正进入“几分钱”时代的原因。
更准确地说,这是某一时间点上第三方托管的定价,不应将其泛化到整个H3生态系统中。
MiniMax自己的API和其他提供商可能采用不同的价格、货币、分辨率、计费逻辑和促销折扣。
Artificial Analysis目前在其排行榜对比中,将H3的创作者API价格列为默认设置下每分钟1080p视频约7.80美元。这与MetaSo截图中的定价基础不同,也说明了为什么必须明确标注各提供商的具体费率。
AI视频通常不会一次尝试就产出最终结果。
创作者可能会生成一段视频,发现问题,修改提示词,然后重新尝试。
这意味着真正的成本不是:
一条视频的价格
而更接近:
每次尝试的成本 × 获得可接受结果所需的尝试次数
假设一位创作者需要尝试8次生成10秒的768p视频,才能选出一个可用的版本。
按来源中MetaSo显示的价格计算:
10秒 × 0.09元 × 8次尝试 = 7.20元
当每次尝试的成本达到几十元时,同样的基本创作过程就会变得困难得多。
更低的价格可以改变用户行为。
创作者可以负担得起测试:
其价值不仅在于节省最终成品的费用。
更在于降低了尝试的心理成本。
尤其对视频至关重要
文本生成的成本足够低廉,以至于用户很少会在要求再生成一版草稿前犹豫不决。
视频则不同。
每一次生成都要消耗多得多的算力,而且结果包含的多个维度可能同时出问题:
这使得反复采样成为常态。
因此,一个实用的生产指标是:
总花费
──────────────
可用出片数
如果一个模型每秒生成的成本较低,但又能产出足够多的可用生成结果,让每个被采纳片段的成本保持在较低水平,那么它就是有价值的。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
创作者应当同时评估价格和命中率。
价格之所以重要,是因为 H3 并非一个精简的文本生成视频模型。
MiniMax 官方仓库确认 H3 支持:
该架构还通过 H3-Omni-Transformer 联合预测视频和音频的潜变量。
这意味着一次生成可以同时包含视觉和音频结构,而不需要单独进行配音环节。
官方 H3 仓库将完整系统描述为:
H3-Base 生成 768p 输出。
随后 H3-Regenerate-2K 将基础结果与原始上下文一起输入,以更高分辨率重新生成片段。
这与简单的像素放大不同。
托管 API 可以将这些阶段对用户隐藏起来。
来源文章还展示了 MetaSo 中的 H3 API 面板。

截图提供了一个使用 MetaSo 自有 API 主机和 MiniMax-H3 模型名称的请求示例。
所展示结构的一个简化版本如下:
curl --request POST \
--url https://metaso.cn/api/minimax/v2/video_generation \
--header 'Authorization: Bearer ' \
--header 'Content-Type: application/json' \
--data '{
"model": "MiniMax-H3",
"content": [
{
"type": "text",
"text": "描述你想要生成的视频。"
}
],
"resolution": "2K",
"duration": 5,
"ratio": "16:9"
}'
这段代码反映了来源截图中可见的请求形态。开发者在生产环境部署之前,应使用 MetaSo 的最新文档或产品内的 API 面板,因为端点、字段、认证格式和限制可能会发生变化。
用于重复工作流
当团队需要以下功能时,编程访问比浏览器更有用:
托管推理让应用程序可以在不管理实际模型服务栈的情况下调用H3。
H3生态系统现在为开发者提供了多种工作方式。
最适合:
优点:
权衡:
最适合:
优点:
权衡:
最适合:
优点:
权衡:
正确的选择更多取决于工作流的经济性而非意识形态。
开放模型仍然可以通过托管服务达到最大便利性。
对于想在不进行本地部署的情况下测试H3的用户,一个合理的流程是:
在探索提示词和场景时使用较低成本模式。
在概念可行之前不要在高分辨率上投入。
一次只改变一个变量:
这样更容易理解是什么改进了结果。
保存成功的组合。
一个可复用的提示词可能比一次幸运的输出更有价值。
一旦构图和运动可接受,在更高分辨率层级生成或重新生成。
如果同一工作流频繁重复,将其移入节点图或应用程序管线。
对于商业用途,检查:
AI生成应被视为生产链的一部分,而不是唯一的审核阶段。
开发者应将模型访问与业务逻辑分离。
一个简单的架构可以如下:
应用程序
↓
生成服务
↓
提供商适配器
↓
MetaSo H3 API / MiniMax API / 自托管H3
↓
任务状态 + 输出URL
↓
存储 / 审核 / 发布
提供商适配器让后续更换推理后端变得更加容易。
可存储以下字段:
由此可构建一个有效数据集,用于比较每个可用片段的实际成本。
这个醒目数字很有吸引力,但有几个边界问题需要注意。
¥0.09/秒和¥0.15/秒是来源文章中显示的 MetaSo 价格。
不应将其引用为 MiniMax 的全球 API 标准定价。
第三方提供商可能因以下原因调整定价:
务必随时查看实时界面。
一个包含大量失败生成的工作流仍可能变得昂贵。
请衡量接受率。
MetaSo 为用户处理基础设施。
自托管提供更多控制权,但也将计算和运维负担转移到用户身上。
来源中最值得关注的部分不仅是某家提供商价格低廉。
而是两种趋势的汇合。
首先,高质量视频模型正变得更加开放。
MiniMax 发布了 H3 权重,并支持多种推理框架,包括 ComfyUI。
其次,托管平台正在将这些开放模型变成一键式服务。
由此带来更广泛的用户群体:
模型内部并不会变得更简单。
基础设施对使用者而言变得不可见。
MiniMax H3 是 MiniMax 推出的开放权重全模态视频生成系统。它可以以文本、图像、视频和音频作为上下文,生成长达 15 秒、带有原生立体声音频的同步视频片段。
来源文章显示,测试期间 MetaSo 对 768p 每生成秒收费 ¥0.09,2K 每生成秒收费 ¥0.15。这些是 MetaSo 平台价格,而非 MiniMax 的通用官方 API 费率,并且可能变化。
可以,如果你使用托管服务,例如 MiniMax 自己的 API/应用或 MetaSo 等第三方平台。提供商在其基础设施上运行模型,因此你的本地设备只需访问服务即可。
MiniMax 已在其社区许可下发布 H3 模型权重和代码。完整的托管式 H3-Context-IR 编排系统不在开放发布范围内,不过 MiniMax 为该阶段提供了 API 和提示词指南。
可以。MiniMax 官方 H3 仓库将 ComfyUI 列为推荐工作流之一,并提供了 H3 模板链接。MetaSo 也表示其托管式 H3 访问可与面向 ComfyUI 的工作流程一起使用。
工作流。
具体要求取决于推理框架、精度、时长和性能目标。MiniMax 官方的 SGLang 参考命令使用四块 GPU,因此用户不应假设普通消费级笔记本电脑就能流畅运行完整模型。
截至本文所评审的 2026 年 8 月 7 日快照,H3 在 Artificial Analysis 的带音频视频编辑排行榜上排名第一。排名是动态的,并不代表 H3 在所有视频生成类别中都位居第一。
在进行实验时,从更低廉的分辨率入手通常更合理,因为大多数概念需要多次迭代。一旦运动、构图和参考内容稳定下来,再将理想结果放入更高分辨率的工作流中。
MiniMax H3 采用开放权重,但本地部署仍然涉及不小的硬件和工程开销。MiniMax 官方的参考服务示例使用了多 GPU 的 SGLang 配置,这有助于解释为什么许多视频创作者更倾向于托管路线。
源文章展示了 MetaSo 如何将 H3 转化为一种
基于浏览器的服务,提供文生视频、图生视频、多参考生成、API访问以及面向ComfyUI的工作流。在测试时,MetaSo显示的定价为768p每秒0.09元,2K每秒0.15元。
这些低廉的第三方费率之所以重要,是因为AI视频本质上是一个迭代过程。更便宜的尝试让创作者在最终确定高分辨率结果之前,能够测试更多的镜头方向、提示词、场景和剪辑。
真正的转变不仅在于H3是开源的——更在于开源权重视频模型正日益变得像普通网络服务一样易于使用。
从一句话开始,几分钟内拿到完整网站。