MiniMax H3 开源深度解读:15 秒 2K 原生立体声,视频模型的「DeepSeek 时刻」来了?
8 月 3 日,MiniMax 正式开源通用视频模型 H3:统一理解文本/图像/视频/音频多模态上下文,输出最长 15 秒、最高 2K、32kHz 原生立体声视频,33B 参数支持本地部署,魔搭与 Hugging Face 同步开放。这是国产视频模型第一次把完整的私有化方案交给开发者。
核心结论
H3 输出最高 2K/15 秒/32kHz 原生立体声,33B dense 骨干支持本地部署
Ref2VA 支持 9 图 + 3 视频 + 3 音频(最多 12 文件)全模态参考,可做人声与嘴型编辑
完整 2K 体验依赖未开源的 Context-IR 与 Regenerate-2K API,开源≠完整官方体验
视频模型进入「开源私有化」赛道,数据不出内网成为现实选项
真实场景案例
影视后期:用 Ref2VA 做多语种配音替换
一支纪录片团队需要为同一片段生成中、英、日三个语种的解说,并保持口型、画面与背景音乐不变。
- 1选取 15 秒原片段作为参考视频,保留画面与 BGM
- 2为每个语种提供一段参考人声(音色样本)
- 3用 Ref2VA 生成三版带口型的对白视频
- 4本地部署 H3-Base 处理素材,素材不出内网
三语版本 1 天内完成初稿,传统配音+重录流程需要 1-2 周;口型同步率约 80%,剩余由剪辑微调。
- 音色参考需提供干净、无背景噪声的样本
- 多语种文化表达差异仍需人工校对,避免直译腔
对比判断表
| 能力 | H3-Base 本地 768p | H3 完整 2K 工作流(API) | Wan3.0 | Seedance 2.5 |
|---|---|---|---|---|
| 最大时长 | 15 秒 | 15 秒 | 30 秒 | 30 秒 |
| 分辨率 | 768p | 最高 2K | 最高 1080P(API) | 高分辨率 |
| 音频 | 32kHz 立体声 | 32kHz 立体声 | 支持 | 支持 |
| 输入模态 | 图/视频/音频最多 12 文件 | 同左 + Context-IR | 文本/图/音/视频 + 文档 | 最多 50 参考素材 |
| 开放方式 | 开源权重 | 官方 API | 公测 + API | 火山引擎 API |
| 适合场景 | 私有化/涉密/声音编辑 | 高质量成片 | 课件/汇报/文档转视频 | 广告/一致性 |
落地检查清单
H3 是什么
MiniMax H3 是一个通用型全模态生成系统:能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频(32kHz 采样率)的视频,输出帧率 24FPS,稳定支持 11 种语言。
模型在 7 月 31 日发布,8 月 3 日宣布开源权重。与常见「开源即宣传」不同,H3 的开源包含完整权重、技术说明和推荐工作流,魔搭社区与 Hugging Face 同步开放,16 家芯片与平台完成首日适配。
技术亮点:三模块系统与 33B 骨干
H3 完整系统由三部分组成:H3-Context-IR(托管式预处理系统,把复杂多模态指令提炼为模型易理解的中间表示,目前提供 API)、H3-Base(本地可部署的生成骨干,768p 输出)、H3-Regenerate-2K(把 768p 结果连同原始上下文送回模型重新生成 2K,通过 in-context 方式避免传统超分的信息丢失,目前提供 API)。
H3-Base 是一个 33B 参数的 dense 单流 Transformer,其中约 13B 参数位于 AdaLN 分支,推理部署时可缓存跳过;视觉编码器复用 Qwen3-VL-32B 的预训练权重。支持 SGLang、vLLM、diffusers、ComfyUI 等框架,社区已出现 Apple Silicon 的 MLX 移植版本。
输入规格:从首尾帧到全模态参考
H3 发布两个任务型 checkpoint:H3-Base-FL2VA 支持文生视频、首帧生视频、尾帧生视频、首尾帧生视频;H3-Base-Ref2VA 支持全模态参考模式——最多 9 张图像、3 段视频、3 段音频,所有类型输入合计最多 12 个文件,可实现人物保留、动作与嘴型编辑、音色参考、原始音频复用等复合任务。
官方给出的 Ref2VA 示例很有代表性:模型保留原视频中的人物身份、服装、镜头构图、光线和场景,部分复用原视频背景音乐,同时参考另一段男性语音的音色,为人物生成新的对白与匹配的嘴型。
开源的意义:视频模型的「DeepSeek 时刻」?
DeepSeek 用开源与低成本改写了文本模型的竞争格局;MiniMax H3 把同一逻辑带进视频赛道:本地可部署的完整权重、清晰的许可协议、可复现的工作流。对开发者而言,这意味着「数据不出内网」的视频生成成为可能——涉密素材、未发布产品、特殊行业内容都可以在私有环境处理。
但也要理性看待差距:H3-Context-IR 与 2K 再生成模块尚未开源(提供 API),完整 2K 体验仍依赖官方服务;768p 本地部署需要 33B 权重对应的显存预算。开源是「可以私有化」,不等于「免费获得全部官方体验」。
与 Wan3.0 / Seedance 2.5 / FLUX 3 的定位差异
四款模型的竞争维度完全不同:Wan3.0 主打文档转视频与 30 秒长片段,Seedance 2.5 主打 50 参考素材的一致性控制,FLUX 3 主打原生 1080p 画质,MiniMax H3 主打开源私有化 + 原生音频。
选型建议:需要私有化部署选 H3;需要配音与声音编辑选 H3(原生立体声);需要文档转视频选 Wan3.0;需要广告级一致性选 Seedance 2.5;需要极致画质可以对比 FLUX 3 与官方 2K API。
界面与截图

常见问题
H3 开源可以商用吗?
基于 MiniMax H3 Community License 发布,商用前须确认许可条款中的使用限制与义务。
本地部署需要什么硬件?
H3-Base 为 33B 参数权重,具体取决于量化方式与框架(SGLang/vLLM/diffusers/ComfyUI),建议先按官方说明评估显存。
2K 输出必须要用 API 吗?
H3-Regenerate-2K 模块目前未开源,官方 2K 工作流需调用其 API;本地 H3-Base 直接输出 768p。
H3 和 Wan3.0 怎么选?
需要私有化与声音编辑选 H3;需要文档/PPT 转视频与 30 秒长片段选 Wan3.0。