MiniMax H3 测评:不做”最强画质”,专攻视觉包装的多模态视频模型,还说要开源
生成视频的模型越来越多了,但你有没有发现,大部分都在比谁画面更逼真?MiniMax H3 选了另一条路:专攻后期包装和视觉特效,把静态海报变成动态广告,给品牌 Logo 自动加花字动效。原生双声道输出,最长 15 秒,价格只要同类模型的三分之一。还宣布要开源,这在视频模型里很少见。H3 到底值不值得放进工作流,我实际试用了一圈。
产品概述
MiniMax H3 是 MiniMax(稀宇科技)在 2026 年 7 月 31 日发布的新一代多模态视频生成模型,也是 MiniMax 首款宣布开源的多模态生成模型。它的核心定位很明确,不做”什么都能拍”的通用视频生成器,而是专攻商业场景的视觉包装和后期特效。
MiniMax 从 2022 年初成立以来,一直在文本和多模态两条线并行自研。此前开源的 M 系列文本模型(M1、M2、M3)已经在开发者社区积累了一定口碑,H3 则是他们把多模态能力推向开源的关键一步。
跟市面上大多数视频模型不同,H3 不再把图片生成、视频生成、音频处理拆成独立模块,而是一个统一的”全模态”架构。它能同时理解文本、图片、音频和视频四种输入,输出原生双声道、2K 分辨率、最长 15 秒的音视频内容。换句话说,你丢给它一张海报、一段参考音乐和一句指令,它直接给你出一条带声音的成品,不用后期合成。
官网:https://www.minimax.io | 体验平台:https://hailuoai.com

核心功能实测
官方列的功能不少,但有几个是真能打,值得单独拿出来说。
全模态参考输入(Omni Reference)
这是 H3 最硬核的能力。单次生成可以同时塞进最多 9 张图片、3 段视频和 3 段音频作为参考素材。不是简单的叠加,而是模型统一理解这些素材里的角色、风格、动作和声音,再按照你的指令生成新视频。

内测用户 @Uncanny_Harry 的测试很有参考价值:他只用了 5 张静态参考图和一段文字指令,H3 就生成了保持艺术风格连贯、镜头视角还能灵活变化的短片。这种”参考驱动”的创作方式,对需要跨素材保持品牌一致性的商业团队来说,省掉了大量手动对齐的工作。
V2V Motion Transfer(视频到视频动作迁移)
把一段参考视频里的人物动作和运镜轨迹,迁移到另一段完全不同的视频里,同时尽量保持目标视频的画面风格和主体形象。这是广告和电商场景里非常实用的能力,不用重新拍摄,就能让同一个产品出现在不同的动态场景中。
指令式精准编辑
以前的视频模型基本是”生成一次如果不满意就重来”。H3 支持基于自然语言的精细化编辑:你可以指定替换某个角色、去掉背景里的某个物体、给画面加特效,不用从头生成了。这种”导演模式”的工作流对商用场景来说效率提升很明显,尤其是广告素材的多版本迭代。
文字渲染和品牌信息还原
视频模型生成文字一直是翻车高发区,缺笔画、乱码、位置错乱。H3 在这块做了专项优化,实测中 Logo 演绎、动态海报、花字动效的文字准确率明显比前代提升。当然,特别小的字还是会崩,但目前的表现已经足够满足大多数商业素材的需求。

上手流程
H3 目前主要通过两个渠道使用:MiniMax 官方 API 和海螺 AI(Hailuo AI)平台。先说海螺 AI,这是对普通用户最友好的入口。
打开 hailuoai.com,用手机号注册或 Google 账号登录就能用。新用户送 3000 积分,够免费跑几条 6 秒短片试试水。首页直接选 H3 模型,输入提示词、上传参考素材、调画面比例,点击生成。2K 视频的等待时间在 1 到 3 分钟左右,具体取决于时长和素材复杂度。

第一次生成我丢了一张静态产品海报进去,写了句”让模特戴上墨镜走出画面,镜头缓慢推进,配上电子音乐节奏”。出来的结果是 15 秒 2K 视频,墨镜的反光、模特的走位、背景音乐的节奏点都对得上。有点惊喜,之前用别的工具做类似效果,通常要跑好几轮。
但对于需要通过 API 接入的开发团队,目前有一点值得注意:H3 的模型权重虽已宣布开源,截至发稿日(2026 年 7 月 31 日)尚未在 HuggingFace 等平台释放。官方说法是”未来几天内”开放,想本地部署的团队还需要再等等。
几个隐藏技巧
很多人不知道还有这些进阶用法:
-
分镜故事板(Storyboard):在海螺 AI 的 H3 界面里,一次可以提交多个分镜描述,模型会按顺序生成连贯的多镜头片段。不用在剪辑软件里手动拼接,适合做产品演示片或活动预告。 -
12 素材混搭参考:不要只丢一张图。实测把产品图、品牌色卡、参考视频、背景音乐同时输进去,H3 的生成结果一致性远高于单独参考某一类素材。 -
指令编辑代替重生成:一个镜头 90% 满意但背景颜色不对?不要重新跑,直接写”把背景换成暖灰色,保持人物不变”。省积分也省时间,一般两轮能修到位。 -
音频分层描述:提示词里把画面镜头和声音设计分开写。例如先描述”镜头从产品特写缓慢拉远”,另起一句”音频:轻快的电子鼓点,配合产品出现的音效强调”。分开写 H3 对音频的理解准确率明显更高。
竞品对比
视频模型赛道现在选手很多,Seedance 2.0、Kling 3.0、Veo 3.1 各有各的绝活。H3 打的是差异化路线,直接看对比:
| 维度 | MiniMax H3 | Seedance 2.0 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|
| 最高分辨率 | 原生 2K | 1080P | 原生 4K | 原生 4K |
| 最长时长 | 15 秒 | 10 秒 | 15 秒 | 8 秒 |
| 原生音频 | 双声道 ✅ | 可选 ✅ | 有 ✅ | 空间音频 ✅ |
| 参考素材数 | 最多 12 个 | 有限 | 有限 | 有限 |
| 指令编辑 | 支持 | 不支持 | 基础 | 不支持 |
| 2K 单价 | $0.13/秒 | 无 2K | 不公开 | $0.50+/秒 |
| 开源 | 宣布中 | 否 | 否 | 否 |
H3 跟 Seedance 2.0 的关系,更像是互补而非替代。Seedance 强在”前期拍摄”,影视感画面、复杂镜头、高张力场景。H3 强在”后期包装”,文字控制、动效设计、品牌视觉包装。多位评测者都提到,两者结合才能覆盖视频制作的全流程。
价格上 H3 的优势是实打实的:2K 分辨率每秒 0.13 美元(约 0.8 元人民币),不到同类旗舰的三分之一。Veo 3.1 的 4K 虽强,但 8 秒时长限制和 $0.50+/秒的价格,定位明显不是同一拨用户。
真实用户怎么说
H3 昨天刚发布,社区反馈还在快速积累,但早期内测用户的评价已经能看出一些规律。
正面评价集中在视觉包装能力上。博主”数字生命卡兹克”在体验后直接说”只要涉及视觉包装相关的工作,它干得都极佳”。X 上的 @AIwithSynthia 用 Omni Reference 做了一段一镜到底的时装变换视频,评价是”人物一致性保持得极其令人印象深刻”。摄影师 @dustinhollywood 用 6200 字的长提示词跑了两段 2K 视频,说快切镜头全是 H3 生成的,没加后期剪辑。
吐槽的点也很集中。最显眼的硬伤是 4K 缺失,如果你需要影院级分辨率,H3 不是答案。再一个,一些影视级镜头的张力和冲击力不如 Seedance,“数字生命卡兹克”的评价是”某些需要超强张力的镜头,表现没有 Seedance 效果好”。还有一个实际问题是模型权重尚未释放,想本地部署的团队只能继续等。
Artificial Analysis 榜单上,H3 的视频编辑能力全球第一,这跟社区反馈方向一致,H3 的强项确实是”编辑”和”包装”,不是”凭空生成电影级画面”。
多维评分
聊了这么多,该给个量化判断了。下面按 8 个标准维度逐项打分。
| 维度 | 权重 | 评分 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ⭐⭐⭐⭐☆ | 视频生成+编辑全链路覆盖,缺 4K 和更强长镜头 |
| 易用性 | 15% | ⭐⭐⭐⭐⭐ | 海螺 AI 平台零门槛,API 接入标准 RESTful |
| 性能表现 | 15% | ⭐⭐⭐⭐☆ | 2K 生成 1-3 分钟,高峰时段偶有排队 |
| AI 能力 | 15% | ⭐⭐⭐⭐⭐ | 全模态理解+精准指令遵循,视频编辑全球第一 |
| 价格合理性 | 10% | ⭐⭐⭐⭐⭐ | 2K 单价不到竞品 1/3,参考素材前 5 张免费 |
| 生态集成 | 10% | ⭐⭐⭐☆☆ | 仅 API+Web,无插件生态,国产芯片适配中 |
| 文档与支持 | 10% | ⭐⭐⭐☆☆ | API 文档完整,缺本地部署指南(权重未释) |
| 更新频率 | 5% | ⭐⭐⭐⭐☆ | MiniMax 近半年连发 M3/Speech 2.8/H3 |
综合评分:8.3 / 10
好的坏的都说清楚
优势
-
视觉包装能力行业领先:文字渲染、Logo 演绎、花字动效、品牌风格一致性,目前没有能打的对手 -
全模态参考输入机制:12 素材混搭参考,多角色+多角度+多风格统一理解,商用流程效率翻倍 -
价格杀伤力强:2K 原生分辨率输出只要行业均价的三分之一,对中小团队极友好 -
宣布开源:虽然权重还没放出来,但开源承诺意味着未来可以本地部署、微调、适配国产芯片
不足
-
权重尚未释放:7 月 31 日宣布”近期开源”,但截至发稿日 HuggingFace 上还没有 H3 仓库 -
无 4K 支持:对影视级交付需求的团队而言,2K 可能不够。Kling 3.0 和 Veo 3.1 已经有原生 4K -
高张力镜头表现偏弱:影视感、极限画面、复杂运镜不如 Seedance 2.0,定位决定了上限
适用人群
搞清楚这个模型到底是为谁准备的很有必要,毕竟它走的不是”通吃”路线。
-
品牌/广告创意团队:需要快速产出多版本品牌视觉素材的团队,H3 的文字控制和品牌一致性是降维打击。一张海报变 15 秒动态广告,以前要半天,现在几分钟。 -
电商运营和产品营销:产品宣传片、功能演示、活动预告这些高频迭代的短视频需求,H3 的批量生成+指令编辑工作流能省掉大量外包成本。 -
UI/UX 和游戏设计:原型动效演示、游戏过场动画、App 功能展示,H3 对 UI 元素的文字还原比竞品精准很多。 -
独立创作者/Vlogger:不想学复杂剪辑软件但需要视觉包装效果的创作者,海螺 AI 平台的上手门槛极低。 -
追求影视级画面张力的团队/创作者:如果你主要做电影预告片、特效大片、高张力场景,Seedance 2.0 或 Veo 3.1 可能更对你的需求。H3 的强项是”包装”,不是”拍摄”。
定价方案
H3 的定价模型分成两条线:面向开发者的 API 按量计费,和面向普通用户的海螺 AI 平台订阅。
API 按量计费(截至 2026 年 7 月 31 日平台定价页面):
| 计费项 | 价格 | 备注 |
|---|---|---|
| 视频生成(2K) | $0.13 / 秒 | 国内定价约 0.8 元/秒 |
| 视频生成(768P) | $0.09 / 秒 | 预计后续开放 |
| 音频输入 | 免费 | — |
| 图片参考 | 前 5 张免费 | 超出 $0.04/张 |
| 视频参考 | 按输出分辨率计费 | 与视频生成同价 |
海螺 AI 平台采用积分制,H3 的 2K 视频每秒钟消耗 12 贝壳(积分),一条 15 秒 2K 视频约 10 元人民币。平台提供免费积分额度供试用,专业版月费约 $9.99,适合高频使用的创作者。
这个定价策略的杀伤力在于:对标 Veo 3.1 的 $0.50+/秒、Sora 2 Pro 的约 $0.50/秒(第三方聚合器数据),H3 用不到三分之一的价格提供了原生 2K 加双声道音频。MiniMax 通过自研的高压缩 H3-VAE Tokenizer 把视频生成所需 Token 量压到极低,成本优势是结构性的,不是补贴出来的。
常见问题
多余的话不说,直接看高频疑问。
Q1:H3 跟 MiniMax M3 是什么关系?
A1:完全不同的两个模型。 M3 是 ~4280 亿参数的语言和编程模型,H3 是多模态视频生成模型。它们只是同一天在 MiniMax 活动上发布,共用一个公司品牌,功能上没有任何重叠。
Q2:H3 开源了吗?现在能下载权重吗?
A2:宣布了,但还没放出来。 MiniMax 在 7 月 31 日发布会上宣布 H3 将在”未来几天内”开源权重。截至同一天,HuggingFace 的 MiniMax 组织下只有 M 系列文本模型,H3 仓库尚未上线。想本地部署的团队先观望几天。
Q3:H3 能生成 4K 视频吗?
A3:不能,原生最高 2K。 如果你必须交付 4K,Kling 3.0 和 Veo 3.1 支持原生 4K。但大多数社交媒体、电商和广告场景 2K 完全够用,而且 H3 的 2K 单价远低于竞品 4K 甚至 1080P 的价格。
Q4:H3 和 Seedance 2.0 选哪个?
A4:看你的需求偏向前期还是后期。 Seedance 强在影视感画面和复杂镜头(前期拍摄),H3 强在文字控制、视觉包装和品牌动效(后期制作)。很多创作者的建议是两者互补使用,不是一个二选一的问题。
Q5:生成的视频有版权问题吗?能商用吗?
A5:API 和平台均支持商用。 MiniMax 平台的服务条款明确允许商业用途。海螺 AI 专业版及以上订阅包含商业授权。但注意,参考素材的版权归你承担,不要用有版权风险的图片或音乐做输入。
Q6:H3 支持中文吗?提示词用中文行不行?
A6:完全支持,而且是强项。 MiniMax 是国产厂商,中文语义理解本身就是深度优化的。实测中文提示词的指令遵循准确率和文字渲染效果都不输英文。海螺 AI 平台也是全中文界面。
Q7:API 调用有最低消费吗?
A7:没有,纯按量计费。 注册 MiniMax 开放平台即可获取 API Key,用多少付多少。新用户通常有免费额度可以跑几条测试视频。不像 Veo 3.1 或 Sora 需要订阅 ChatGPT Plus/Pro 才能用 API。
Q8:H3 生成的视频里人物一致性怎么样?
A8:Omni Reference 模式下极好。 只要上传人物参考图到 Omni Reference,H3 在多镜头间保持角色外观的一致性是目前测试反馈中评价最高的能力之一。不传参考图纯文字生成的话,一致性还是看运气。
Q9:最快多久能生成一条视频?
A9:2K 视频 1-3 分钟,取决于时长和素材复杂度。 实测 6 秒短视频约 1 分钟,15 秒多素材输入约 3 分钟。高峰时段偶尔排队,但整体比 Sora 和 Veo 的快不少。
Q10:H3 能用来做虚拟数字人吗?
A10:可以,而且对口型效果不错。 社区测试显示,上传一张人物图和一段音频,H3 能生成高精度的唇形同步视频,动作自然,适合做虚拟主播或产品讲解的数字人。但长对话的一致性还需要更多测试验证。
所以到底值不值得
MiniMax H3 不是一款”什么都能做”的通用视频模型,但它是目前市面上商业视觉包装能力最强、性价比最高的视频生成工具。它的差异化不需要跟任何人争论,把海报变成动态广告、给 Logo 加花字动效、一镜到底做时装变换视频,这些能力 Seedance 和 Veo 目前都做不到这个水准。
如果你是广告创意、电商运营、品牌设计或者独立内容创作者,H3 大概率能帮你省掉至少一半的后期制作时间,而且效果比自己做的好。如果你是追求电影级画面的影视团队,H3 目前不是答案,但你可能会把它跟 Seedance 一起用。
还有一点值得期待:一旦 H3 的模型权重真的开源,社区微调和国产芯片适配会让它的生态价值远超现在的 API 形态。在此之前,先用海螺 AI 的免费积分享受一下全模态视频创作的感觉,不亏。

起点课堂会员权益





“视频编辑能力全球第一”这个说法建立在 Artificial Analysis 的榜单上,但榜单侧重的是编辑与指令跟随,不等于综合生成实力。H3 在文字渲染和品牌一致性上确实强,可高张力镜头弱、无 4K 也是硬伤。认可它的差异化,只是别把单点第一当成全面领先来宣传。