MiniMax H3 正式发布:通用多模态视频模型,支持 2K 输出与原生立体声

MiniMax 正式发布 MiniMax H3,这是一款通用多模态视频生成模型,能够在统一的生成框架中理解文本、图像、视频和音频。

发布于 2026年7月31日generalGEO 评分: 0
MiniMax H3 正式发布:通用多模态视频模型,支持 2K 输出与原生立体声

MiniMax H3 发布:通用多模态视频模型,支持2K输出与原生立体声音频

引言

MiniMax 正式发布 MiniMax H3,这是一款通用多模态视频生成模型,能够在同一生成工作流中理解文本、图像、视频和音频。

此次发布标志着不再将文生视频、图生视频、参考视频生成、音频同步和编辑视为相互独立的任务。相反,H3 被设计为能够同时接收多种类型的上下文,并使用自然语言指令来描述这些参考内容之间应如何交互。

据 MiniMax 介绍,H3 支持原生立体声音视频输出,可生成最长15秒的片段,并通过当前 API 提供2K分辨率输出。

该公司将该模型定位于商业内容创作领域,包括广告、品牌推广、电子商务、产品设计、UI/UX 和游戏。

图片展示了一位坐在咖啡馆外的年轻女性,她有着卷曲的黑发和棕色的皮肤,身穿白色上衣和蓝色围裙,手腕上戴着彩色手环,正端着一杯咖啡。背景中可见“CAFE”标识的咖啡馆,还有其他顾客在咖啡馆内或室外用餐。这张图片与文档中MiniMax H3模型的介绍相关,可能用于展示其在商业内容创作中的应用场景,如广告、品牌宣传等。

此次发布还着重强调了生成成本。MiniMax 表示,H3 在保持多模态参考和高分辨率输出能力的同时,其每秒生成成本低于许多主流视频生成系统。

H3 从专用视频任务走向统一多模态生成

早期的视频模型往往围绕独立的工作流进行组织。

创作者可能会选择一种模型或接口用于文生视频,另一种用于图像动画,再采用不同的流程来处理参考视频编辑或音频同步。

H3 试图将这些用例统一到共享的多模态上下文中。

MiniMax 当前的 API 文档描述了三种主要的生成模式:

生成模式 输入 典型用途
文生视频 文本提示词 根据文字描述生成新视频
首/尾帧图生视频 提示词加首帧和/或尾帧 让图像动起来,或控制视频片段的开头和结尾
参考生成 提示词加图像、视频和/或音频 保留主体、动作、镜头风格、声音或剪辑节奏

因此,该模型不仅限于将一句话转化为视频。

它还可以将参考媒体作为生成上下文的一部分。

对于参考生成,MiniMax 的 API 支持以下组合:

  • 最多9张参考图像
  • 最多3个参考视频
  • 最多3段参考音频
  • 总计最多12个媒体文件

参考视频总时长可达15秒,而音频必须附带至少一个图像或视频参考。

这种结构允许创作者描述不同输入之间的关系,而无需将每种模态作为独立阶段进行手动处理。

自然语言成为连接各模态的桥梁

AIBase 消息源将 H3 的核心理念之一描述为 上下文全模态表示(Contextual Omni Representation)

其概念是使用自然语言作为连接各

不同类型的媒体。

用户可以同时提供多个参考资料,并用日常语言描述它们之间预期的关系。

例如,一个工作流在概念上可能要求H3做到:

  • 沿用某个参考视频中的运镜方式
  • 保留某张参考图像中出现的人物
  • 跟随某段音频参考的节奏或声音
  • 将所有这些约束同时应用于一个全新生成的场景

这与简单的文本生视频提示有着本质上的区别。

模型不仅要理解每个媒体输入包含什么内容,还要理解每个输入在最终生成中应当扮演什么角色。

MiniMax的公开API通过基于角色的多模态输入体现了这一设计,例如:

  • first_frame(首帧)
  • last_frame(末帧)
  • reference_image(参考图像)
  • reference_video(参考视频)
  • reference_audio(参考音频)

用户仍然需要提供文本提示,但此时提示可以充当多个媒体源之上的指令层。

H3支持原生立体声音频和最长15秒的2K输出

MiniMax表示,H3可以直接生成带有原生立体声音频的视频,而无需在后续额外使用独立的音频生成流程。

当前开发者文档列出的信息包括:

  • 模型名称: MiniMax-H3
  • 输出分辨率: 2K
  • 输出时长: 最长15秒
  • 常见宽高比: 支持
  • 自适应宽高比: 适用于合适的参考工作流

API参考目前接受4到15秒的整数时长,而更高级的开发者指南则介绍正常输出范围为5到15秒。

这个文档上的细微差异在基于API开发时值得注意:开发者应当遵循自己账户和SDK所对应的当前端点模式。

对于纯文本生成,必须明确指定宽高比。

当前API参考中支持的宽高比包括:

  • 21:9
  • 16:9
  • 4:3
  • 1:1
  • 3:4
  • 9:16

参考工作流还可以使用自适应尺寸。

早期测试聚焦于商业内容创作

MiniMax表示,早期测试在多个实际应用领域展现出强劲表现。

这些领域包括:

  • 指令遵循
  • 品牌和文字呈现
  • 视频到视频的运动迁移
  • 多模态生成
  • 受控编辑
  • 商业创意制作

该公司特别强调了以下应用场景:

  • 广告
  • 品牌建设
  • 电子商务
  • 产品设计
  • UI/UX(用户界面/用户体验)
  • 游戏

这些性能描述来自MiniMax自身以及相关发布报道,而不是来自独立的公开基准测试。

这一区别很重要。

视频生成质量很难用一个分数来简单概括。一个模型可能在运动迁移方面表现出色,但在精细的面部细节、字体排版、长期身份一致性或复杂的多物体交互方面却相对薄弱。

因此,评估H3是否适合投入生产最可靠的方式,就是拿它去测试团队实际需要创作的内容。

H3采用全新多模态技术架构

AIBase的报道和MiniMax的发布材料描述了H3背后的多项技术:

  • 上下文全模态表示(Contextual Omni Representation)
  • H3-VAE
  • H3-Omni Transformer(全模态 Transformer)
  • 上下文内再生成(In-Context Regeneration)

公开的API文档目前更多侧重于如何使用H3,而非发布完整的技术细节。

这些组件的相关研究论文尚未公开,因此详细的架构描述应视为 MiniMax 的产品说明,除非有技术报告提供额外的可复现细节。

上下文全模态表示

该组件旨在将文本、图像、视频和音频共同表示在一个共享上下文中。

其作用是帮助 H3 理解多个参考来源与自然语言指令之间的关联。

H3-VAE

H3-VAE 被描述为模型视频表示和生成栈的一部分。

视频 VAE 通常将高维视频信息压缩为更易管理的潜在表示,用于生成和解码。

在本文撰写时审查的文档中,MiniMax 尚未发布足够公开的技术细节,因此无法独立描述 H3-VAE 的确切设计。

H3-Omni Transformer

H3-Omni Transformer 被定位为负责统一多模态生成的模型组件。

其命名反映了模型的更广泛目标:一个系统应能处理多种媒体类型的推理,而非在不同独立专家模型之间切换。

上下文内再生成

MiniMax 还将上下文内再生成列为 H3 技术栈的一部分。

其预期作用是利用多模态上下文中已有的信息来改进生成效果。

与其他架构名称一样,详细的训练流程和消融实验结果在发布时的公开 API 文档中并未提供。

H3 定价基于视频时长

AIBase 文章强调了 H3 的性价比。

MiniMax 当前官方的按量付费定价提供了更清晰的数值参考。

分辨率 官方 API 标价
2K 每生成一秒 $0.13
768P 每生成一秒 $0.09

输入参考材料有单独的计费规则。

MiniMax 目前列出:

  • 音频参考:免费
  • 前 5 张图像参考:免费
  • 额外图像参考:每张 $0.04
  • 视频参考:根据输入视频时长和目标输出分辨率计费

MiniMax 表示,按每秒计算,H3 在 2K 分辨率下的成本不到主流竞品模型的三分之一,768P 分辨率下的成本不到主流 720P 替代方案价格的一半。

这些相对比较属于厂商宣称,因为结果在很大程度上取决于所包含的竞品模型、套餐、分辨率和计费方式。

在预算规划时,开发者应首先依据已公布的 H3 API 费率,然后与自身实际使用的替代方案进行精确对比。

为什么每秒成本对 AI 视频很重要

视频生成的成本会随着输出时长而线性增长,因此费用可能迅速变得高昂。

这改变了迭代试错的经济性。

创作者很少一次就能生成完美的片段。

一个完整的生产流程可能涉及:

  1. 多次提示词实验
  2. 多次角色一致性尝试
  3. 镜头运动变化
  4. 不同宽高比
  5. 品牌或产品修正
  6. 最终高分辨率生成

即使每秒生成成本仅有小幅降低,当团队创建数十乃至数百个备选版本时,累积节省也会相当可观。

这一点在以下场景中尤其重要——

广告和电子商务领域,一个营销活动可能需要:

  • 多种产品
  • 多个市场
  • 不同语言
  • 横版和竖版格式
  • 多个创意变体

因此,H3的定价定位不仅考虑单个最终视频的成本,更着眼于迭代经济性。

参考生成是H3最重要的能力之一

当前MiniMax API支持使用图像、视频和音频混合的参考生成。

这支持如下工作流程:

  • 从图像保持产品或角色的一致性
  • 跟随参考视频的运动
  • 借用另一个视频片段的镜头行为
  • 使用参考音轨进行时间控制或配音
  • 在单个请求中组合多种形式的参考素材

MiniMax表示,H3可以在整个生成输出中保留参考主体或素材的特征。

这对商业工作尤为重要。

一般的文本提示可以生成视觉上吸引人的视频片段,但仍可能改变:

  • 标志
  • 产品比例
  • 服装
  • 角色身份
  • 包装
  • 品牌颜色

参考驱动的工作流程对这些变量提供了更多控制。

但这并不能保证完美的身份保留,因此团队在发布每个生成素材前仍应进行审查。

首帧和末帧控制增加了另一种制作工作流程

H3还支持使用首帧、末帧或两者同时使用。

当创作者已经知道镜头应如何开始或结束时,这非常有用。

典型用途包括:

  • 让产品静图动起来
  • 在两幅图像之间创建过渡
  • 将一个镜头的开头与另一个镜头的结尾匹配
  • 控制变换的最终状态
  • 构建更可预测的剪辑序列

MiniMax的API将首帧/末帧生成和参考生成视为两种独立的模式。

一个请求不能在同一任务中混用first_framelast_frame角色与reference_imagereference_videoreference_audio角色。

这一限制对集成该API的开发者来说非常重要。

MiniMax计划发布H3模型权重

该公告中最引人注目的部分之一是MiniMax计划公开H3模型权重。

该公司表示,权重计划在未来几天内发布,需遵守适用法律法规。

MiniMax认为,发布权重有助于:

  • 扩展开放模型生态系统
  • 支持定制化版本
  • 加速对不同硬件的适配
  • 减少对单一托管服务的依赖
  • 鼓励研究和部署实验

该公司还表示,从H3设计之初就考虑了硬件兼容性,包括对更广泛的AI硬件兼容。

在本文撰写时,MiniMax的官方GitHub和Hugging Face组织页面可公开访问,但在此处审查的官方H3 API文档中尚未链接确认的公开H3权重仓库。

这意味着开发者应等待MiniMax官方发布链接,而不是从未经授权的镜像下载权重。

对“首个开源权重中文视频模型”说法的更正

AIBase

这篇文章称H3的发布计划是中国视频生成基础模型首次向社区开放其权重。

从广义上讲,这一说法在历史上并不准确。

阿里巴巴于2025年2月发布了其Wan2.1视频生成模型的权重和推理代码,后续的Wan2.1变体也已公开释出。

H3更站得住脚的差异化点在于其通用统一多模态视频架构,包括文本、图像、视频和音频参考,以及原生音视频输出——而非它是首个开放权重的中国视频模型。

开放权重有助于硬件适配

在组织希望更多掌控基础设施的市场中,开放模型权重至关重要。

托管API更易于上手,但开放权重可以实现:

  • 在私有基础设施上部署
  • 针对本地硬件优化内核
  • 对模型进行量化
  • 构建专用推理运行时
  • 在许可允许的范围内微调或适配组件
  • 与国产加速器集成
  • 将敏感数据保持在受控环境中

H3能否实际自主托管,将取决于源文章中尚未公开的信息,包括:

  • 参数量
  • 显存需求
  • 推理精度
  • 并行化要求
  • 最低硬件配置
  • 许可条款
  • 训练或微调支持

在官方权重和技术文档发布之前,关于消费级GPU兼容性或自主托管成本的声称都只是推测。

MiniMax承认H3仍有提升空间

MiniMax还表示,该模型并非H系列的最终终点。

公司指出了以下方向:

  • 精细图像细节
  • 整体模型规模
  • 进一步能力扩展

MiniMax表示计划继续扩展H系列模型,并最终整合H和M模型家族的能力。

H家族目前专注于多模态生成,尤其是视频。

M家族包括MiniMax的语言和智能体模型。

未来的融合可能指向这样一种系统:一个模型家族即可处理:

  • 语言推理
  • 智能体执行
  • 图像理解
  • 视频理解
  • 音频
  • 视频创作
  • 编辑

这仍然是一个前瞻性的方向,而非目前已发布的统一产品。

H3对视频生成工作流的改变

H3最重要的贡献不仅仅是更高的分辨率。

更大的转变在于,此前多个相互独立的创作操作现在可以在一个上下文中完成。

创作者可以从:

根据这句话生成一段视频。

走向:

使用这个人,跟随这段视频中的动作,保持这种视觉身份,
从这段音频中获取节奏提示,并根据此提示词创建新场景。

这改变了视频模型的角色。

它不再像一个单一用途的生成器,而更像一个多模态创意引擎。

对于商业团队而言,其价值将取决于H3在多大程度上能够一致地保持参考一致性、遵循复杂指令、渲染品牌信息,并保持经济高效。

历经数代传承。

常见问题

什么是 MiniMax H3?

MiniMax H3 是 MiniMax 推出的一款通用多模态视频生成模型。它可接受文本、图像、视频和音频作为上下文,并支持文生视频、图生视频、基于参考素材的生成以及受控视频创作。

MiniMax H3 支持什么分辨率?

MiniMax 当前的 API 文档将 2K 列为 H3 的主要输出分辨率。其定价页面还列出了 768P 的计费档位。

MiniMax H3 视频最长可达多久?

官方 H3 文档支持最长 15 秒的视频输出。API 参考当前接受 4 到 15 秒之间的整数时长值。

MiniMax H3 会生成音频吗?

会。MiniMax 将 H3 描述为支持原生立体声音视频输出,因此音频可以作为视频工作流程的一部分生成,而不必总是依赖单独的后期制作模型。

MiniMax H3 API 的费用是多少?

MiniMax 目前将 H3 定价为 2K 分辨率每秒生成 $0.13,768P 分辨率每秒 $0.09。根据已公布的计费规则,参考视频和附加图片可能会增加输入素材费用。

H3 能同时使用参考图像、视频和音频吗?

能。官方 API 在同一个参考生成工作流程中支持参考图像、视频和音频,但需遵守文件数量、时长、大小和输入组合限制。

MiniMax H3 是开源的吗?

MiniMax 已宣布计划在未来几天内发布 H3 模型权重,具体需遵守适用法规。在本文撰写时,官方 API 已上线,但在此次查阅的官方文档中尚未确认链接到公开的 H3 权重仓库。

H3 是首个中国开源权重视频模型吗?

不是,从广义历史意义上讲并非如此。阿里巴巴于 2025 年发布了 Wan2.1 视频生成模型权重。H3 更值得关注的是它在一个通用视频模型中结合了多模态参考和原生音视频生成能力。

相关工具

  • MiniMax H3 API:H3 文生视频、图生视频和参考生成工作流程的官方文档。
  • MiniMax 开放平台:MiniMax 开发者平台,提供 API 密钥、模型访问、计费和开发者资源。
  • MiniMax GitHub:该公司的官方 GitHub 组织,用于公开代码和模型相关项目。
  • MiniMax Hugging Face:MiniMax 的官方 Hugging Face 组织,用于公开模型资源。
  • Wan2.1:阿里巴巴的开源视频生成模型系列,可作为开源权重视频模型的历史背景参考。

相关链接

io/docs/api-reference/video-generation-v2-create):用于创建 H3 视频生成任务的官方 V2 端点规范。

总结

MiniMax H3 将文本、图像、视频和音频整合到一个通用视频生成流程中。它支持最高 15 秒 2K 输出、原生立体声音频、首帧/末帧控制,以及使用多种媒体类型进行参考生成。

其商业卖点集中在两方面:控制能力和成本。MiniMax 表示,H3 在指令遵循、品牌呈现和动作迁移方面表现良好,而其官方 API 目前将 2K 生成定价为每秒 0.13 美元,768P 为每秒 0.09 美元。

MiniMax 还计划发布模型权重,不过在发布时审阅的官方文档中,尚未链接到已确认的 H3 权重仓库。

H3 最重要的转变不仅仅是 2K 视频——而是走向一个能够理解文本、图像、视频和音频应如何协同工作的统一多模态生成系统。