MiniMax H3将多模态提示词转化为带原生音频的2K可发布视频

MiniMax H3 是面向完整制作流程的多模态视频模型,可处理文本、图像、视频和音频并生成带原生音频的 2K 视频。本文介绍其在广告、电商、产品设计和社交内容中的实际用法。

发布于 2026年8月3日generalGEO 评分: 012 次阅读
MiniMax H3将多模态提示词转化为带原生音频的2K可发布视频

MiniMax H3将多模态提示转化为可发布的2K视频

引言

视频生成模型发展迅速,但大多数仍停留在素材生成器的层面。它们生成一段片段,然后让创作者在另一款剪辑应用中自行处理字幕、排版、转场、调色、音乐、节奏和视觉效果。

MiniMax H3正是为了改变这一工作流程而设计。

H3于2026年7月31日发布,是一款通用多模态视频模型,可在同一上下文中接受文本、图像、视频和音频输入。它可以生成4至15秒的同步立体声视频,输出分辨率可达768p或最高2K。

MiniMax表示,该模型旨在参与完整的内容制作流程,而不仅仅是生成原始素材。其目标应用场景包括广告、品牌推广、电子商务、产品设计、UI和UX、游戏、动态海报、片头序列以及社交媒体内容。

MiniMax将H3定位为开源权重、通用型多模态视频模型。

原始报告将这一转变描述为视频生成迎来了它的“编程时刻”。这一比喻并非字面意义,但这个想法很有价值:创作者可以越来越多地描述他们想要的结果,提供参考资料,检查输出,并通过自然语言指令进行迭代,而无需手动构建每一个层次。

开源权重状态: MiniMax最初表示权重将在数天内发布。官方H3-Base检查点现已可在Hugging Face上获取,遵循MiniMax H3社区许可。然而,H3-Context-IR、H3-Regenerate-2K以及稀疏注意力实现并未全部包含在初始权重发布中。

MiniMax H3作为端到端视频制作模型登场

最初令人惊艳的示例并非简单的电影镜头。它们包括动态排版、手绘效果、产品图形、动画片头序列、音乐、对话和转场。

这些通常被视为独立的后期制作任务。

传统工作流程可能如下:

  1. 生成或录制原始素材。
  2. 将片段导入剪辑软件。
  3. 筛选可用镜头。
  4. 添加剪辑和转场。
  5. 设计标题和字幕。
  6. 添加音乐和音效。
  7. 调整节奏和色彩。
  8. 导出最终版本。

H3试图将其中多个决策整合在一起进行建模。

一个提示词可以描述视觉风格、镜头顺序、节奏、屏幕文字、表演指导、声音景观和转场效果。参考文件可以提供角色、产品、动作、摄影机风格、声音、配乐或剪辑节奏。

图片展示了MiniMax H3的早期测试成果。左侧是TSUBAKI的推文,呈现了使用MiniMax H3制作的视频片段,包含人物形象、动态文字、背景图案等元素,时长1分11秒,获3.1万观看。右侧是padiphone的推文,展示了一款白色收音机,时长1分21秒,获15.5K观看。这些视频体现了MiniMax H3将多模态提示转化为2K成品视频的能力,与上下文介绍的H3能生成更接近成品的短内容资产相呼应。

早期测试者使用H3制作风格化角色视频和精致的产品

advertising.*

这并不意味着专业编辑软件已经过时。较长的项目仍然需要精确的时间线控制、资产管理、修改、法务审核以及多种格式的交付。

重要的变化在于,模型现在可以在一次生成中产出更接近成品短视频素材的内容。

使用宣传视频和快速多镜头提示词测试H3

原作者通过MiniMax的Hailuo界面测试了H3。

第一个实验是一段虚构男团幕后花絮视频,主角是AI行业知名人物。文本提示词描述了预期的基调和剪辑风格,而H3负责生成视觉序列。

随后作者测试了一段带有苹果风格演示美学的发布视频。仅添加了简短风格标签,生成结果却包含了半透明玻璃效果、渐变、动态图形以及类似演示的节奏。

一个更具挑战性的测试使用了长提示词来描述一支六镜头预告片。每个镜头都有各自的情感方向、表演指导和节奏。

根据报告,H3紧密遵循了镜头顺序,生成了场景分明的快速蒙太奇,而非将指令压缩成一段泛泛的片段。

这类任务同时考验多项能力:

  • 多镜头规划
  • 角色和场景一致性
  • 提示词遵循度
  • 情感表演
  • 运镜
  • 剪辑节奏
  • 转场设计
  • 音画同步

结果仍然属于主观演示,而非受控基准测试。一个成功的社媒案例并不能保证每条长提示词都能一次成功。

尽管如此,与以往只期待简短视觉描述的老式视频系统相比,该模型显然更适合结构化的创意指令。

文字渲染是H3最具商业价值的特性之一

文字历来是AI生成视频中最脆弱的环节之一。

图像模型只需在一帧中正确渲染一个词。视频模型则必须在镜头、表面、光照和周围场景持续运动的同时,在大量帧中保持相同的字形。

任何一帧的小错误都可能导致闪烁、拼写错误或排版不稳定。

原版测试表明,H3在以下方面已达到可用的水平:

  • 动画标题
  • 宣传排版
  • 歌词视频
  • 品牌名称
  • 产品标签
  • 字幕
  • 动态文字图形
  • UI和网页视觉

MiniMax官方发布材料中也将精准的文字和品牌渲染列为核心能力。

该模型并不能保证每次生成都产出完美文字。小字号、长句、特殊字体和复杂运动仍可能导致失败。

H3更有价值之处在于,它似乎能建模文字与场景之间的关系。

在一个示例中,与钻石项链相关联的文字呈现出反射光照和景深感,而非简单的平面叠加。这更接近视觉合成,而非普通的字幕放置。

对于商业团队而言,可靠的排版往往比华丽的电影级运镜更有价值。广告、产品

发布、社交媒体内容等都依赖于可读的信息。

原生音频:连接语音、音效与音乐

H3 联合生成音视频。

官方模型卡说明如下:

  • 32 kHz 立体声音频
  • 稳定支持 11 种语言的对话
  • 语音、音乐与音效的原生建模
  • 联合视听生成,而非独立的后期音频处理阶段

MiniMax 列出的支持对话语言包括:

  • 阿拉伯语
  • 中文
  • 英语
  • 法语
  • 德语
  • 意大利语
  • 日语
  • 韩语
  • 葡萄牙语
  • 俄语
  • 西班牙语

其他语言可能也能使用,但质量会有差异。

原文还指出,用户可以提供音频作为参考。H3 可以结合语音片段、音乐或其他音频素材,同时配合图像和视频参考。

在当前 API 中,音频不能作为唯一的参考输入,必须同时提供图像或视频。

这一集成非常重要,因为生成的语音应匹配场景的节奏和情感。视频后期添加的配音虽然听起来正确,但仍可能与面部动作、节奏或镜头切换脱节。

H3 的原生视听设计旨在令这些元素保持对齐。

定价:2K 视频每秒 0.13 美元

MiniMax 按照生成视频的时长对 H3 进行定价。

当前全球按量付费费率如下:

输出 价格
2K 视频 每秒 0.13 美元
768p 视频 每秒 0.08 美元
768p 至 2K 重新生成 每秒输出 0.05 美元
H3-Context-IR 输入 每百万 tokens 0.90 美元
H3-Context-IR 输出 每百万 tokens 3.60 美元

按当前费率计算,10 秒直接生成的费用大约为:

分辨率 近似输出成本
768p 0.80 美元
2K 1.30 美元

参考输入的计费遵循单独的规则:

  • 音频参考免费。
  • 前五张图像参考免费。
  • 直接生成时,前五张之后的每张图像收费 0.04 美元。
  • 参考视频按其时长和所选输出分辨率计费。

来源文章截取了 H3 最初的输入素材和输出定价。

上述截图列出 768p 生成价格为每秒 0.09 美元。MiniMax 当前的全球定价页面现标为每秒 0.08 美元,因此应以实时官方文档作为当前信息来源。

MiniMax 声称,在 2K 分辨率下,H3 的成本不到主流竞品的三分之一;在 768p 分辨率下,成本不到主流 720p 模型的一半。

该比较基于 MiniMax 选择的竞品和设置。每段有效视频的实际成本取决于重试次数、参考素材、片段长度、重新生成,以及首次输出是否可直接使用。

H3 在 Artificial Analysis 视频编辑榜单中位列第一

Artificial Analysis 目前将 MiniMax H3 列于其带音频的视频编辑排行榜首位。

在本文档编写时,排名显示如下:

排名 模型 Elo API 价格
1 MiniMax H3 1,129 7.80 美元/分钟
2 Gemini Omni Flash 1,122 6.

00/分钟 |
| 3 | HappyHorse-1.0 | 1,096 | $27.04/分钟 |
| 4 | Wan 2.7 | 1,080 | $16.90/分钟 |
| 5 | Dreamina Seedance 2.0 720p | 1,037 | $5.57/分钟 |

来源文章将H3置于Artificial Analysis视频编辑排行榜榜首。

H3在文生视频和图生视频测试中也名列前茅。

排行榜结果会随着新模型和投票的加入而发生变化。它们衡量的是特定提示集上的群体偏好,不应被视为某一模型适合所有制作流程的证明。

这一结果仍然值得关注,因为H3将强劲的编辑评分与已发布的基础权重相结合,而许多领先的视频模型仍然保持封闭。

统一的多模态输入系统

H3并不将文本、图像、视频和音频视为互不相关的输入模态。

它将它们作为一个统一的多模态上下文来接受,并试图理解这些素材与所请求输出之间的关系。

例如,一个提示可以要求H3:

  • 使用某个视频中的镜头运动
  • 保留图像中显示的人物
  • 使用音频参考中的声音
  • 跟随另一个片段的节奏
  • 应用指定的标题样式
  • 生成一个包含所有这些关系的新场景

官方API目前支持:

参考类型 限制
图片 最多9张
视频片段 最多3个
音频片段 最多3个
混合文件总数 最多12个

参考视频和音频片段长度必须在2到15秒之间,每种媒体类型的最大总时长为15秒。

提示词限制为7,000个字符。

这张图片展示了MiniMax H3的创作视频功能界面,界面顶部有“创作视频”“创作图片”“海螺Agent”三个选项,其中“创作视频”选项处于选中状态。界面中部显示“H3正式上线 让灵感跃然成片”的文字内容,下方设置了输入区域,包含加号参考按钮、生成相关参数选项,以及“创作”按钮,还给出了生成视频的示例提示。该界面对应文档中介绍的MiniMax H3可将多模态提示转化为2K视频的相关内容,体现了这款产品的视频创作操作入口与界面设计。

海螺界面将提示、多模态参考、分辨率、时长和宽高比整合在一起。

这种设计使参考素材比编写超长提示词更加重要。

一段文字可以描述所需的光线效果,但一张参考图像可以更直接地传达相同的视觉效果。文字描述可以解释一个动作,但参考视频可以展示精确的时机。

该模型的价值在于解读这些参考应如何重新组合,而非仅仅复制它们。

近期素材减少重复上传

来源文章强调了一个虽小但实用的产品功能:上传的素材会出现在近期使用面板中。

图片展示的是MiniMax H3生成视频的界面。画面中显示上传进度为99%,正在生成视频。左侧有“上传”和“选择资产”按钮,下方是“参考”区域,展示了多张人物图片,其中一张图片被标记为“参考(2/12)”。右侧是视频生成的描述,包含场景设定、声音描述和技术规格尾缀等内容。该图片与上下文紧密相关,直观呈现了使用MiniMax H3生成视频时的界面及部分操作步骤。

先前上传的图片和参考素材可以从近期素材面板中重复使用。

这很实用

对于那些反复使用相同角色、产品、标志、品牌色调、声音、视觉风格、地点或动态参考的工作流程。

它减少了每次生成时上传和整理相同文件的需求。

H3如何理解创意意图

MiniMax将H3描述为一个围绕任务泛化构建的系统,而非独立专家模型的集合。

早期的生成系统通常将创意工作分割为孤立的任务,如文本转视频、图像转视频、首尾帧生成、角色参考、风格参考、动态迁移、声音参考、视频编辑、音效生成和音乐生成。

H3经过训练,能够在单一多模态系统中通过自然语言表达这些关系。

完整的在线H3工作流程包含三个主要模块:

多模态输入
      ↓
H3-Context-IR
      ↓
H3-Base(768p)
      ↓
H3-Regenerate-2K
      ↓
最终视频(含立体声音频)

H3-Context-IR

H3-Context-IR是一个托管的预处理和编排系统。

它分析文本、图像、视频和音频之间的关系,然后生成H3-Base可以使用的结构化中间表示。

该系统可以执行指令解析、跨模态关联、时间分析、场景分解、音视频关系建模、缺失细节的提示补全以及复杂逻辑推理。

MiniMax的技术博客指出,部分源材料在被提炼为约4,000个token的平均上下文表示之前,需要约100,000个token的推理计算。

H3-Context-IR不包含在初始开源权重版本中,因为它依赖多个托管模型和服务。MiniMax通过API提供该功能,并为希望构建自己的预处理系统的团队发布提示指南。

H3-Base

H3-Base以768p分辨率生成视频和立体声音频。

不同的输入模态通过相应的编码器或VAE进行编码,打包成统一的多模态序列,然后送入H3-Omni Transformer。

发布的模型提供两个任务专用检查点:

检查点 主要任务
H3-Base-FL2VA 文本转视频以及首尾帧转视频
H3-Base-Ref2VA 基于参考的音视频生成

两个检查点均使用BF16精度。

H3-Regenerate-2K

H3的2K工作流程不是传统的超分辨率放大工具。

768p结果和原始多模态上下文会被反馈回H3,使模型能够以更高分辨率重新生成输出。

MiniMax将其称为上下文内再生成

传统的超分辨率系统试图从低分辨率视频中推断缺失细节。H3可以复用原始提示和参考信息,这可能有助于其更准确地恢复小文字、产品细节和场景信息。

H3-Regenerate-2K不包含在初始开源权重版本中。目前可通过MiniMax的托管工作流程和API使用。

H3的核心技术组件

MiniMax确定了系统背后的四项主要技术。

上下文全模态表示

在传统的视频提示中,一段文字说明描述目标片段。

而在H3中,

字幕还必须说明每个参考与输出的关系、参考之间的相互关系、哪个动作应来自哪个视频、哪个声音属于哪个角色、音频在多个镜头之间如何变化,以及哪些内容应保留或编辑。

语言是连接这些多模态关系的桥梁。

MiniMax构建了专用模型和全模态理解流水线来生成这种表示。

H3-VAE

H3使用独立的视觉和音频潜空间。

视觉VAE是一个时间因果视频自动编码器,具有16倍空间压缩、4倍时间压缩、24个潜通道,并在Transformer之前进行额外的分块处理。

MiniMax表示,新的VAE相比其早期方法在有效序列长度上提供了4倍的提升,降低了训练和推理成本,同时有助于支持原生2K生成。

音频VAE先独立处理左右立体声通道,然后再重新组合。它将32 kHz音频压缩为每通道40 Hz的潜令牌。

H3-Omni Transformer

H3-Omni Transformer是一个密集的单流Transformer。

官方模型卡列出:

  • 总计330亿参数
  • AdaLN相关分支中约130亿参数
  • 视频和音频潜变量的联合预测
  • 三维多模态旋转位置嵌入
  • 统一的注意力机制和前馈层,无模态专用模块

MiniMax表示AdaLN调制输出可以预计算并缓存,因此仅用于推理的部署无需加载这些参数。

该模型在训练期间分离理解和生成任务,以更好地处理多模态序列长度的大幅变化。MiniMax报告称,这将端到端训练吞吐量提升了近30%。

稀疏注意力

H3使用原生稀疏注意力进行训练,以降低长多模态序列的成本。

初始开源权重版本目前使用全注意力进行推理。MiniMax表示稀疏注意力实现将在未来更新中发布。

这一区别对本地部署很重要,因为当前可用的实现可能需要比MiniMax内部优化的服务栈更多的计算资源。

开放权重:实际发布内容

MiniMax在Hugging Face上以MiniMax H3社区许可协议发布了H3-Base权重。

该仓库包括H3-Base-FL2VA、H3-Base-Ref2VA、处理器文件、分词器文件、文本编码器、Omni Transformer权重、视觉和音频VAE、示例脚本、部署说明以及可复现的768p示例。

检查点使用Qwen3-VL-32B的完整预训练权重作为H3编码器,并将其第50层隐藏状态提供给H3-Omni Transformer。

模型可通过以下命令下载:

hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3

MiniMax将SGLang、vLLM、Diffusers和ComfyUI列为支持或推荐的推理框架。

其SGLang示例使用四块GPU:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \

--host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

这是一个官方示例,并非通用最低要求。实际内存和性能取决于检查点、时长、分辨率、实现方式和硬件。

整个在线系统尚未完全开放

将 H3 简单称为“完全开源”可能会产生误导。

已发布的 H3-Base 权重相当可观,支持本地 768p 生成。然而:

  • H3-Context-IR 仍是一个托管系统。
  • H3-Regenerate-2K 尚未发布。
  • 稀疏注意力推理未包含在首次发布中。
  • 该模型采用 MiniMax 社区许可,而非 Apache 2.0 等标准宽松许可。

团队在规划商业部署之前,应仔细审查许可和架构说明。

对于私有品牌资产而言,该发布仍然创造了有意义的选择。企业可以在许可条款范围内研究、微调并部署基础模型,而无需将每个源资产发送到第三方生成接口。

通过 API 使用 MiniMax H3

官方 API 支持三种主要生成模式:

  1. 文本转视频
  2. 首帧/末帧图像转视频
  3. 多模态参考生成

生成工作流为异步模式:

  1. 提交任务并接收 task_id
  2. 轮询任务状态。
  3. 任务成功后获取视频 URL。
  4. 下载并保存结果。

开发者还可以使用官方 MiniMax CLI:

npm install -g mmx-cli
mmx auth login
mmx video generate \
  --model MiniMax-H3 \
  --prompt "A polished product commercial with animated typography"

对于多模态参考工作流:

mmx video generate \
  --model MiniMax-H3 \
  --prompt "Keep the same character and follow the reference motion" \
  --reference-image character.png \
  --reference-video motion.mp4

在生产环境中使用前,应查看 CLI 和 API 文档,因为输入限制、计费和受支持的参数可能会发生变化。

H3 对视频制作的意义

H3 并不会消除所有后期制作任务。

一个专业的营销项目可能仍然需要逐帧精确剪辑、客户审阅、授权音乐、法律和版权检查、精准的品牌合规性、长片连续性、多种宽高比导出、真人表演指导和色彩管理交付。

H3 改变的是起点。

创作者不再收到一段无声的素材,而是可以获得一个包含剪辑、声音、排版、配音、特效和可识别的视觉方向的短资产。

这使得该模型特别适用于:

  • 社交媒体广告
  • 产品宣传片
  • 电商视频
  • 音乐视觉
  • 动态海报
  • 品牌概念测试
  • 快速活动变体
  • 游戏和 UI 概念视频

该模型还表明,视频生成正变得越来越不局限于特定任务。一个单一系统可以日益解读一组创意资产,并执行更完整的创意简报。

常见问题

什么是 MiniMax H3?

MiniMax H3 是一个通用多模态视频生成和编辑系统。它接受文本、图像、视频和音频输入,可以生成 4 到 15 秒的视频,并带有同步立体声。

声音。

MiniMax H3 能生成2K视频吗?

能。托管API支持2K输出。完整流程会先用H3-Base生成768p的结果,然后使用H3-Regenerate-2K在保留原始上下文的情况下以更高分辨率重新生成视频。

MiniMax H3 是开源的吗?

MiniMax已根据其社区许可发布了H3-Base权重。完整的在线系统并未完全开源,因为H3-Context-IR、H3-Regenerate-2K和稀疏注意力推理并未全部包含在初始版本中。

MiniMax H3 能在本地运行吗?

能,已发布的H3-Base检查点可以部署在本地进行768p生成。MiniMax提供了SGLang示例,并提供了vLLM、Diffusers和ComfyUI工作流的链接,但该模型需要大量GPU资源。

MiniMax H3 API 的费用是多少?

目前的全球标价为2K分辨率每秒生成0.13美元,768p分辨率每秒0.08美元。超过前五张的参考图片、参考视频、重新生成以及H3-Context-IR可能会产生额外费用。

H3 会随视频一起生成音频吗?

会。H3联合生成视频和原生32kHz立体声音频,包括对白、音乐和音效。

H3 可以接受多少个参考文件?

API支持最多九张图片、三个视频和三段音频片段,最多12个混合文件。同时还存在时长和文件大小限制。

H3 适合商业视频制作吗?

MiniMax将H3设计用于广告、品牌推广、电子商务、产品设计、UI和UX以及其他商业用途。团队仍应审查输出内容,验证所有输入素材的权利,并查看社区许可和平台条款。

相关工具

  • Hailuo AI:MiniMax使用H3创建视频的全球Web应用。
  • Hugging Face上的MiniMax H3:官方H3-Base权重、模型卡、架构说明和本地部署示例。
  • MiniMax API:通过API生成H3视频的官方全球平台。
  • MiniMax CLI:用于生成视频、图像、语音、音乐和文本的官方命令行工具。
  • SGLang:MiniMax H3本地部署示例支持的推理服务框架。
  • ComfyUI:基于节点的可视化工作流环境,提供官方H3视频生成教程。
  • Artificial Analysis Video Arena:用于比较视频编辑模型的盲评投票排行榜。

相关链接

定价:当前的H3代次、参考输入、重新生成及Context-IR定价。

总结

MiniMax H3将AI视频从单一的片段生成推向更高层次,在一个系统内整合了视觉生成、剪辑逻辑、字幕排版、对白、音效、音乐以及多模态参考。

托管版本可生成4至15秒视频,自带原生立体声音频,输出分辨率最高可达2K。目前,该版本在Artificial Analysis视频编辑排行榜上位居首位,并通过MiniMax全球API以每生成一秒0.13美元的价格提供2K输出。

MiniMax现已发布H3-Base检查点,支持本地768p生成及后续开发。但由于Context-IR、2K重新生成以及稀疏注意力推理尚未全部开源,完整的托管工作流仍部分封闭。

H3的核心转变并非仅是生成更优质的画面,而是从生成一段片段,演进为理解并执行一份完整的短视频创作简报。