MiniMax H3 上线 MetaSo:768p AI 视频每秒仅需 ¥0.09,无需本地部署

MiniMax H3 上线 MetaSo 后,创作者可以按每秒 0.09 元的价格生成 768p AI 视频,无需自行部署模型。本文介绍 H3 的多模态能力、MetaSo 的使用方式与成本,并比较云端使用和本地部署的实际取舍。

发布于 2026年8月7日generalGEO 评分: 011 次阅读
这张图片是适配8月7日MiniMax H3相关内容的SEO封面图,采用深黑紫的16:9暗色调背景,视觉干净简洁,无多余拥挤元素。图中核心突出的文字信息为“MiniMax H3 on MetaSo”,下方明确标注了两项关键服务价格:¥0.09/s视频与2K生成,同时提及API、ComfyUI访问权限。背景还搭配了抽象的紫色音频波形和蓝色AI标识,底部设有电影播放按钮、代码标签、网络节点样式的科技感图标,呼应AI视频生成的产品属性,直观传递了MiniMax H3接入MetaSo后的核心优势与配套权限。

MiniMax H3 登陆 MetaSo:768p AI 视频每秒仅需 ¥0.09,无需本地部署

引言

MiniMax H3 才刚发布,关于它的讨论就已从模型质量转向了一个更实际的问题:普通创作者真正用起来到底有多便宜、多方便?

该模型因统一的文本、图像、视频和音频条件控制、原生立体声、视频编辑、基于参考的生成以及最高 2K 的输出而备受关注。同时它也是开源权重模型,开发者可以选择自行部署。

然而,开源并不意味着本地部署就能轻松搞定。

运行一个大型多模态视频模型仍然需要处理模型文件、推理框架、GPU 显存、依赖项、环境配置以及生成延迟等问题。MiniMax 官方开源文档推荐使用 SGLang、vLLM、Diffusers 和 ComfyUI 等框架,其 SGLang 部署示例就用了四块 GPU。

对于那些只想把想法变成一段视频的创作者来说,这跟“做视频”完全是两码事。

源文章重点介绍了一条第三方路径:MetaSo(秘塔AI) 已在其基于浏览器的视频生成产品中接入 MiniMax H3。在源文章展示的界面中,用户无需搭建本地环境即可直接使用 H3。

最引人注目的是测试时显示的平台专属定价:

  • 768p:每秒生成 ¥0.09
  • 2K:每秒生成 ¥0.15

这些是源文章中 MetaSo 展示的价格,并非 MiniMax 的通用官方 API 价格。第三方定价可能存在促销、补贴或后续调整,因此在正式生产使用前务必再次核实。

这张图片展示了秘塔AI(MetaSo)平台上使用MiniMax H3的视频生成界面,左侧是功能操作区,顶部有“文/图生视频”“多参考”选项,标注了MiniMax H3,设有“提示词”输入框,支持引用已上传素材,还有开启H3 Context IR的开关,以及“起始帧”“结束帧”的设置区域;右侧是视频生成预览区,显示了一段已生成的赛博朋克风格视频,标注“已完成”,并附有时间戳及相关操作按钮。该界面体现了用户无需配置本地环境,可直接在该平台便捷使用MiniMax H3进行视频生成的特点。

从复杂部署到直接生成

MiniMax H3 是一个能力出众的开源权重视频模型,但“开源”和“易于运行”并不是一回事。

MiniMax 官方仓库将 H3 描述为一个通用的全模态生成系统,能够理解由以下内容构成的上下文:

  • 文本
  • 图像
  • 视频
  • 音频

它可以为 4 至 15 秒的片段生成同步视频和原生立体声。

当前开源版本提供两个主要的基础模型变体:

模型变体 主要用途 输入
H3-Base-FL2VA 文生视频及首帧/末帧生成 文本加零张、一张或两张图像
H3-Base-Ref2VA 多参考音视频生成 文本加参考图像、视频和/或音频

参考模型最多支持:

  • 9 张图像
  • 3 段视频
  • 3 段音频
  • 共 12 个文件

MiniMax 还文档化了一套完整的 2K 工作流,将 H3-Base 与 H3-Context-IR 和 H3-Regenerate-2K 结合使用。

H3 实力强劲,登顶实时视频编辑排行榜

源文章提到 MiniMax H3 在 Artificial

分析平台(Artificial Analysis)上线后不久发布的视频编辑排行榜。

该陈述可通过2026年8月7日审查的当前快照进行验证。

Artificial Analysis 将MiniMax H3列为当前带音频视频编辑排行榜的第一名,在该视图中领先于Gemini Omni Flash。由于这些是基于用户偏好的实时排名,随着更多样本的提交,确切顺序可能会发生变化。

这是来自Artificial Analysis的带音频视频编辑排行榜截图,页面顶部标注了排行榜名称,还设置了类别筛选选项,如仅展示当前模型、有无音频等。排行榜的首位是MiniMax-H3,其模型标签旁明确显示为“Open Weights”,该模型Elo值为1130,样本量5035,于2026年7月发布,API定价显示为即将推出;第二位是Google的Gemini Omni Flash,Elo值为1121,API定价为每分钟6美元,它的排名虽紧随其后,却不及MiniMax-H3的Elo数值。该截图对应文档中提及的MiniMax H3登顶带音频视频编辑排行榜的相关内容,为相关陈述提供了可验证的实时快照依据。

这是H3在编辑质量上具备竞争力的有力证据,但不应将其过度引申为H3在所有视频生成类别中永久排名第一的更广泛声明。

文生视频、图生视频、参考生成和视频编辑是各自独立的任务,排名取决于所选的筛选条件、日期、音频设置和用户投票。

部署壁垒依然真实存在

来源文章提出了一个在开放模型讨论中容易被忽视的观点:许多创作者不想为了测试一个创意想法而成为推理工程师。

自托管H3工作流可能涉及:

  1. 查找官方代码仓库。
  2. 下载相应的检查点文件。
  3. 安装受支持的推理框架。
  4. 准备GPU资源。
  5. 配置依赖项。
  6. 启动模型服务。
  7. 连接客户端或工作流界面。
  8. 调试内存和兼容性问题。

MiniMax的官方代码仓库提供了一个类似这样的SGLang示例:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

参考生成变体使用相同的四GPU示例,只是模型变体和端口不同。

这并不意味着所有可能的H3部署都必须恰好需要四块GPU。硬件需求取决于框架、精度、并行度、分辨率、视频时长和优化方法。

但它确实表明,官方参考部署并非面向典型的消费级笔记本电脑。

开放权重并不能消除计算成本

模型权重可以获取,但推理仍然需要大量计算资源。

使用本地硬件的创作者需要考虑:

  • GPU购买或租赁费用
  • 显存(VRAM)
  • 系统内存
  • 存储空间
  • 模型下载大小
  • 推理时间
  • 功耗
  • 驱动兼容性
  • 框架更新
  • 生成失败的情况

来源中包含一条社区帖子,一位用户在本地下载H3后遇到了内存不足的错误。

这则轶事不应被当作通用的硬件基准,但更重要的观点是成立的:能够下载模型并不等于能够流畅运行它。

本地生成也可能很慢

来源报道称,本地生成一段大约10秒的

在某些硬件配置上,生成一个短片可能需要20到40分钟。

这并非MiniMax官方的延迟规格,实际耗时将因硬件和软件配置的不同而有显著差异。

尽管如此,对于创意工作而言,延迟仍然至关重要。

视频生成是一个迭代过程。用户可能需要多次尝试才能修正以下问题:

  • 摄像机运镜
  • 角色动作
  • 产品一致性
  • 文字渲染
  • 镜头选择
  • 节奏把控
  • 风格调整

如果每次尝试都需要很长时间,即使模型本身可以免费下载,实验和探索的难度也会大大增加。

MetaSo 将 H3 转化为浏览器工具

源文中重点介绍的工作流程,省去了本地部署的大部分步骤。

MetaSo 的主页目前在原有搜索和生产力产品旁边,新增了一个 视频生成 入口。

根据源文测试,基本流程如下:

  1. 打开 MetaSo。
  2. 进入视频生成区域。
  3. 选择 MiniMax H3。
  4. 选择生成模式。
  5. 输入提示词,如需要可添加参考。
  6. 在浏览器中生成视频片段。

无需在制作第一个视频前下载 H3 代码库或配置 CUDA 环境。

支持的创作模式

文章中展示的界面包含了创作者期望从 H3 中获得的主要工作流:

  • 文生视频
  • 图生视频
  • 多参考生成

截图还展示了一个 H3 Context IR 选项,这与 MiniMax 的官方架构相符。

H3-Context-IR 是 MiniMax 托管的预处理和编排系统,用于解释自由形式的多模态指令。它分析文本、图像、音频和参考视频之间的关系,然后将该上下文转换为 H3-Base 能更有效利用的表示形式。

MiniMax 并未 在开源权重中提供完整的 H3-Context-IR 托管系统。它提供了一个 API 来复现官方工作流程。

这一区别有助于解释为什么托管服务可能比纯粹的本地开源权重安装更容易上手。

一个 15 秒的西部风格测试,约三分钟完成

源文作者通过 MetaSo 测试了 H3,使用了一个简短的西部风格寻宝概念。

生成的视频片段包含:

  • 沙漠全景镜头
  • 牛仔特写镜头
  • 骑马动作场景
  • 多个镜头切换
  • 一致的西部氛围

作者报告称,从打开生成页面到收到完成的 15 秒结果,整个过程大约耗时三分钟。

这是一个单独的测试结果,并非保证的服务级别延迟。

实际生成时间可能因以下因素而异:

  • 队列负载
  • 分辨率
  • 视频时长
  • 生成模式
  • 参考数量
  • 平台容量

实际的区别在于,用户无需自己管理推理基础设施。

对于许多创作者来说,这比模型在技术上是否开源权重更为重要。

MetaSo 也支持面向 ComfyUI 的工作流程

源文称,高级用户可以将该服务连接到 ComfyUI 工作流程。

这在一体化网页生成器和完全自托管模型之间提供了一个有用的中间方案。

ComfyUI 是一个开源的、基于节点的生成式 AI 工作流系统。MiniMax 官方的 H3 代码库也将 ComfyUI 列为推荐的 H3 推理/工作流选项之一。

以及H3模板的链接。

节点式工作流让用户对以下方面拥有更多控制:

  • 输入准备
  • 提示词阶段
  • 参考素材
  • 分支处理
  • 后处理
  • 可复用的生成管道

实际操作中的分工如下:

用户类型 适用的工作流
测试创意的创作者 浏览器提示词界面
使用参考素材的创作者 浏览器多参考工作流
高级用户 ComfyUI 或 API 工作流
基础设施团队 本地或云端部署开源权重

这也是托管访问与开源权重相辅相成而非相互排斥的原因之一。

每秒0.09元改变了迭代的成本

原文后半部分聚焦于价格。

在作者测试时,MetaSo显示:

分辨率 来源中MetaSo显示的价格
768p 0.09元/秒
2K 0.15元/秒

图片展示了MiniMax H3生成视频的输出价格信息。2K视频按秒计费,价格为0.15元/秒,可获得17.0积分/秒;768P视频现已开放,按秒计费,价格为0.09元/秒,可获得10.2积分/秒。该图片与上下文紧密相关,上下文提到MetaSo在作者测试时显示的768p和2K视频价格分别为¥0.09/秒和¥0.15/秒,此图直观呈现了这些价格,帮助读者更清晰地了解MiniMax H3的视频生成价格情况。

这些费率产生的是非常小的单条视频成本。

768p 示例

时长 按0.09元/秒计算的费用
5秒 0.45元
10秒 0.90元
15秒 1.35元

2K 示例

时长 按0.15元/秒计算的费用
5秒 0.75元
10秒 1.50元
15秒 2.25元

这就是为什么原文将AI视频描述为以人民币计算正进入“几分钱”时代的原因。

更准确地说,这是某一时间点上第三方托管的定价,不应将其泛化到整个H3生态系统中。

MiniMax自己的API和其他提供商可能采用不同的价格、货币、分辨率、计费逻辑和促销折扣。

Artificial Analysis目前在其排行榜对比中,将H3的创作者API价格列为默认设置下每分钟1080p视频约7.80美元。这与MetaSo截图中的定价基础不同,也说明了为什么必须明确标注各提供商的具体费率。

为什么廉价生成比表面看起来更重要

AI视频通常不会一次尝试就产出最终结果。

创作者可能会生成一段视频,发现问题,修改提示词,然后重新尝试。

这意味着真正的成本不是:

一条视频的价格

而更接近:

每次尝试的成本 × 获得可接受结果所需的尝试次数

假设一位创作者需要尝试8次生成10秒的768p视频,才能选出一个可用的版本。

按来源中MetaSo显示的价格计算:

10秒 × 0.09元 × 8次尝试 = 7.20元

当每次尝试的成本达到几十元时,同样的基本创作过程就会变得困难得多。

更低的价格可以改变用户行为。

创作者可以负担得起测试:

  • 更多的镜头方向
  • 更多的角色动作
  • 更多的提示词变体
  • 不同的宽高比
  • 同一广告的多个版本
  • 替代性的故事情节

其价值不仅在于节省最终成品的费用。

更在于降低了尝试的心理成本。

廉价迭代正在

尤其对视频至关重要

文本生成的成本足够低廉,以至于用户很少会在要求再生成一版草稿前犹豫不决。

视频则不同。

每一次生成都要消耗多得多的算力,而且结果包含的多个维度可能同时出问题:

  • 画面质量
  • 时间一致性
  • 运动
  • 镜头行为
  • 音频
  • 对白
  • 人物身份
  • 文字
  • 产品细节
  • 剪辑节奏

这使得反复采样成为常态。

因此,一个实用的生产指标是:

总花费
──────────────
可用出片数

如果一个模型每秒生成的成本较低,但又能产出足够多的可用生成结果,让每个被采纳片段的成本保持在较低水平,那么它就是有价值的。

创作者应当同时评估价格和命中率。

H3 的能力让低成本迭代更有吸引力

价格之所以重要,是因为 H3 并非一个精简的文本生成视频模型。

MiniMax 官方仓库确认 H3 支持:

  • 原生立体声
  • 4–15 秒输出
  • 24 FPS
  • 多种宽高比
  • 首帧生成
  • 尾帧生成
  • 首尾帧生成
  • 参考图片
  • 参考视频
  • 参考音频
  • 多参考工作流
  • 2K 重生成

该架构还通过 H3-Omni-Transformer 联合预测视频和音频的潜变量。

这意味着一次生成可以同时包含视觉和音频结构,而不需要单独进行配音环节。

在开放工作流中,2K 是一个独立的重生成阶段

官方 H3 仓库将完整系统描述为:

  1. H3-Context-IR
  2. H3-Base
  3. H3-Regenerate-2K

H3-Base 生成 768p 输出。

随后 H3-Regenerate-2K 将基础结果与原始上下文一起输入,以更高分辨率重新生成片段。

这与简单的像素放大不同。

托管 API 可以将这些阶段对用户隐藏起来。

API 访问让 H3 超越网页界面

来源文章还展示了 MetaSo 中的 H3 API 面板。

图片展示了MetaSo的MiniMax H3 API调用示例。左侧为请求示例,使用curl命令,包含POST请求、URL、Header、Content-Type等信息,以及data中的model、type、text、resolution、duration等参数。右侧是响应结果,显示208状态码及task_id。该图与上下文紧密相关,是对上文提到的H3 API面板中请求示例的直观呈现,帮助开发者理解如何使用MetaSo API进行视频生成等操作。

截图提供了一个使用 MetaSo 自有 API 主机和 MiniMax-H3 模型名称的请求示例。

所展示结构的一个简化版本如下:

curl --request POST \
  --url https://metaso.cn/api/minimax/v2/video_generation \
  --header 'Authorization: Bearer <YOUR_API_KEY>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "MiniMax-H3",
    "content": [
      {
        "type": "text",
        "text": "描述你想要生成的视频。"
      }
    ],
    "resolution": "2K",
    "duration": 5,
    "ratio": "16:9"
  }'

这段代码反映了来源截图中可见的请求形态。开发者在生产环境部署之前,应使用 MetaSo 的最新文档或产品内的 API 面板,因为端点、字段、认证格式和限制可能会发生变化。

该 API 很实用

用于重复工作流

当团队需要以下功能时,编程访问比浏览器更有用:

  • 生成多个变体
  • 连接内容管线
  • 自动化产品视频
  • 构建内部创意工具
  • 从ComfyUI发送任务
  • 自动存储输出
  • 添加审核和批准步骤

托管推理让应用程序可以在不管理实际模型服务栈的情况下调用H3。

托管API与本地开源权重服务不同的用户

H3生态系统现在为开发者提供了多种工作方式。

方案1:使用托管创意界面

最适合:

  • 个人创作者
  • 营销团队
  • 快速实验
  • 没有GPU的人员

优点:

  • 无需部署
  • 设置时间短
  • 界面简单
  • 提供商管理算力

权衡:

  • 提供商特定定价
  • 排队等待
  • 使用限制
  • 平台依赖

方案2:使用托管API

最适合:

  • 开发者
  • SaaS产品
  • 内部自动化
  • 不想自托管推理的ComfyUI用户

优点:

  • 编程控制
  • 无需GPU运维
  • 更容易扩展

权衡:

  • 使用费用
  • API依赖
  • 提供商限制

方案3:自托管开源权重

最适合:

  • 研究团队
  • 基础设施团队
  • 拥有自有GPU能力的组织
  • 定制推理工作

优点:

  • 更强的基础设施控制
  • 开放模型访问
  • 定制管线
  • 支持组件的潜在离线/私有运行

权衡:

  • 硬件成本
  • 部署复杂性
  • 运维维护
  • 设置时间更长

正确的选择更多取决于工作流的经济性而非意识形态。

开放模型仍然可以通过托管服务达到最大便利性。

创作者的实用工作流

对于想在不进行本地部署的情况下测试H3的用户,一个合理的流程是:

第1步:从768p开始

在探索提示词和场景时使用较低成本模式。

在概念可行之前不要在高分辨率上投入。

第2步:生成多个变体

一次只改变一个变量:

  • 摄像机角度
  • 主体动作
  • 光照
  • 镜头节奏
  • 参考强度

这样更容易理解是什么改进了结果。

第3步:保留最佳提示词和参考

保存成功的组合。

一个可复用的提示词可能比一次幸运的输出更有价值。

第4步:将最终候选提升至2K

一旦构图和运动可接受,在更高分辨率层级生成或重新生成。

第5步:使用ComfyUI或API进行重复操作

如果同一工作流频繁重复,将其移入节点图或应用程序管线。

第6步:在常规编辑器中完成

对于商业用途,检查:

  • 标志
  • 文字
  • 产品细节
  • 音频电平
  • 字幕
  • 版权
  • 最终调色
  • 导出设置

AI生成应被视为生产链的一部分,而不是唯一的审核阶段。

开发者的实用工作流

开发者应将模型访问与业务逻辑分离。

一个简单的架构可以如下:

应用程序
    ↓
生成服务
    ↓
提供商适配器
    ↓
MetaSo H3 API / MiniMax API / 自托管H3
    ↓
任务状态 + 输出URL
    ↓
存储 / 审核 / 发布

提供商适配器让后续更换推理后端变得更加容易。

可存储以下字段:

  • 提示词
  • 参考内容
  • 分辨率
  • 时长
  • 宽高比
  • 提供商
  • 模型版本
  • 成本
  • 任务 ID
  • 生成时间
  • 输出 URL
  • 审核状态

由此可构建一个有效数据集,用于比较每个可用片段的实际成本。

¥0.09 价格并不代表什么

这个醒目数字很有吸引力,但有几个边界问题需要注意。

并非 MiniMax 的通用官方价格

¥0.09/秒和¥0.15/秒是来源文章中显示的 MetaSo 价格。

不应将其引用为 MiniMax 的全球 API 标准定价。

价格可能变动

第三方提供商可能因以下原因调整定价:

  • 促销活动
  • 算力供应
  • 批量协议
  • 队列策略
  • 模型更新
  • 商业策略

务必随时查看实时界面。

低价并不保证最终视频的单位成本低

一个包含大量失败生成的工作流仍可能变得昂贵。

请衡量接受率。

托管访问不同于开源部署

MetaSo 为用户处理基础设施。

自托管提供更多控制权,但也将计算和运维负担转移到用户身上。

更大的转变:开放模型正变得更容易使用

来源中最值得关注的部分不仅是某家提供商价格低廉。

而是两种趋势的汇合。

首先,高质量视频模型正变得更加开放。

MiniMax 发布了 H3 权重,并支持多种推理框架,包括 ComfyUI。

其次,托管平台正在将这些开放模型变成一键式服务。

由此带来更广泛的用户群体:

  • 研究人员可以检视并部署模型。
  • 开发者可以使用 API。
  • 高级用户可以构建 ComfyUI 流程图。
  • 创作者可以打开网页直接生成。

模型内部并不会变得更简单。

基础设施对使用者而言变得不可见。

常见问题

什么是 MiniMax H3?

MiniMax H3 是 MiniMax 推出的开放权重全模态视频生成系统。它可以以文本、图像、视频和音频作为上下文,生成长达 15 秒、带有原生立体声音频的同步视频片段。

MiniMax H3 在 MetaSo 上的价格是多少?

来源文章显示,测试期间 MetaSo 对 768p 每生成秒收费 ¥0.09,2K 每生成秒收费 ¥0.15。这些是 MetaSo 平台价格,而非 MiniMax 的通用官方 API 费率,并且可能变化。

我可以不使用 GPU 运行 MiniMax H3 吗?

可以,如果你使用托管服务,例如 MiniMax 自己的 API/应用或 MetaSo 等第三方平台。提供商在其基础设施上运行模型,因此你的本地设备只需访问服务即可。

MiniMax H3 是开源的吗?

MiniMax 已在其社区许可下发布 H3 模型权重和代码。完整的托管式 H3-Context-IR 编排系统不在开放发布范围内,不过 MiniMax 为该阶段提供了 API 和提示词指南。

MiniMax H3 可以在 ComfyUI 中运行吗?

可以。MiniMax 官方 H3 仓库将 ComfyUI 列为推荐工作流之一,并提供了 H3 模板链接。MetaSo 也表示其托管式 H3 访问可与面向 ComfyUI 的工作流程一起使用。

工作流。

自行托管 H3 需要什么硬件?

具体要求取决于推理框架、精度、时长和性能目标。MiniMax 官方的 SGLang 参考命令使用四块 GPU,因此用户不应假设普通消费级笔记本电脑就能流畅运行完整模型。

H3 目前在 Artificial Analysis 上排名第一吗?

截至本文所评审的 2026 年 8 月 7 日快照,H3 在 Artificial Analysis 的带音频视频编辑排行榜上排名第一。排名是动态的,并不代表 H3 在所有视频生成类别中都位居第一。

我应该直接以 2K 分辨率生成吗?

在进行实验时,从更低廉的分辨率入手通常更合理,因为大多数概念需要多次迭代。一旦运动、构图和参考内容稳定下来,再将理想结果放入更高分辨率的工作流中。

相关工具

  • MiniMax H3:官方开源仓库,包含 H3 模型架构、检查点、提示词指南、部署示例和工作流链接。
  • MiniMax API 平台:MiniMax 面向 H3 及其他 MiniMax 模型的官方托管开发者平台。
  • MetaSo:源文章中重点介绍的 AI 产品,其浏览器端视频生成入口包含 MiniMax H3。
  • ComfyUI:一个开源、基于节点的生成式 AI 工作流系统,在 MiniMax 的 H3 仓库中获官方支持。
  • SGLang:MiniMax 推荐的用于本地服务 H3 的推理框架之一。
  • Hugging Face:MiniMax 官方 H3 模型页面,提供公开模型文件和社区使用。

相关链接

总结

MiniMax H3 采用开放权重,但本地部署仍然涉及不小的硬件和工程开销。MiniMax 官方的参考服务示例使用了多 GPU 的 SGLang 配置,这有助于解释为什么许多视频创作者更倾向于托管路线。

源文章展示了 MetaSo 如何将 H3 转化为一种

基于浏览器的服务,提供文生视频、图生视频、多参考生成、API访问以及面向ComfyUI的工作流。在测试时,MetaSo显示的定价为768p每秒0.09元,2K每秒0.15元。

这些低廉的第三方费率之所以重要,是因为AI视频本质上是一个迭代过程。更便宜的尝试让创作者在最终确定高分辨率结果之前,能够测试更多的镜头方向、提示词、场景和剪辑。

真正的转变不仅在于H3是开源的——更在于开源权重视频模型正日益变得像普通网络服务一样易于使用。