字节跳动据报计划推出5万亿以上参数AI模型,后续报道指向最高达10万亿

据报道,字节跳动正在讨论训练一个超过 5 万亿参数的基础模型,后续报道甚至指向最高 10 万亿,但项目仍处于早期阶段,能否落地尚无定论。本文梳理相关消息来源,比较 Qwen3.8-Max、Kimi K3 等模型规模,并分析超大模型竞赛的技术与资源挑战。

发布于 2026年8月7日generalGEO 评分: 0
这张图片是一篇文章的标题封面图,背景为深黑蓝的深色基调,点缀着带有科技感的蓝色线条与光点元素。图片中央清晰展示核心标题,上方背景处还隐约呈现ByteDance的品牌标识,标题内容与文章主题完全对应,直观突出了字节跳动拟推出5万亿参数模型这一核心信息。

据报道,字节跳动计划训练超5万亿参数AI模型,后续报道指向最高10万亿

引言

中国前沿模型竞赛正深入万亿参数时代。

阿里巴巴的Qwen3.8-Max已达到2.4万亿参数,而月之暗面的Kimi K3已将公开披露的规模推至2.8万亿参数

字节跳动可能正准备下一次跃升。

AIBase援引晚点LatePost的报道称,字节跳动于2026年8月7日正在讨论训练一个超过5万亿参数的基础模型。据该报道称,该项目仍处于早期阶段,尚无法保证最终模型会发布。

图片为晚点LatePost发布的内容,标题为“#字节讨论训练超5万亿参数模型#”。内容提到,字节跳动正在讨论训练一个参数规模超5万亿的模型,超过阿里Qwen 3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数),是国内已知参数规模最大的模型。新模型由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作,Seed正在重新梳理组织、划分职责、分配资源。该图片与文档中ByteDance讨论训练超5万亿参数模型的内容相关,是晚点LatePost对此报道的截图。

仅从规模来看,该项目将成为中国公开报道中最大规模的AI模型项目之一。

然而,当天还有一项重要更新。

8月7日晚些时候,路透社援引英国《金融时报》及知情人士的消息报道称,字节跳动正在训练一个多达10万亿参数的模型,且该模型已进入预训练阶段。字节跳动当时尚未对此报道做出公开回应。

这两份报道并非必然矛盾。一个最初讨论为"超5万亿"的项目,最终可能会瞄准更大的配置。但由于字节跳动尚未正式披露模型架构或参数数量,本文中所有数字均应视为报道中的计划,而非已确认的模型规格。

据报道,字节跳动正迈向5万亿参数大关

晚点LatePost的原始报道称,字节跳动正在讨论一个超过5万亿参数的模型。

这将使其远超目前多家中国前沿模型已披露的规模。

模型 公开报道的总参数 状态
Qwen3.8-Max 2.4万亿 阿里巴巴已发布
Kimi K3 2.8万亿 月之暗面已发布
报道中的字节跳动模型 超过5万亿 报道中的计划
后续FT/路透社数据 最高10万亿 据报道,未经官方确认

月之暗面官方将Kimi K3描述为2.8万亿参数的混合专家模型,每个token激活1040亿参数。

路透社8月3日报道称,阿里巴巴的Qwen3.8-Max包含2.4万亿总参数

如果字节跳动最终训练并部署一个5万亿至10万亿参数的模型,这将代表模型总规模的显著提升。

但这并不自动意味着该模型的能力会是原来的两到三倍。

参数数量不等于智能水平

AIBase的消息来源将5万亿参数模型描述为与美国领先前沿系统(如GPT-5.6或Anthropic最新高端模型)处于同一量级类别。

这种比较需要加一个重要的限定条件。

OpenAI 和 Anthropic 并未公开披露 GPT-5.6、Claude Fable 5 或 Claude Mythos 5 的确切参数量

路透社在其8月7日的报道中也提出了同样的观点:与美国领先系统的直接规模比较很困难,因为这些实验室不公布其模型的参数量。

参数量只是衡量模型能力的一个维度。

性能还取决于:

  • 模型架构
  • 每个 token 的激活参数量
  • 训练数据质量
  • 训练 token 数量
  • 数据过滤
  • 优化器设计
  • 强化学习
  • 后训练
  • 工具使用
  • 测试时计算
  • 长上下文架构
  • 推理效率

这一点对于混合专家模型尤为重要。

一个稀疏 MoE 模型可能包含数万亿的总参数,但每个 token 只激活其中很小的一个子集。

Kimi K3 就是一个很好的例子。

其官方规格说明列出:

  • 2.8万亿总参数
  • 1040亿激活参数
  • 896个路由专家
  • 每个 token 选择16个专家

因此,权重的总数与每次推理步骤所使用的计算量并不是一回事。

字节跳动尚未公开披露所报告的模型是否使用类似的稀疏架构,也没有披露每个 token 会激活多少参数。

一个5万亿参数的模型将需要巨大的训练算力

原始报道以 NVIDIA H100 GPU 为例说明了其规模。

其估算表明,训练一个5万亿参数的模型大约需要:

  • 100,000块 H100 级 GPU 运行347天,或
  • 1,000,000块 GPU 运行约35天

这两种场景的总加速器时间大致处于同一数量级:

场景 GPU数量 时长 约计 GPU 天数
长期集群 100,000 347天 3,470万
大规模短期集群 1,000,000 35天 3,500万

这些数字应被理解为来自消息源的粗略场景估算,而非通用的工程公式。

实际训练需求在很大程度上取决于:

  • 架构
  • 稀疏与密集激活
  • token 数量
  • 精度
  • 模型 FLOPs 利用率
  • 检查点保存
  • 网络效率
  • 硬件代际
  • 训练稳定性
  • 数据流水线性能
  • 失败运行和重启

NVIDIA 官方 H100 规格说明显示,SXM 版本的 TDP 最高可达 700W,并通过 Hopper 的 Transformer Engine 和 NVLink 基础设施支持大规模 transformer 训练。

在数十万个加速器的规模下,仅 GPU 集群就达到了电力、网络、冷却和数据中心容量成为首要约束条件的体量。

为什么“100万块GPU”并不意味着字节跳动会这样训练

AIBase 的消息源正确地指出,同时运行100万块 H100 级加速器将是一种极端的基础设施配置。

更现实的项目可能会将训练分散到一个更小但仍然巨大的集群上。

消息源建议更接近的方案是:

  • 200,000到300,000个加速器
  • 运行大约三到四个月

这仍将是最大规模的训练集群之一。

人类有史以来最具雄心的模型训练工程之一。

而预训练仅仅只是一个阶段。

一个前沿模型还需要时间和算力来完成以下步骤:

  1. 数据准备
  2. 架构实验
  3. 规模扩展研究
  4. 预训练
  5. 检查点评估
  6. 监督式后训练
  7. 强化学习
  8. 安全测试
  9. 工具与智能体训练
  10. 服务优化

因此,AIBase 的原始文章估计,整个流程至少需要半年时间,而在成熟模型问世之前,总耗时可能接近一年。

后来英国《金融时报》的报道(路透社摘要)称,该模型已进入预训练阶段,并指出这一阶段通常需要大约三到六个月,之后才会进入微调和发布阶段。

两种描述都指向同一个实际结论:如此规模的项目是一项长期的基础设施工程,而不是第一个训练集群上线后就能立刻出现的模型。

字节跳动有实力去尝试

如此规模的训练不仅仅是一个研究问题。

它更是一个基础设施和资本问题。

字节跳动是为数不多的几家中国科技公司之一,拥有足够的财力、消费者分发渠道、云基础设施、数据中心容量以及AI工程团队,能够认真尝试如此规模的项目。

该公司官方的 Seed 组织已覆盖以下领域:

  • 基础模型预训练
  • 后训练
  • 强化学习
  • 高性能推理
  • 分布式训练
  • 异构硬件编译
  • 多模态模型
  • 智能体系统

字节跳动的基础设施团队明确将其工作描述为涵盖分布式训练、强化学习系统、高性能推理以及面向基础模型的编译器技术。

其招聘材料中也明确提到了以下工作内容:

  • 超大规模训练
  • 训练稳定性
  • 模型 FLOPs 利用率
  • 软硬件协同设计
  • 多节点推理
  • 并行化
  • 调度优化

这些正是在以万亿参数规模训练模型时变得至关重要的系统工程问题。

消息来源的 GPU 数量仅为估算值,并非公开披露数据

AIBase 还引用了第三方对几家前沿实验室可用 AI 算力规模的估算。

文章中提到的大致数量为:

  • OpenAI 约 200 万张 GPU
  • Anthropic 约 62 万张
  • DeepSeek 约 6 万张

这些数字不应被视为经审计的库存数据。

OpenAI 和 Anthropic 并不会公开维护其自有设施、云合作伙伴以及预留容量中所有可用加速器的实时数量。

DeepSeek 约 6 万块加速器的数字最早来自 SemiAnalysis 的估算,此后在各种报道中被广泛引述。这些估算包含的是 A100、H100、H800 和 H20 等多种加速器的混合组合,而非单一型的机队。

比任何确切的库存数字更可靠的,是更宏观的关键点:

前沿模型的开发越来越依赖于获取超大规模的加速器算力,而当模型规模不断增大时,拥有超大规模基础设施的公司与较小实验室之间的差距可能会变得非常悬殊。

H100对比仅是一个基线

使用H100等效算力能让计算讨论更容易理解,但字节跳动未必会依赖单一类型的加速器。

大型AI公司可以组合使用:

  • H100
  • H200
  • Blackwell代英伟达系统
  • 中国特供版英伟达芯片
  • 国产AI加速器
  • 定制硬件
  • 多个云和数据中心区域

更新的加速器可以改变完成相同训练计算量所需的物理GPU数量。

软件同样重要。

以下方面的改进:

  • 内核效率
  • 并行度
  • 专家路由
  • 内存管理
  • 通信
  • 检查点保存
  • 量化
  • 数据加载

可以显著改变模型总规模与训练成本之间的关系。

因此,“X模型恰好需要Y块GPU”应始终被视作一种场景假设,而非固定法则。

字节跳动为何可能需要如此大的模型

消息源主要将该计划框定为推动豆包智能水平迈向全球前沿的一次尝试。

这很可能只是动机的一部分。

更大的基础模型可能为字节跳动AI生态的多个部分提供支撑。

豆包

豆包是字节跳动在中国市场的主要消费级AI产品之一。

更强的基座模型可以提升:

  • 通用推理
  • 知识工作
  • 编程
  • 搜索
  • 长上下文任务
  • 智能体行为
  • 多模态交互

Seed研究

超大规模模型也将为Seed团队提供新的研究平台,探索:

  • 缩放定律
  • 稀疏架构
  • 强化学习
  • 智能体训练
  • 模型效率
  • 记忆
  • 长时间跨度推理

火山引擎

字节跳动还可以通过企业服务和云服务将模型能力商业化。

因此,前沿模型在消费级聊天机器人之外也具有潜在价值。

更大模型仍需带来经济回报

AIBase文章中最后一个问题最为关键。

一个训练成本极高的模型能否产生相应的回报?

前沿实验室不仅要为最终训练运行买单。

总支出可以包括:

  • GPU
  • 数据中心
  • 电力
  • 网络
  • 存储
  • 研究人员薪酬
  • 数据准备
  • 失败实验
  • 后训练
  • 推理
  • 安全相关工作
  • 产品集成

随后,模型必须通过以下某种组合创造价值:

  • 消费级订阅
  • 广告
  • 电商
  • 企业API
  • 云服务
  • 效率工具产品
  • 编程工具
  • 智能体
  • 内部效率提升

参数规模只有在以可接受的推理成本转化为有用能力时,才具有经济意义。

这就是为什么当前一代前沿模型越来越强调扩展效率,而不仅仅是总参数量。

例如,Kimi K3总参数量达2.8万亿,但每个token仅激活1040亿参数。月之暗面表示,与上一代相比,其架构在扩展效率方面有所提升。

因此,真正的竞争不是:

谁的参数最多?

而更接近:

谁能用最少的资源转化出最强的能力?

以可持续的训练和推理成本,转化为最有用的智能?

哪些已确认,哪些仍属报道

已确认

  • 根据月之暗面(Moonshot AI)的信息,Kimi K3 总参数量为 2.8 万亿。
  • 根据阿里巴巴和路透社的报道,Qwen3.8-Max 总参数量为 2.4 万亿。
  • 字节跳动 Seed 团队从事大规模预训练、后训练、推理及模型基础设施相关工作。
  • 豆包(Doubao)是字节跳动的面向消费者的 AI 产品。
  • NVIDIA H100 专为大规模 Transformer 训练和万亿参数规模的 AI 工作负载而设计。

据报道但未经字节跳动官方确认

  • 字节跳动正在构建参数量超过 5 万亿的模型。
  • 最终目标可能高达 10 万亿参数。
  • 确切的训练集群规模。
  • 所需 H100 等效算力的总量。
  • 最终发布日期。
  • 该模型最终是否会公开发布。
  • 模型架构和激活参数数量。

无法从公开模型规格验证

  • 5 万亿参数的模型自动属于“GPT-5.6 级别”。
  • 仅凭参数量就能预测模型的智能水平。
  • GPT-5.6 或 Anthropic 的 Fable/Mythos 级别模型的精确参数量。
  • OpenAI 或 Anthropic 当前的精确 GPU 库存。

常见问题

字节跳动真的在训练一个 5 万亿参数的模型吗?

AIBase 援引《晚点 LatePost》报道称,字节跳动正在讨论一个超过 5 万亿参数的模型。当天晚些时候,路透社援引《金融时报》报道称,字节跳动已经在预训练一个可能高达 10 万亿参数的模型。字节跳动尚未公开确认确切数字。

该模型会为豆包提供支持吗?

消息源预计该模型将增强字节跳动的豆包生态系统,但字节跳动尚未正式宣布该报道中的模型将如何部署。前沿模型也可能支持企业 API、智能体、研究及字节跳动的其他产品。

5 万亿参数的模型一定比 Kimi K3 或 Qwen3.8-Max 更好吗?

不一定。总参数量并不直接决定模型质量。架构、激活参数、训练数据、后训练、强化学习、推理时思考以及工具使用都可能同样重要。

Kimi K3 有多少参数?

月之暗面官方公布 Kimi K3 总参数量为 2.8 万亿,激活参数为 1040 亿。它采用稀疏混合专家(MoE)架构。

Qwen3.8-Max 有多少参数?

根据阿里巴巴和路透社的报道,阿里巴巴的 Qwen3.8-Max 总参数量为 2.4 万亿。它也基于稀疏模型设计,而非对每个 token 激活全部参数量。

训练一个 5 万亿参数的模型需要多少块 H100 GPU?

消息源给出了一个粗略的场景,相当于约 3500 万 H100 GPU·天,例如 10 万块 H100 运行 347 天,或 100 万块 H100 运行约 35 天。实际需求可能因架构、精度、利用率、token 数量、硬件和训练效率而有很大差异。

GPT-5.6 有 5 万亿参数吗?

OpenAI 未公开披露 GPT-5.6 的参数量。任何关于 GPT-5.6 与报道中的字节跳动模型之间的直接数值比较都只能算推测。

字节跳动何时可能发布该模型?

目前尚未公布正式发布日期。路透社基于英国《金融时报》的报道称,该模型正处于预训练阶段,这一阶段可能需要数月时间,之后才能进行微调、评估和部署。

相关工具

  • ByteDance Seed:字节跳动官方研究机构及基础模型、多模态系统和AI研究的模型中心。
  • ByteDance Seed LLM:字节跳动在预训练、后训练、推理、记忆、学习及基础模型研究方面的官方概述。
  • 豆包:字节跳动的消费级AI助手,也是可能受益于更强基础模型的主要产品入口之一。
  • Kimi:月之暗面的官方产品平台及Kimi模型系列的访问入口。
  • 通义千问:阿里巴巴官方Qwen模型及产品门户。
  • NVIDIA H100:NVIDIA官方提供的H100加速器规格及训练性能信息。

相关链接

摘要

据报道,字节跳动正在准备一个超大规模基础模型,规模将超过目前公开披露的中国模型。AIBase和晚点LatePost最初将该项目描述为超过5万亿参数,而当日稍后路透社/英国《金融时报》的报道则称该模型可能达到10万亿参数,且已处于预训练阶段。

如此规模的项目将需要巨大的计算资源。消息来源举例的H100计算量约相当于3500万GPU天,但实际训练需求取决于架构、激活参数、硬件代际、利用率和训练效率。

更大的问题不在于字节跳动能否构建最大的模型。总参数是衡量智能的不完整指标,尤其是对于稀疏混合专家系统而言。

真正的考验在于

字节跳动能够将万亿级的计算量转化为一个在性能上显著更优、效率足以支撑服务、且价值足以证明其背后基础设施合理性的模型。