首页AI 资讯字节跳动被曝训练 10 万亿参数大模型:或超 Anthropic Mythos 5,国内算力竞赛再升级
字节跳动被曝训练 10 万亿参数大模型:或超 Anthropic Mythos 5,国内算力竞赛再升级 封面
行业动态2026-08-089 分钟

字节跳动被曝训练 10 万亿参数大模型:或超 Anthropic Mythos 5,国内算力竞赛再升级

据英国《金融时报》报道,字节跳动正在预训练一个参数量最高可达 10 万亿的 AI 模型,规模超过业内估计约 8 万亿参数的 Anthropic Mythos 5,由 Seed Foundation 负责人项亮主导。预训练通常需 3-6 个月,最终规模与发布时间仍不确定。

字节跳动Seed Foundation10万亿参数大模型金融时报Anthropic算力竞赛

核心结论

10 万亿是目标上限而非最终确定值,预训练 3-6 个月后规模才可能落定

这首先是算力与工程实力的信号:能组织 10 万亿参数预训练,意味着万卡级集群与成熟训练管线

参数规模不等于模型能力,最终要等发布后的实测与成本数据

对比判断表

模型厂商业内估计/披露参数状态
字节新模型(代号未公开)字节跳动最高约 10 万亿预训练早期(FT 报道)
Anthropic Mythos 5Anthropic约 8 万亿(业内估计)未公开具体规模
Anthropic Fable 5Anthropic约 5 万亿(业内估计)未公开具体规模
Kimi K3月之暗面约 2.8 万亿国内已发布最大
Qwen 3.8-Max阿里约 2.4 万亿已发布
字节内部讨论的超 5 万亿方案字节跳动超 5 万亿(讨论中)晚点 LatePost 报道

落地检查清单

区分「最高可达 10 万亿」与「确定 10 万亿」:前者是目标上限
以金融时报原始报道为准,第三方转载注意信息损耗
关注预训练 3-6 个月后的官方或权威进展,而不是每周追传闻
把参数规模与能力评测分开看,参数大不等于能力强
跟踪字节火山引擎算力采购与 Seed 招聘,作为进度参考信号
警惕「爆料即发布」的误读,历史上超大规模模型缩水案例不少

一、FT 独家爆料了什么

8 月 7 日,英国《金融时报》援引三名知情人士报道:字节跳动正在训练一个参数量最高可达 10 万亿的超大规模 AI 模型,目前处于预训练早期阶段。报道称,这一规模比中国已发布的最大模型、月之暗面的 Kimi K3(约 2.8 万亿参数)还要大三倍多,并可能接近甚至超过 Anthropic 最先进的 Mythos 系统。

知情人士表示,预训练阶段通常需要三到六个月,之后如果顺利将进入微调并最终发布;模型的确切规模要到后期阶段才能确定。「最高可达 10 万亿」是一个目标上限,不代表最终版本一定是这个数字。

凤凰网科技、21 世纪经济报道、CNMO、联合早报、Ars Technica 等多家媒体随后跟进转载,事件在 8 月 7 日至 9 日持续发酵,成为本周国内 AI 圈最受关注的消息之一。

二、10 万亿参数是什么概念

Anthropic 并未公开其模型参数规模,但业内估计其最先进的 Mythos 5 约有 8 万亿参数,Fable 5 约为 5 万亿参数。若字节跳动的 10 万亿计划落地,它将明显超过这两个数字,进入全球超大模型的第一梯队。

作为参照,阿里 Qwen 3.8-Max 约为 2.4 万亿参数,月之暗面 Kimi K3 约为 2.8 万亿参数,这两者是目前国内公开信息中参数规模最大的已发布模型。10 万亿意味着大约是其 3.5 到 4 倍的规模。

参数规模决定的是模型「存储信息的基础能力或记忆上限」,实际能力还取决于训练数据质量、训练方法、推理效率与算力投入。参数多不等于模型强,但参数规模确实是衡量厂商算力储备与训练工程能力的重要标尺。

三、从「讨论 5 万亿」到「开练 10 万亿」

8 月 5 日至 6 日,《晚点 LatePost》率先报道,字节跳动内部正在讨论训练一个参数规模超过 5 万亿的模型,并称该计划由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。报道还提到,字节跳动创始人张一鸣在内部表态「不蒸馏、别被编程这种短期热点影响」,倾向做长期、底层的超大模型投入。

仅仅两天后,金融时报就把数字推高到「最高可达 10 万亿」。两个数字并不矛盾:5 万亿是内部讨论的起点方案之一,10 万亿则是目前训练计划的目标上限。从讨论到真正开练,说明字节内部已经完成了从方案论证到算力调度的决策闭环。

8 月 6 日钛媒体等报道了张一鸣「以退为进」的思考:字节在大模型上的策略不是跟随热点(如编程),而是押注「比同行大几倍」的规模优势,走长期路线。10 万亿模型的曝光,正是这条路线的最新注脚。

四、谁来主导:Seed Foundation 与项亮

据晚点 LatePost 与金融时报报道,这一新模型由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。两人均出身于字节跳动的搜索、广告和推荐体系,在超大规模机器学习与数据工程上有深厚积累。

Seed Foundation 是字节跳动面向前沿 AI 研究设立的部门,旗下孵化了豆包大模型、Seedance 视频生成等产品。项亮此前长期负责字节的推荐与广告算法,将其调任 Seed Foundation 负责超大规模模型,被外界解读为字节「把最核心的工程资源押注到前沿模型」的信号。

这一人事安排也解释了为什么字节敢把目标定到 10 万亿:超大模型训练的核心瓶颈不是论文思路,而是数据管线、分布式训练框架与万卡级集群调度能力,这些恰好是项亮团队擅长的领域。

五、参数越大越好吗?先拆掉这个误区

「10 万亿 > 8 万亿 > 2.8 万亿」的直观比较很容易让人得出「参数多就强」的结论,但行业共识是:参数量只是能力上限的一个因子。训练数据质量与规模、架构设计、训练方法(如是否用高质量数据而非单纯堆量)、推理效率,共同决定最终效果。

一个典型的反例是:小参数模型通过高质量数据与强化学习,可以在特定任务上超过参数数倍于自己的模型;反之,参数堆得很大但数据含噪、训练不稳定,可能得到「又贵又笨」的模型。

因此,看待字节 10 万亿模型,更准确的姿势是:它首先是一个「算力与工程实力」信号——能组织 10 万亿参数的预训练,本身就说明字节具备万卡级集群、稳定训练框架和海量数据管线;至于最终能力,要等模型发布后看实测。

六、算力、成本与时间表

10 万亿参数的预训练,对算力的需求是百万卡时级别的。按当前主流 GPU 集群的吞吐估算,即使使用数万张高端加速卡,完整预训练也要数月;再加上数据清洗、checkpoint 保存、故障恢复的开销,总成本是数十亿元人民币量级。

预训练通常 3-6 个月,之后还有微调、对齐(RLHF/DPO)、评测与安全测试等环节。参考行业惯例,从开练到正式发布,乐观估计在 2026 年底到 2027 年上半年,悲观或保守估计则更长——而且不排除中途因成本或效果不达预期而调整规模、延期甚至停掉。

对国内算力供给而言,这类超大模型项目会进一步挤占国产与进口加速卡产能;对云厂商来说,字节火山引擎的万卡调度经验也可能外溢为对外服务能力。

七、对行业格局的影响

如果字节 10 万亿模型最终落地,国内大模型竞争将正式从「百亿/千亿参数的应用竞争」进入「万亿级参数的底座竞争」。已经发布 Qwen 3.8-Max(2.4 万亿)的阿里、手握 K3(2.8 万亿)的月之暗面,以及 DeepSeek、智谱等头部厂商,都需要回应「规模代差」带来的压力。

但竞争不会只发生在参数端:DeepSeek 的路线证明,高性价比的小体量模型同样可以凭推理效率和价格赢得大量用户;OpenAI、Anthropic 则在能力与安全治理上构筑壁垒。参数规模、推理成本、安全治理三条线会同时展开竞争。

对开发者生态来说,超大模型通常意味着更强的通用能力与更长上下文,但也会带来更高的 API 调用成本与更慢的推理延迟。届时「大模型打底、小模型承接高频场景」的混合架构可能成为主流。

八、不确定性:预训练 ≠ 发布

金融时报、晚点等媒体的报道都明确提示:该计划仍处于早期阶段,并不代表模型最终一定会发布。预训练阶段的失败风险包括:训练不稳定导致 loss 发散、算力调度跟不上、成本超预算、安全评估不通过等。

历史上,多家厂商都出现过「官宣级爆料最终缩水」的情况:规模砍半、延期数月、甚至转为内部研究项目。因此对 10 万亿这个数字,合理的态度是「关注但不要押注」——把它当作字节战略方向的风向标,而不是确定的发布日期。

下一步值得跟踪的公开信号:字节火山引擎的算力采购公告、Seed 团队的招聘规模、项亮团队的对外技术分享,以及豆包/Seedance 产品线是否出现能力代际提升。这些都比单条爆料更能反映真实进度。

界面与截图

21世纪经济报道/凤凰网科技关于字节跳动训练 10 万亿参数模型的报道
21世纪经济报道(转引金融时报):字节预训练最高可达 10 万亿参数的模型,或超 Anthropic Mythos 5

常见问题

10 万亿参数的模型一定比 Claude/GPT 强吗?

不一定。参数规模决定能力上限,但实际效果还取决于数据质量、训练方法、对齐程度与推理效率。Anthropic 的模型参数规模也是业内估计而非官方公开,拿估计值做能力比较没有意义,最终要看发布后的实测。

为什么说「最高可达 10 万亿」而不是确定 10 万亿?

因为模型仍在预训练早期,最终规模要到后期阶段才能确定。训练过程中可能因成本、稳定性或效果调整规模,10 万亿是当前计划的目标上限,不是最终承诺。

预训练需要 3-6 个月,什么时候能看到模型?

预训练之后还有微调、对齐、评测与安全测试等环节,通常比预训练本身耗时更长。乐观估计在 2026 年底到 2027 年上半年,保守估计更晚,也存在延期或缩水的可能。

项亮是谁?为什么由他主导?

项亮是字节跳动 Seed Foundation 负责人,此前长期负责字节搜索、广告与推荐算法,在超大规模机器学习与分布式训练上有深厚积累。超大规模模型的核心瓶颈是数据管线与集群调度,这正是他团队的强项。

字节已经有豆包,为什么还要训练超大模型?

豆包是面向 C 端用户的模型产品,超大模型则是底座的战略投入。张一鸣此前被报道表态「不蒸馏、别被短期热点影响」,倾向用规模优势构筑长期能力底座;超大模型的成果也可以反哺豆包、Seedance 等产品线。

这对国内算力和芯片采购有什么影响?

10 万亿参数预训练需要万卡级集群和数月时间,会显著占用高端加速卡产能,推高对国产与进口芯片的需求;同时也会推动国产分布式训练框架与集群调度技术的成熟。

可核验来源

相关工具

相关阅读