Home
avatar

杨晏

字节要训10万亿参数模型,中国大模型的军备竞赛升级了

字节要训10万亿参数模型,中国大模型的军备竞赛升级了

封面_字节10万亿冲击全球第一

昨天还在传「超5万亿」,今天直接变成「最高10万亿」。

10万亿参数。 大约是月之暗面 Kimi K3 的三倍,是目前国内任何已发布模型的三倍还多。

英国《金融时报》援引知情人士报道,字节跳动正处于一个超大模型的预训练早期阶段,参数规模最高可达 10 万亿。就在前一天晚上,晚点 LatePost 的独家消息还是「超 5 万亿」。

一天之内数字翻倍,这才是这则新闻最刺激的地方。字节的目标根本不是什么「追赶」,是直接把参数规模一次推到同行的数倍,冲全球第一。


这个数字是什么概念

先把参照系摆出来。

Anthropic 从不公开自家模型的参数规模,但业内估计,其最先进的 Mythos 5 大约 8 万亿参数,Fable 5 大约 5 万亿。

国内目前已知的规模天花板。

  • 月之暗面 Kimi K3,2.8 万亿参数,7 月 27 日开源,是全球最大的开源模型,Arena 前端编程登顶 1679 分,压过 Claude Fable 5

  • 阿里 Qwen3.8-Max,2.4 万亿参数,8 月 3 日刚发布,激活仅 95B,首次开源 Max 级权重,国际价只要 Opus 5 的四分之一

  • 字节若按 5 万亿落地,直接超过阿里和月之暗面两家之和

而 10 万亿,意味着超过业内估算的 Mythos 5,有机会成为全球参数规模第一的模型。

这个体量有多夸张,举一个参考,Kimi K3 开源时权重文件约 1.56TB,正常部署需要价值千万的 GPU 集群。10 万亿的预训练,烧掉的算力是天文数字。 illust_01_10万亿什么概念


张一鸣罕见发声,不蒸馏,不走捷径

比参数数字更有信号意义的,是字节两个掌门人罕见地先后表态。

据 The Information 报道,在一个月前的 Seed 全员会上,张一鸣明确拒绝用模型蒸馏来加速研发。态度很坚决。

「字节跳动应该愿意为了长远目标牺牲一些短期利益。」

他还安抚了团队,训大模型本就是很难的事,不必过度焦虑。

什么叫蒸馏,简单说就是用强模型的输出去训练弱模型,是很多公司快速追平差距的捷径。DeepSeek、Kimi、Qwen 都在用,字节也不是不会。

但张一鸣的选择是,不用别人的输出,换一时的榜单排名。哪怕这意味着 Seed 模型短期内会在评测榜单上暂时落后于国内同行。

这个表态放在今天看,分量很重。因为它解释了一切,为什么字节宁可承受短期落后,也要把参数规模一次推到 10 万亿。 illust_02_拒绝蒸馏不走捷径


梁汝波,接受短期落后,动作不要变形

8 月 6 日,字节举办 2026 年度年中全员会,CEO 梁汝波把话接上了。

他坦承,字节跳动在大语言模型上面临被海外先进模型拉开差距的问题。

但方向不变,坚持自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形

他还提出 2026 年业务的三大原则,高度优先、粗主干、优化长期,AI、信息平台、交易服务被列为三大核心业务支柱,豆包未来要承担更重要的角色。

两个掌门人,一个说「可以牺牲短期利益」,一个说「接受短期落后」。在 AI 圈人人都在抢跑、抢榜、抢发布的当下,这种口径太罕见了。

这不是保守,这是把赌注押在了更长的时间尺度上。 illust_03_接受短期落后


三家三种打法,军备竞赛升级了

把字节、阿里、月之暗面摆在一起看,中国大模型的竞争已经分成三条完全不同的路线。

  • 字节,赌规模。一次推到 10 万亿,用同行数倍的参数体量换领先位置,拒绝蒸馏走捷径,押注长期主义

  • 阿里,赌开源+效率。Qwen3.8-Max 总参 2.4 万亿但只激活 95B,稀疏 MoE 把成本打下来,首次开源 Max 级权重,国际价只有 Opus 5 的四分之一

  • 月之暗面,赌开源+登顶。Kimi K3 全球最大开源模型,前端编程登顶第一,逼得 OpenAI 和 Anthropic 估值预期蒸发约 3140 亿美元

三条路线没有对错,但有一个共同点,都不再满足于「够用」

之前国产模型的竞争逻辑是,用更低的成本追平海外性能。现在逻辑变了,要么参数规模直接碾压,要么开源生态直接卡位,要么效率价格打到地板。 illust_04_三家三种打法


参数堆得更大,不等于能力更强

当然,泼冷水的话也得说。

参数更大不等于能力更强,这是 FT 报道里都点明的事实。MoE 架构下,10 万亿总参数可能只激活几百亿,真正的瓶颈在数据质量、训练方法、算力调度。

而且 10 万亿只是「最高可达」,预训练通常需要 3 到 6 个月,最终规模仍可能调整,模型还要经过微调和测试,才会决定是否发布。

OpenAI 和 Anthropic 也都没闲着。这场竞赛里,字节是在用自己的时间换空间,赌的是别人不敢下注的规模。

赌赢了,就是全球第一梯队。赌输了,就是一次昂贵的试错。

但至少这一次,中国公司终于有人敢把参数规模这个数字,推到 10 万亿了。这才是这则新闻最值得记住的地方。 illust_05_参数大不等于能力强

AI Claude OpenAI Anthropic DeepSeek Qwen