国产开源三巨头,一周放出了6.8万亿参数
国产开源三巨头,一周放出了6.8万亿参数

7月16日,Kimi K3发布。
7月17日,DeepSeek V4峰谷定价上线。
7月19日,Qwen3.8官宣。
7月21日,Qwen3.8更新版本,前端能力再提升。
五天内,三家旗舰模型密集出手。 这个节奏在过去一年里,从没出现过。
不是巧合,是窗口期到了。

三巨头各自押了什么
先看数据。
Kimi K3,2.8T参数,KDA混合线性注意力,896专家激活16,Frontend Code Arena 1679分第一。承诺7月27日前开源权重。
Qwen3.8,2.4T参数,288B激活,MoE+DSAG动态稀疏自适应门控,自称仅次于Fable 5。7月21日已更新版本,前端能力提升。
DeepSeek V4 Pro,1.6T参数,49B激活,SWE-Bench Verified 80.6%。7月15日上线峰谷定价,高峰翻倍,夜间和周末保持原价。
三家加起来,一周内放出了超过6.8万亿参数的开源或准开源模型。
三家押注的技术路线,完全不一样。
K3走的是KDA混合线性注意力,注意力残差结构,原生视觉,896专家的大规模MoE。目标是让模型同时具备长上下文、视觉理解和代码执行能力。
Qwen3.8走的是超大规模MoE+DSAG门控,288B激活参数中2.4T总参,推理效率官方称提升47%。目标是编程和办公场景。
DeepSeek V4走的是极致性价比路线,1.6T参数49B激活,但定价是闭源模型的1/20不到。峰谷计费让算力像用电一样按时段定价。 
三条路线,三个方向。
K3上线三天就刹车,算力见顶了
这个细节挺有意思的。
Kimi K3上线后,只用了三天,月之暗面就宣布暂停C端新用户订阅和注册。
原因很直接:算力见顶了。
2.8T参数的模型,跑一次推理的成本是前代K2.6的几倍。即使是896专家只激活16个,推理集群的算力消耗依然惊人。月之暗面在算力储备上,显然没有预料到需求会这么猛。
这不是K3独有的问题。Qwen3.8 2.4T参数,DeepSeek V4 Pro 1.6T参数,每一个模型跑起来都要烧掉海量算力。国产模型在参数规模上已经追上甚至超越闭源,但算力储备的差距,是比参数差距更难跨越的鸿沟。
DeepSeek的峰谷定价,某种程度上也是在回应这个问题。高峰时段价格翻倍,引导开发者把非紧急任务挪到夜间和周末。这不是涨价,是算力调峰,和电网的峰谷电价一个逻辑。 
开源是承诺,落地是另一回事
K3承诺7月27日前开源权重。Qwen3.8说「going open-weight soon」。
但两个问题摆在面前。
第一,开源的模型多大?2.8T参数的模型,完整权重文件至少几百GB。下载、部署、推理,每一步都是门槛。没有8张H100级别显卡,连跑都跑不起来。
第二,开源后的生态怎么建?权重放出来只是第一步,社区适配、推理框架优化、开发者工具链,这些都需要时间。DeepSeek从开源到现在,社区生态花了将近一年才成熟。K3和Qwen3.8,这条路不会更短。
开源承诺的价值,不在开源那一刻,而在开源之后一年。 
开发者窗口期,只有6个月
三巨头密集发布,对开发者来说意味着一件事:选择窗口期。
过去一年,开发者选模型很简单,要么闭源花钱买能力,要么用DeepSeek V4这种性价比路线。但未来6个月,情况会彻底改变。
K3开源后,你有机会本地部署2.8T级别的模型,虽然成本不低,但数据安全可控。Qwen3.8正式版发布后,Token Plan的39元/月,加上兼容两套API协议,切换到Cursor和Claude Code的成本几乎为零。DeepSeek的峰谷定价,让夜间批处理任务成本降到极致。
三家的产品矩阵已经清晰:K3走开源+前端编程,Qwen3.8走模型+工具链闭环,DeepSeek走极致性价比+峰谷计费。
开发者不需要选边站,但需要想清楚自己的场景适合哪条路。
窗口期也是洗牌期
有一点要提醒。
三巨头密集发布的背后,是资源的高度集中。K3的算力见顶、Qwen3.8的「soon」、DeepSeek的峰谷涨价,都在指向同一个信号——增长开始遇到瓶颈。
算力不够烧,定价不能无限低,开源不能永远免费。当补贴退潮,能活下来的模型,不是参数最大的,而是生态最健康的。
窗口期最多6个月。到2026年底,这个格局会重新洗牌。
但不管怎么洗,这一周发生的事值得记住。Kimi K3 2.8T开源 + Qwen3.8 2.4T官宣 + DeepSeek V4峰谷定价,三个信号叠在一起,指向同一个方向——国产开源模型集体冲线,AI正在从奢侈品变成开发者手中的标准工具。
去试试K3的API,去跑跑Qwen3.8的预览版,去算算DeepSeek夜间能省多少。窗口期开着,别浪费。 