Home
avatar

杨晏

Kimi K3 3万亿开源+GPT-Red自动化攻击:AI世界的矛与盾,同一天进化了

Kimi K3 3万亿开源+GPT-Red自动化攻击:AI世界的矛与盾,同一天进化了

cover_封面


一、Kimi K3:全球最大开源模型,前端编程反超Fable 5

7月16日,月之暗面扔了一颗炸弹。

Kimi K3正式发布,2.8万亿参数,全球首个开源的3万亿级别模型。

这是一个什么概念?2.8万亿参数,是DeepSeek V4 Pro 1.6万亿的1.75倍,是MiniMax M3 2.7万亿的1.04倍。参数规模直接刷新了全球开源模型纪录。

更关键的是它的成绩单:

Frontend Code Arena(前端代码竞技场),Kimi K3以1679分登顶,超越Claude Fable 5,7个细分赛道拿下6个第一。

这意味着什么?前端编程这个赛道,国产开源模型第一次正面干翻了全球最强的闭源模型。

不仅仅是前端。它搭起了一套真正可用的编译器栈——用开源EDA工具和Nangate 45nm工艺库,48小时自主运行Agent,设计了一颗芯片。 芯片面积4mm²,集成146万个标准单元,0.277MB SRAM,INT4 MAC阵列,100MHz时序收敛,仿真解码吞吐持续超过8700 token/秒。一颗由AI设计、为AI服务的芯片。

在长程编程上,它能在最多24小时内分析现有实现、重写GPU内核并反复跑分验证。在知识工作上,它完成了一份覆盖ASIC行业42年历史的深度研究报告——2800多次网页搜索与抓取、1100多次终端数据拉取、87份季报和99份原始PDF、合计超过11000页资料。

然后它做了一个4分半的3Blue1Brown风格动画,介绍自己的架构。

一个模型,设计芯片、写编译器、做研究、剪视频,全部自己完成。

架构上,Kimi K3基于Kimi Delta Attention(KDA混合线性注意力机制)和Attention Residuals构建。MoE混合专家架构,896个专家中高效激活16个。训练效率相比K2提升约2.5倍。

但有一个有趣的细节:它的API定价放弃了国产大模型惯用的低价路线。 输入3美元/百万token,输出15美元/百万token。对比一下:DeepSeek V4 Pro输出6元(约0.83美元),MiniMax M3输出2.1元(约0.29美元),Claude Fable 5输出10美元。K3的定价直接对标Fable 5,甚至比Fable 5贵50%。

月之暗面的逻辑很清晰——不卷低价,卷能力。综合智能指数57分仍落后Fable 5和Sol,但在前端编程、长程任务等特定赛道上已经反超。7月底将完整公开权重。


illust_01_Frontend登顶

二、GPT-Red:AI攻击AI,安全范式变了

同一天,OpenAI发布了一个方向完全相反的模型。

GPT-Red,一个专门用来攻击其他AI模型的AI。

它的任务不是帮用户写代码、做研究,而是攻击OpenAI自己的模型——不断尝试发现漏洞、发动prompt injection攻击,从而帮助模型提升抵御能力。

核心机制是自博弈强化学习。GPT-Red持续设计新的攻击方式,诱导模型执行非预期操作。OpenAI投入了前所未有的算力规模对其进行训练,并将生成的攻击数据直接用于生产模型的安全训练。

成绩单很惊人。 伪造思维链型攻击的成功率,从GPT-5.1上的95%降低至最新模型上的不足10%。GPT-5.6 Sol在GPT-Red的直接提示注入攻击中,失败率仅有0.05%。GPT-Red自身在攻击测试中的成功率达到了84%。

这标志着AI安全的一次范式转移。过去,安全测试靠人工红队——安全专家手动设计攻击,手工测试。现在,让AI自主发现并修复自身漏洞,类似于AlphaGo的自我对弈,但应用于安全领域。

为什么这件事重要? 随着模型能力指数级增长,人工红队已无法覆盖所有攻击向量。你不可能让100个安全专家每天手动测试1000种攻击方式。但一个自动化红队模型可以24/7不间断运行,发现人类根本想不到的攻击路径。

GPT-Red已经应用于GPT-5.6 Sol的训练。这意味着Sol的安全能力,有一部分是AI自己教自己的。


illust_02_48小时自主设计芯片

三、矛与盾,同一天进化

7月16日,两条新闻同时出现。

Kimi K3代表了AI能力的极致——2.8万亿参数,前端编程反超Fable 5,48小时设计芯片,2800次搜索写研究报告。能力在向上冲。

GPT-Red代表了AI安全的极致——84%攻击成功率,自博弈强化学习,让Sol的prompt injection失败率降到0.05%。安全在向下扎。

一个在造矛,一个在造盾。但有趣的是,矛和盾都是AI自己造的。

Kimi K3的芯片是AI自己设计的。GPT-Red的攻击数据是AI自己生成的。AI能力的提升让AI变得更危险,AI安全的提升让AI变得更可控。同一个技术基座,两个完全相反的方向,同时加速。

回到Kimi K3本身。2.8万亿参数,开源,前端编程反超Fable 5,48小时造芯片——这些数据每一个拿出来都够写一篇文章。但我觉得最有意思的,是它的定价策略。 illust_03_一个模型的全能

输入3美元,输出15美元。不卷低价,卷能力。

在国产大模型集体打价格战的时候,月之暗面选择了完全不同的路线。它的逻辑是:我的能力值这个价。前端编程我比Fable 5强,长程任务我接近Sol,我的token消耗费用比Fable 5和Sol低——所以我的定价就应该对标它们。

这是一种自信,也是一种赌注。赌的是开发者愿意为真正好用的模型买单,而不是只看价格表上的数字。

7月底权重完整公开,到时候每个人都能自己跑一跑。

#KimiK3 #GPTRed #AI安全 #开源模型 #前端编程 #OpenAI #大模型竞争 #自博弈

AI GPT Claude OpenAI API DeepSeek