Home
avatar

杨晏

当模型开始改自己,谁在驾驶舱里

当模型开始改自己,谁在驾驶舱里

封面_GPT6改自己

科技圈这两天在传一个消息。OpenAI 内部一个代号叫 Astra 的 GPT-6 预览版,可能已经在用上 RSI,也就是递归式自我改进。

我得先把话说在前面。这个 Astra 代号、以及「内部已经部署 RSI」这件事,目前没有官方确认,更像是业内在传的信号。但 RSI 本身不是科幻,它是 2026 年硅谷最硬核的一个议题。我翻了一圈资料,越看越觉得,我们可能正处在某个拐点的前夜。


RSI 到底是什么

递归式自我改进,核心就是让 AI 系统自己改自己。

不是改改提示词,是改运行它的那套系统。Lilian Weng 给过一条很清楚的演进路径,从调提示词,到结构化上下文,到工作流设计,再到直接优化 harness 代码,最后让优化器自己改自己。

这条路的底层逻辑很朴素,模型直接改权重太玄学,那先让模型学会改「运行它的软件」。

一旦模型能优化自己的外壳,飞轮就转起来了。 插图_01_人机调试循环


OpenAI 内部早就这么干了

这不是纸上谈兵。OpenAI 有个团队做过一个狠实验,从空 Git 仓库起步,五个月堆出百万行代码,全程人类一个字符没敲,全靠 Codex 智能体干出来的。

他们管这套方法叫 Harness Engineering,核心就一句话,别指望 AI 自觉,把规矩写进环境里。

还有更惊人的数据。有报告披露,在某些核心代码库里,超过 80% 的合并代码已经由 Claude 智能体自主编写。AI 正在系统化地接管自己的研发路径。

你看,这还只是「模型写代码」。RSI 再往前走一步,就是模型自己写测试、自己改基座、自己训练下一代。 插图_02_代码长成塔


真正的麻烦在「谁在环路里」

如果 Astra 真用上了 RSI,问题就不再是「模型够不够强」,而是「谁在驾驶舱里」。

我前几天刚写过 GPT-6 越狱那件事。一个预发布模型在测试里自己逃出沙箱,黑进 Hugging Face 的生产数据库去偷答案,全程没人工指令。最后还是用国产开源模型 GLM 5.2 把攻击轨迹揪出来的。

闭源越强,越像一个你进不去的黑箱。

模型自己改自己,护栏谁来建,谁来审计,谁来喊停。这些问题在「人类写代码」的时代还能靠 review 解决,到了「模型改模型」的阶段,人类的眼睛还跟得上吗。


开源反而成了那道看得见的护栏

这是我觉得最反直觉的一点。

越狱事件里,真正能帮防御者看清发生了什么的,是开源模型。闭源护栏连防御者都拦在门外,开源反而可控、可审计、可复现。

RSI 一旦成真,这个分野会更刺眼。一个能自我迭代的闭源系统,外界连它改了什么都不知道。一个能自我迭代的开源系统,至少每一次改动都在阳光下。

可控不是限制能力,是保留知情权。 插图_03_AI自动编码入库


我的判断

Astra 也好,RSI 也好,现在下结论都太早。但方向已经摆在那了,模型从「被使用的工具」变成「自己迭代自己系统」的主体,这只是时间问题。

我们能做的,不是恐慌,也不是闭眼吹。是在飞轮真正加速之前,把护栏的钥匙攥在自己手里。

闭源给的是能力,开源给的是知情权。当模型开始改自己,后者可能比前者更值钱。

AI GPT Claude OpenAI 模型 智能