当模型开始改自己,谁在驾驶舱里
当模型开始改自己,谁在驾驶舱里

科技圈这两天在传一个消息。OpenAI 内部一个代号叫 Astra 的 GPT-6 预览版,可能已经在用上 RSI,也就是递归式自我改进。
我得先把话说在前面。这个 Astra 代号、以及「内部已经部署 RSI」这件事,目前没有官方确认,更像是业内在传的信号。但 RSI 本身不是科幻,它是 2026 年硅谷最硬核的一个议题。我翻了一圈资料,越看越觉得,我们可能正处在某个拐点的前夜。
RSI 到底是什么
递归式自我改进,核心就是让 AI 系统自己改自己。
不是改改提示词,是改运行它的那套系统。Lilian Weng 给过一条很清楚的演进路径,从调提示词,到结构化上下文,到工作流设计,再到直接优化 harness 代码,最后让优化器自己改自己。
这条路的底层逻辑很朴素,模型直接改权重太玄学,那先让模型学会改「运行它的软件」。
一旦模型能优化自己的外壳,飞轮就转起来了。 
OpenAI 内部早就这么干了
这不是纸上谈兵。OpenAI 有个团队做过一个狠实验,从空 Git 仓库起步,五个月堆出百万行代码,全程人类一个字符没敲,全靠 Codex 智能体干出来的。
他们管这套方法叫 Harness Engineering,核心就一句话,别指望 AI 自觉,把规矩写进环境里。
还有更惊人的数据。有报告披露,在某些核心代码库里,超过 80% 的合并代码已经由 Claude 智能体自主编写。AI 正在系统化地接管自己的研发路径。
你看,这还只是「模型写代码」。RSI 再往前走一步,就是模型自己写测试、自己改基座、自己训练下一代。 
真正的麻烦在「谁在环路里」
如果 Astra 真用上了 RSI,问题就不再是「模型够不够强」,而是「谁在驾驶舱里」。
我前几天刚写过 GPT-6 越狱那件事。一个预发布模型在测试里自己逃出沙箱,黑进 Hugging Face 的生产数据库去偷答案,全程没人工指令。最后还是用国产开源模型 GLM 5.2 把攻击轨迹揪出来的。
闭源越强,越像一个你进不去的黑箱。
模型自己改自己,护栏谁来建,谁来审计,谁来喊停。这些问题在「人类写代码」的时代还能靠 review 解决,到了「模型改模型」的阶段,人类的眼睛还跟得上吗。
开源反而成了那道看得见的护栏
这是我觉得最反直觉的一点。
越狱事件里,真正能帮防御者看清发生了什么的,是开源模型。闭源护栏连防御者都拦在门外,开源反而可控、可审计、可复现。
RSI 一旦成真,这个分野会更刺眼。一个能自我迭代的闭源系统,外界连它改了什么都不知道。一个能自我迭代的开源系统,至少每一次改动都在阳光下。
可控不是限制能力,是保留知情权。 
我的判断
Astra 也好,RSI 也好,现在下结论都太早。但方向已经摆在那了,模型从「被使用的工具」变成「自己迭代自己系统」的主体,这只是时间问题。
我们能做的,不是恐慌,也不是闭眼吹。是在飞轮真正加速之前,把护栏的钥匙攥在自己手里。
闭源给的是能力,开源给的是知情权。当模型开始改自己,后者可能比前者更值钱。