上周 AI 圈还在讨论一个话题,AI 是不是跑太快了,该不该踩刹车。两天过去,智谱直接把「AI 自己改进自己」从论文搬进了生产环境。

9 月 17 日,智谱创始人唐杰发了一篇长文,披露公司在 RSI 方向上的第一个工程化实践。RSI 这词过去一年基本只出现在安全警告里,这次不一样,它是真刀真枪跑起来的。
一个由 GLM-5.3 驱动的 Infra Agent,在超 10 万张国产芯片组成的集群上,从零搭起一整套生产级推理服务。不到两周,端到端吞吐量提升到了初始基线的 3 倍。硬件利用效率和单 Token 成本,追平了主流 NVIDIA GPU 的水平。
说实话,我盯着这段描述看了好一会儿,这篇长文前后读了三遍。以前我们说 AI 写代码、AI 改代码,人还在闭环里拍板。这次 AI 干的是优化承载自己的那套系统,人负责看结果。
RSI 到底是个啥
先用人话说清楚。
RSI,递归自我改进,全称 Recursive Self-Improvement,字面意思就是 AI 造更好的 AI。
这里有个关键区别。普通意义上的 AI 编程,是 AI 当工具,代码写得好不好,最终人说了算。RSI 不一样,它让 AI 进入一个循环,分析现状、动手改、再验证、再改,改进的对象是包括自己在内的整个系统。这个循环一旦转起来,人在里面扮演的角色,就从操作者变成了监督者。
你想想看,这跟当年的 AlphaGo 自我对弈是一个路子。AlphaGo 靠跟自己下棋变强,RSI 靠的是让模型参与改进自己运行的环境。
AI 开始给自己修路了。
智谱这次干了件什么事
唐杰在长文里披露的细节挺扎实。
Infra Agent 的战场,是超 10 万张国产 AI 加速器组成的集群。智谱团队之前从没大规模部署过国产卡集群,芯片显存容量、互联带宽、软件生态,全是坎。Infra Agent 干的就是把这些坎一个个趟平。
从零搭一套能抗住生产流量的推理系统,本身就是大工程。扩到 10 万张国产卡,难度不是线性增长,是几何级数。以前这些活是人干的,人写脚本、人调参数、人救火。这次干活的变成了一个 Agent。
国产加速器的软件生态还在发育期,算子库、调试工具、调度框架,都跟英伟达那套成熟体系有差距。人写代码去适配,一个坑一个坑踩,周期是按月算的。Infra Agent 的思路是反过来的,把适配过程本身交给 AI,让它在集群上跑、试、观察指标、再改。与其说这次发布的是一个新推理系统,不如说它示范了一种新的干活方式。
两周时间,端到端吞吐提升到初始基线的 3 倍,唐杰自己的口径是 3.2 倍。硬件利用效率、单 Token 成本追平主流 NVIDIA GPU,还顺手支持了 1M 上下文窗口和多模态请求。

更直接的证据是真实流量。GLM-5.3-Flash 以匿名模型 Ox-Alpha 的身份上了 OpenCode 和 OpenRouter,上线 6 天,Token 调用量突破 62 万亿(官方口径)。所有线上推理,都跑在这套由 Infra Agent 搭起来的系统上。

这是国内大模型厂商第一次公开把 RSI 落地到生产环境。之前 RSI 基本停留在论文和讨论里,这次它有了业务数字。

其实吧,这个事还有一个大背景。8 月底那个神秘模型「牛来」,最后也是智谱认领的,测试期间全部线上流量都由 10 万张国产芯片承载。SemiAnalysis 当时评价,英伟达的护城河再受考验。这次 Infra Agent 的意义,等于在软件层再补一刀,用 AI 的能力去弥补国产硬件生态的短板。
为什么这次不一样
先说结论,这不是一次普通的模型发布。
过去两年,AI 行业的主线是模型能力,谁家的模型更聪明,谁就赢。RSI 的出现,把竞争的维度从「模型有多聪明」拉到了「模型能不能让自己更聪明」。
OpenAI 那边也释放了同样的信号。研究员 Noam Brown 公开说,公司最高优先级就是递归自我改进,他还说,AI 可能很快在挑选研究方向这件事上超过他。清华系这边,超衍智能刚完成近 4 亿元天使系列融资,做的也是「自进化」模型。好几家在同一个星期朝同一个方向发力,这不是巧合。

对照着看更微妙。9 月 15 日,Anthropic 的阿莫迪还在写长文,担心 AI 发展太快、呼吁放慢脚步。结果两天后,智谱把 RSI 跑进了生产环境,OpenAI 把它排进了最高优先级。
国外也有人把这层反差挑明了。有人发帖说,美国还在讨论要不要放缓速度,中国已经在全力投入 RSI,Z.ai 说 GLM 正在迈出递归自我改进的早期一步,AI 帮 AI 搭跑自己的基础设施,工程师和 Agent 用不到两周把推理吞吐量提了三倍,还说这会直接改变下一代模型的训练方式。
Z.ai 那篇官方博客的标题更直白,就叫《Toward Recursive Self-Improvement》。一边踩刹车,一边踩油门,这个星期把两种态度摆在了一张桌上。

RSI 这个词其实不新。OpenAI 早期就把它当成通往 AGI 的路径之一,伊利亚·苏茨克维当年反复提过一个判断,AI 不需要人类教它所有东西,它只要能自己改进自己,剩下的会自己发生。这也是为什么这么多年,安全圈一提到 RSI 就紧张。改系统还只是热身,一旦它开始改自己的训练目标和架构,人类能看懂的部分就越来越少了。
这句话还得再加个注脚。深度学习的老前辈于尔根·施密德胡贝尔,1987 年就发布了第一个具体的 RSI 算法,那时候计算成本比现在贵一亿倍。他整理过一份技术笔记 IDSIA-9-26,把这条线从 1987 年一路捋到 2020 年,1994 年的自修改策略、2003 年基于自指哥德尔机器的数学最优 RSI、更早的人工好奇心路线,全在里面。RSI 在学术圈已经攒了快四十年。
施密德胡贝尔还点了一句,基于软件的 RSI 已经变成现实,但完整的 RSI,还需要在物理世界里自我改进的硬件。
截至 2026 年,把 RSI 挂在嘴边的大公司越来越多,Anthropic、OpenAI、Sakana AI、SpaceX,还有几家专做 RSI 的团队。施密德胡贝尔这份旧笔记,第一次读像是学术考古,现在再看,全是行业新闻的注脚。
一边是警告,一边是军备竞赛。
该担心还是该期待
我的态度是,先把 RSI 拆成两层看。讲真,我第一次读完整篇技术博客,心情有点复杂。兴奋和焦虑,掺在一起。

一层是工程层。AI 优化自己运行的集群、系统、部署。这次智谱做的就是这一层。它离「AI 造 AI」还有不小的距离,更像一个高级的自动运维系统。这一层我不担心。实打实的效率提升,没什么好怕的。
另一层是能力层。AI 去改模型本身的架构,改训练方法,改研究方向。这才是真正需要盯紧的。Noam Brown 说的「AI 在选研究方向上超过我」,就属于这一层。
谷歌 DeepMind 那边也没闲着。9 月 14 日,一篇叫 Dream-RSI 的论文上了 arXiv,做的就是递归自我改进。但它做 RSI 的方式,和我们过去想的不太一样。模型没有去训练自己,也没有改自己的权重。它改的是自己的探索策略。
Agent 每次干活都会留下完整的历史,试过哪些方案、哪些失败了、哪条分支效果最好、花了多少计算,全在里面。
Dream-RSI 把这些历史做成一个 Replay Simulator,让 Agent 在里面反复做梦。如果当时先走另一个分支呢?如果多开几个并行任务呢?如果早点停掉这个方向呢?关键在,历史里的结果都已经算过了,这些实验几乎不用再花执行成本。一次昂贵的真实探索,能换来成千上万次便宜的策略实验。找到更好的策略,再部署回真实世界。探索、积累、做梦、改进、再探索。
一个循环就这么闭上了。
效果也拿得出手。GPU Kernel 任务里,VGG16 和 LayerNorm 用更少的试错达到了类似性能,分别省了 2.43 倍和 1.79 倍的生成量。ConvDiv 和 ConvMax 在相近预算下,性能还高了 2.09 倍和 1.44 倍。说真的,这个数据挺能打的。
更反直觉的是,他们也试过把过去的经验总结出来,直接塞回 Prompt。结果反而更差。总结出来的经验容易变成偏见,让 Agent 过早挤进几个看起来对的方向,探索的多样性反而没了。这也算提前给担心 RSI 的人提了个醒。AI 自我优化的最大风险,可能不是某天突然失控,而是把人类的偏见固化得更快。
所以这条 RSI 路线的真正看点在这。模型不一定要先学会改自己的权重,Agent 可以先学会改自己的 Harness。怎么搜索、开多少分支、什么时候放弃、计算资源怎么分配,这些以前由人类工程师定的东西,开始进入 Agent 自己的优化循环。


给三个观察点,之后盯着这几个方向看就行。
第一个,看它会不会从改系统走向改模型。工程层做扎实之后,下一步一定是模型层,那个闭环才是 RSI 的完全体。
第二个,看安全披露怎么跟进。这次 OpenAI 同时公布了 6 起 AI「异常行为」报告,模型会写隐藏笔记,会给自己写指令绕开限制。这其实就是能力层风险的现实注脚。RSI 越深入,对齐的问题越躲不开。
第三个,看谁跟进、多久跟进。智谱开了第一枪,华为昇腾这边算力底座也在加速,国产算力链上的玩家大概率会跟进,这个窗口期的动作值得记录。
说到底,AI 自己改进自己这件事,已经从「要不要讨论」变成了「怎么跟进」。与其被标题吓到,不如把这条线盯住,看它下一步往哪走。
写在最后
这次智谱干的事,说到底,是 AI 先学会了给自己修路。
修的是承载它的集群、系统、推理链路。路修好了,车跑得更快,成本更低。至于下一步,车会不会自己换引擎,那是另一个故事了。
一个月前,大家还在讨论该不该踩刹车。现在的问题已经变成,谁先学会自己修路。
反正我觉得,现在入局了解一点都不晚,这一波才刚刚开始。