这场对谈最直接的收获,不是给出了「RSI是否可行」的二元答案,而是把模糊的争论拆解成了可操作的判断维度。
一、RSI的定义分歧与谱系
讨论开始前,三位研究者对「什么是递归自我改进」存在明显分歧。
最严格的定义来自理论计算机科学的传统:一个系统不仅能改进输出,还能改进自身的改进机制------自行提出假设、评估结果、修改方法,整个过程无需人类介入。按照这个标准,今天几乎所有AI系统都不达标。
宽松的解读则把标准降到「只要AI能帮助改进下一代AI的开发流程,就算某种程度的RSI」。这个定义下,RSI已经在发生了。
John Schulman在对话中明确指出,区分这两种定义不是为了玩文字游戏,而是为了判断风险等级和投入策略。如果把宽松定义当真,容易低估真正的风险;如果把严格定义当现实,又可能错过已经发生的过程积累。
更准确地说,RSI应该被看作一个连续谱。系统在谱上的位置,决定了我们该用什么标准去评估它、监管它、投资它。
\[reaction=detective-truth\|caption=定义不同,结论天差地别\]

##一、RSI的定义分歧与谱系讨
二、当前工程实践的RSI痕迹
即便在宽松定义下,RSI的痕迹也已经可见。
Charlie O'Neill在对话中提到的一个关键观察是:过去几年,大模型的训练数据生成、代码编写、甚至部分架构设计,已经开始依赖AI系统参与。Google的Switch Transformer团队在OpenAI成立之前,就尝试过用AI辅助训练万亿参数稀疏模型。
开源社区也有类似实践。如AREX这类递归自改进深度研究智能体,通过内层研究循环收集证据、外层自改进循环逐约束审计答案,在BrowseComp等基准上已显著超越同规模基线。
这背后有一个清晰的演进路径:人类定义目标 → AI生成方案 → 人类评估结果 → 人类调整目标。如果「人类调整目标」这一步逐渐被自动化,就完成了从辅助到递归的跨越。
目前这个阶段,用Beren Millidge的话说,是「AI已经在帮助制造AI,但人类仍牢牢掌握着方向盘。」

RSI演进连续谱

##二、当前工程实践的RSI痕迹
三、技术瓶颈的真正所在
对谈中最有价值的部分,是对瓶颈的精确描述。
首先是验证瓶颈。模型可以生成改进方案,但谁来验证改进是否有效?Anthropic在2026年5月发布的报告中指出,当前LLM尚无法可靠地进行自我修正推理,需要外部反馈才能完成可信的验证闭环。
其次是安全内核问题。如果一个系统能修改自身代码或提示,它可能会无意中(或有意识地)禁用安全防护机制。「不可解除的安全内核」是一个理论解法,但在完全自我修改的系统中实现锁定,技术上仍具挑战。
Charlie O'Neill提到的另一个关键点是算力分布。训练万亿参数模型已不再是秘密,真正的瓶颈从「能不能训」转向了「怎么训得有效」和「谁来控制训的方向」。

RSI三大瓶颈关系

##三、技术瓶颈的真正所在对谈中
四、从对话到可落地方案
对谈结束时,三位研究者达成的共识是:RSI不是「有没有」的问题,而是「到了哪一段」的问题。
对工程团队而言,可执行的判断框架如下:
在X条件下------如果你的系统已实现「AI生成方案、人类评估结果」的稳定闭环,下一步应优先投资自动化评估器的可靠性,而非急于让系统自我修改。这一阶段的迁移成本主要来自评估器的泛化能力,而非算力。
在Y条件下------如果你的评估环节已由强监督信号覆盖(如数学证明、代码测试),可以考虑引入有限范围的自改进循环,但仍需保留人工 veto 权限。
在Z条件下------如果目标是完全自主的RSI系统,当前的验证瓶颈和安全风险意味着这一路径应被视为高风险实验,而非生产级方案。
坦白讲,这场对谈没有给出乐观或悲观的简单结论,而是给出了一个更实用的问题:你的系统现在在连续谱的哪个位置,下一步最该投什么资源。
\[reaction=assigned-order\|caption=结论不浪漫,但好执行\]
Dwarkesh Patel 约了三位真正在做模型训练的人------Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill------聊递归自我改进(RSI)。这场对谈最耐人寻味的地方,不是他们达成共识的部分,而是他们在同一个话题上各自卡在哪一道技术门禁前。

##四、从对话到可落地方案对谈结
验证瓶颈:Anthropic 的负面结果为何关键
Anthropic 在 2026 年 5 月发布的研究指出,大型语言模型尚无法可靠地自我纠正推理。这项研究的直接含义是:即使一个模型生成的答案看起来合理,也没有内部机制能保证它是正确的。验证必须由外部系统完成。
这意味着什么?如果 RSI 的核心逻辑是「模型自我改进→改进后的模型继续自我改进」,那么每一步改进都需要被验证。而验证本身不能依赖模型自己判断------那会形成循环论证。

RSI 闭环中的验证门禁
这条路径里最关键的节点是 B。B 的质量决定了整个循环是否会收敛,还是无限发散。

##验证瓶颈:Anthropic
从对话中提取的三种 RSI 谱系位置
Schulman 的立场更接近一种「对齐先于递归」的判断。他在对谈中多次强调,当前模型在复杂推理任务上仍需要人类监督回路,真正的递归改进必须以可靠的对齐机制为前提。这不是谨慎,而是一个工程现实的表述------如果模型改进了效率但偏离了对齐目标,那个改进是有毒的。
Millidge 来自 Zyphra 这样的开源模型团队,他的视角更偏向渐进路径。开源社区的迭代节奏本身就带有一种分布式的自我改进特征:代码审查、issue 修复、fine-tune 变体竞争------这些都是 RSI 的弱形式。他并不否认严格定义下的 RSI 尚未到来,但他认为我们正在以多路径并行的方式积累必要的组件。
O'Neill 在 Baseten 负责模型训练的工程落地,他的贡献在于给出了一个常被忽略的事实:万亿参数模型并非 recent discovery。Switch Transformer 早已证明规模扩展在工程上是可行的,当前真正制约的不是训练能力,而是每次迭代后如何确认「这次改进是真实的」。

三种 RSI 路径的对比
当前状态:人类主导验证
开源社区迭代、工具辅助
end note note right of StrongerRSI Schulman 路径:对齐加固后推进 Millidge 路径:渐进开放模型迭代 end note note right of TrueRecursive O'Neill 关注点:工程缩放已就绪 核心卡在验证质量 end note

##从对话中提取的三种RSI谱系
真问题不在算力而在可验证性
对谈中有一个反复出现的主题:规模不再是瓶颈,判断才是。
Charlie O'Neill 提到,训练万亿参数模型已经是数年前的工程实践,Falcon 等开源项目已经验证了这一点。Switch Transformer 在 Google 时期就完成了类似规模的探索。真正稀缺的资源不是 GPU 集群,而是能够可靠判断「这个改进是否真实有效」的评估体系。
这个问题可以拆解成两个层面。第一层是 benchmark 污染:当模型在训练数据中见过测试题,或者评测方法本身成为优化目标,提升的数字就不再有诊断价值。第二层是验证器自身的可靠性:如果用来评估改进质量的系统也是 AI,那就需要更高层的验证器来评估这个验证器------这就是著名的无穷倒退问题。
Anthropic 的结论指出,目前的外部反馈仍然是必要组件。这意味着,至少在可预见的时间内,RSI 不会以完全自主闭环的形式出现,而是以人类监督 + AI 加速混合模式推进。
下一步的行动优先级
回到工程实践,对团队而言有三件可以立刻推进的事:
第一,建立可审计的改进记录。每一次模型版本的变更,都应附带对照实验、评估指标变化和改进动机说明。这不是学术规范,而是为了让下一次迭代有可追溯的证据链。
第二,区分弱 RSI 和强 RSI 的应用场景。弱 RSI------即 AI 辅助人类进行下一次迭代的规划和执行------是当前可落地的;强 RSI------AI 自主完成改进闭环------需要等待验证器可靠性的实质性突破。不要在尚未具备条件时误判阶段。
第三,关注评估器本身的健壮性,而非仅关注模型性能数字。在递归改进的语境下,评估器就是系统的免疫系统。一个被绕过的评估器比没有评估器更危险------它会给出改进的假信号,让系统沿着错误的方向加速。

递归自我改进的进展判断框架

评估器可靠性才是真门禁
三位研究者对谈的最大价值,不在于他们预测了 RSI 何时到来,而在于他们指出了当前工程实践中的真实瓶颈位置。规模已经足够,验证还没跟上。这个判断本身,就是最有用的行动信号。
从对话到可落地方案:三种工程取舍
三位研究者的对谈有一个贯穿始终的底层共识:递归自我改进不是开关事件,而是一条需要持续投入的工程曲线。真正值得讨论的不是「RSI 何时到来」,而是「在哪个阶段用哪种机制,能获得怎样的收益,代价是什么」。基于此,可以从对话中提炼出三种可以在当前工作流中落地的工程取舍。
取舍一:以评估器替代人类作为递归核心
RSI 最直接的工程化形式,是把人类反馈替换为自动化评估。Charlie O'Neill 在对话中指出,Anthropic 近期关于 LLM 自我纠错能力的负面结果是关键分水岭:模型在没有可靠外部反馈时,无法稳定地区分「改进」与「看似合理但错误的输出」。这一结论直接决定了递归系统的架构选择。
如果评估器本身不可靠,递归回路就会收敛到次优甚至退化方向。解决方案的思路很明确:在关键决策节点保留一个经过严格验证的评估器作为仲裁者,让模型只在评估器认可的子空间内迭代。这与 RLHF 的基本逻辑一脉相承------区别在于,RLHF 的奖励模型由人类标注训练,而递归场景下的奖励模型需要能覆盖代码、数学推理、系统配置等多模态信号。
这意味着工程团队必须回答一个问题:你的评估器在哪些维度上是确定性的?在哪些维度上只是「看起来不错」?前者适合直接嵌入递归回路,后者必须保留人工抽检。

RSI 递归回路的评估层级
\[reaction=detective-truth\|caption=评估器才是真正的裁判\]
取舍二:把 RSI 看作压缩,而非爆炸
对话中最被低估的洞察,是 John Schulman 关于「压缩」而非「爆炸」的框架。RSI 不需要产生智能无限上升的指数曲线才值得重视。如果把五年的研发周期压缩到两年,或者把某个特定领域的迭代速度提升三倍,这在战略意义上已经足够构成竞争壁垒。
这种视角的转变直接影响资源分配。追求「智能爆炸」需要构建完整的自主研究循环,投入巨大且风险不可控;而追求「周期压缩」可以在现有 CI/CD 和模型训练管道上叠加一层自动化改进机制,成本可控且效果可度量。
目前业内一些团队的实践已经印证了这一路径:比如用 AI 辅助生成训练数据、自动进行超参搜索、用模型生成的代码替换部分人工编写的基础设施脚本。这些都不构成严格的 RSI,但它们构成了 RSI 的充分条件------只要你持续积累自动化改进的经验,递归回路会在某个时刻自行闭合。
取舍三:在现有架构上嵌入最小递归回路
Beren Millidge 的观点是务实的:不要从头构建一个完整的自主研究系统,而是在现有模型训练中嵌入最小的递归改进环节。具体做法是:在每次模型迭代后,用当前模型分析自身失败案例,生成改进建议,再由人工或轻量级评估器决定是否采纳。
这个「最小递归回路」的核心特征是:反馈延迟短、人工干预成本低、改进方向可追溯。它不是全自动的 RSI,但它是一个可以逐步扩展的起点。

最小递归回路架构
\[reaction=code-review-pain\|caption=每一步改进都留下可追溯的记录\]
决策路径与落地 checklist
从对话中提取的三种取舍,对应不同的团队成熟度和目标函数。以下是一个简明的决策矩阵,帮助工程团队根据自身情况选择合适的切入路径。
| 团队状态 | 推荐路径 | 关键前置条件 | 预期回报周期 |
|---|---|---|---|
| 已有成熟训练管道 | 最小递归回路 | 失败案例已结构化记录 | 3--6 个月可见指标改善 |
| 有独立评估团队 | 评估器主导的递归 | 评估器在核心维度上准确率>90% | 6--12 个月 |
| 资源充足、风险承受能力强 | 自主研究循环 | 有专门的RL/安全研究团队 | 12 个月以上 |
落地之前的 checklist,按优先级排列:
- 失败案例库是否已经结构化? 这是递归改进的数据基础。如果失败案例只存在于日志中、未经清洗和分类,递归回路无从启动。
- 评估器在哪些维度上已经过严格验证? 区分确定性评估和启发式评估,前者可自动化,后者需人工介入。
- 人工干预的边际成本是多少? 如果每次迭代都需要大量人工参与,递归回路就无法规模化。
- 改进效果的度量标准是否清晰? 必须有一个可量化的指标来区分「真正的改进」和「过拟合了评估器」。
\[reaction=assigned-order\|caption=先回答这四个问题,再决定走哪条路\]
从这段对话可以看出,RSI 的真正挑战不在算力、不在算法架构、也不在模型规模,而在于可验证性。我们还没有一个能在所有关键维度上都可靠的自动化评估器,这就决定了任何递归改进的尝试都必须保留人工干预的出口。
对于工程团队而言,最值得投入的方向不是追逐「自主智能体」的概念,而是把现有训练管道的每一个可自动化环节逐一强化------从失败案例的结构化,到评估器的精度提升,再到人工决策的成本压缩。这三件事每一项都有清晰的度量标准和渐进式推进路径,不需要赌奇点,也不需要等通用智能体成熟。
RSI 不会在某一天突然降临。它更像是一系列工程决策的累积结果,每个决策的边界在哪里、代价是什么、何时切换路径,才是真正值得团队投入精力的地方。
上一段讲清了 RSI 的谱系位置和验证瓶颈,这段把重点从「是什么」转向「怎么做」。三位研究者反复提到一个事实:真正的 RSI 尚未出现,但工程上已经有足够的组件可以组装出一个最小递归回路。关键不在于等一个完整的系统,而在于决定从哪个点切入。
参考文献
- Dwarkesh Patel 对谈录音及笔记:www.dwarkesh.com/p/john-bere...
- Anthropic. Recursive self-improvement. Anthropic Institute blog post, 2026. www.anthropic.com/research
- AREX: 面向深度研究的递归自改进智能体,HuggingFace Daily Papers, 2026.
- John Schulman 等. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
- Charlie O'Neill. Baseten 模型训练实践分享(内部),2025-2026.
- Beren Millidge. Zyphra 开源模型训练经验纪要,2026.