深度拆解:150M循环模型如何用循环推理击败大Transformer

150M参数,29.5% ARC-AGI-1 pass@2,每次推理成本$0.0007------不到一美分的十分之一。这不是"小模型也可以很强"的励志故事。这是对整个AI行业"参数规模=推理能力"假设的系统性挑战。BDH-CQ用一套全新的架构证明:推理能力不一定要靠更多参数,可以靠更多计算步骤------而且这些步骤不需要输出任何中间token。

上图:BDH-CQ的双循环系统------循环记忆处理上下文学习,循环潜在推理空间执行迭代推理,两者协作完成从示例到答案的全过程
一、核心矛盾:参数量 vs 计算深度
1.1 标准Transformer的囚徒困境
标准Transformer的推理是一次性前向传播:输入token序列 → 嵌入 → N层注意力计算 → 输出答案。推理能力与参数量直接挂钩:
推理能力 ∝ 参数量 × 输入长度
要提升推理能力?加参数。GPT-4有万亿级参数,o1有大推理模型------整个行业都在走"大参数"路线。但这是一条成本不归路:参数越大,推理越慢、显存越大、部署越难、成本越高。
更关键的是,CoT(Chain-of-Thought)推理进一步加剧了成本问题:每一步中间推理都需要前向传播 → softmax采样 → 重新编码------三个操作循环执行,token消耗巨大。
1.2 BDH-CQ的核心洞察
BDH-CQ提出了一条完全不同的路线:
推理不是通过更多参数,而是通过更多计算步骤------而且这些步骤在连续隐空间中执行,不产生任何中间token。
这意味着计算深度与参数规模被解耦了。同一组150M参数可以被反复使用,每次循环都是一轮推理,而不需要增加任何额外参数。
1.3 生物学启示
人类大脑有约100万亿突触------但不是每次思考都激活全部。大脑通过循环回路(皮层-丘脑环路)反复处理信息,每次循环使用同一组神经元。认知科学的研究也表明,人类的语言系统和概念推理系统部分独立运作。
BDH-CQ的设计受到类似启发:不是模仿大脑,而是提取大脑"走对路"的原则------局部交互、稀疏激活、持久状态、持续调整------然后应用到一个现代序列模型上。
二、BDH架构:不是Transformer的替代品
2.1 Dragon Hatchling(BDH)架构族
BDH-CQ建立在BDH(Dragon Hatchling)架构之上------这不是Transformer的变体,而是一个后Transformer序列模型架构。其核心设计要素:
| 组件 | 设计 | 作用 |
|---|---|---|
| 高维正激活 | ReLU驱动的稀疏激活 | 大特征空间中的局部交互 |
| 低秩通信 | 低秩矩阵连接层 | 跨位置信息传递的压缩通道 |
| 循环关联状态 | 持久化的状态记忆 | 避免增长的KV缓存 |
| 线性注意力 | 线性复杂度注意力 | 高效的上下文关联 |
BDH层将ReLU低秩变换与线性注意力结合在一个大神经元/特征空间中。这个设计是"脑启发但非脑模仿"------提取生物计算的关键原则,而非复制神经机制。
2.2 从BDH到BDH-CQ
BDH架构本身已支持循环约束满足系统------研究团队此前已用它构建了数独求解器,通过迭代优化视觉状态直到满足约束。BDH-CQ将这条路线扩展到了推理领域:
-
BDH:架构家族,支持语言建模和序列建模
-
BDH-CQ:在BDH上构建的推理系统,结合结构化隐空间和循环计算
-
完整系统:还包括输入变换、候选构建、排序和推理流水线
BDH架构(基础)
↓ 添加循环记忆 + 隐空间推理
BDH-CQ系统(推理)
↓ 添加候选生成 + 排序 + 流水线
完整评估系统(端到端)
三、双循环系统:记忆与推理的分离

上图:BDH-CQ的双循环协作------循环记忆从示例中学习规则,循环推理在隐空间中迭代求解,两者通过不同的状态空间独立运作
3.1 循环记忆:从示例中学习
BDH-CQ的第一个核心是循环记忆(Recurrent Memory),负责上下文学习。
给定一个任务的K个示例和一个查询输入,BDH-CQ不将示例压缩为单一向量,而是顺序处理每个示例,让记忆逐步演化:
S_t = U_θ(S_{t-1}, D_t)
其中:
S_t:第t步的循环上下文状态D_t:第t个示例的内容U_θ:固定参数的状态更新函数θ:模型参数(在推理时不更新)
这个循环上下文状态的作用类似于注意力机制构建的上下文关联,但有一个关键优势:避免了不断增长的显式KV缓存。它与快速权重记忆和线性注意力有概念上的关联,线性注意力是其最简化的特例。
3.2 循环潜在推理:在隐空间中"思考"
BDH-CQ的第二个核心是循环潜在推理(Recurrent Latent Reasoning, RLR)。示例和查询被摄入后,模型进入隐空间的迭代推理阶段:
H_r = f_θ(H_{r-1}) # 循环更新隐状态
# 不产生任何token
# 不输出任何中间结果
直到收敛 → 输出层 → 解码答案
关键区别在于:循环记忆S_t负责"学习任务是什么",循环推理H_r负责"计算答案是什么"。两者有不同的概念角色,使用不同的状态空间。
3.3 为什么分离记忆与推理?
这个设计回应了一个深层次的问题:上下文学习和推理计算是否应该共享同一个状态空间?
标准Transformer将两者混合在同一个注意力机制中------KV缓存既存储上下文信息,也参与推理计算。BDH-CQ将它们分离:
| 维度 | 循环记忆 S_t | 循环推理 H_r |
|---|---|---|
| 职责 | 从示例中学习规则 | 在隐空间中迭代求解 |
| 更新方式 | 随示例顺序演化 | 随推理步骤迭代 |
| 概念角色 | 类似注意力上下文 | 类似工作记忆 |
| 状态空间 | 关联状态空间 | 结构化多向量工作空间 |
这种分离使得系统可以在不干扰已学规则的前提下,进行深度推理计算。
四、循环潜在推理(RLR)vs 思维链(CoT)
4.1 三种推理范式
标准推理: 输入 → [0步思考] → 输出
CoT推理: 输入 → [输出N个思考token] → 输出
RLR推理: 输入 → [隐空间循环R次, 0 token] → 输出
4.2 CoT的计算瓶颈
CoT的每个中间token需要三个操作:
- 前向传播:计算下一个token的分布
- 解码:通过softmax采样生成token
- 重新编码:将token作为下一轮输入重新嵌入
每个操作都有计算开销,而且步骤2和3引入了信息瓶颈------连续的隐状态必须通过离散的token词汇表"序列化"再"反序列化"。
4.3 RLR的效率优势
RLR直接传递隐状态,跳过了解码和重新编码:
CoT:h → token → h' → token → h'' ... (每步3个操作)
RLR:h → h' → h'' ... (每步1个操作)
更深层优势在于:一个连续隐状态可以同时携带多个活跃假设。理论研究表明,对于有向图可达性问题,连续思考可以编码多个搜索前沿并同时扩展------这在token级别的序列推理中几乎不可能实现。
4.4 可解释性代价
RLR的代价是可解释性。CoT的中间token至少提供了可审查的推理链------虽然不总是可靠,但至少可见。RLR的中间隐状态是高维连续向量,人类无法直接解读。
这引出了一个设计选择:未来系统可能需要混合模式------在需要通信、验证或工具调用时输出语言token,在需要深度推理时使用隐空间循环。论文指出,BDH层同时支持语言建模和隐推理,因此未来系统可以在同一循环架构中结合两种模式。
五、ARC-AGI-1评测:29.5%意味着什么

上图:ARC-AGI-1成本-精度帕累托前沿------BDH-CQ以$0.0007/task的成本突破此前所有系统建立的成本-精度边界
5.1 ARC-AGI-1是什么
ARC-AGI(Abstraction and Reasoning Corpus)是François Chollet设计的推理基准,专门测试技能获取效率:
- 每个任务通过2-5个示例指定一个全新的变换规则
- 系统必须从示例中推断出规则并应用到新输入
- 每个任务都是新的------无法通过记忆解决
- 要求精确输出------不是生成相似文本,而是精确的网格变换
ARC-AGI-1的评估使用pass@2指标:系统可以提交两个候选答案,只要有一个正确即得分。
5.2 BDH-CQ的评测结果
| 指标 | 数值 | 说明 |
|---|---|---|
| pass@2 | 29.5% | 400个公开评测任务中解决118个 |
| pass@1 | 24.25% | 单候选答案的正确率 |
| 测试对精度 | 31.03% | 419个测试对中解决130个 |
| 每任务成本 | $0.00070 | 0.85 H200 GPU秒 |
| 每任务成本对比 | 57倍更便宜 | 对比GPT 5.6 Luna (Low)的$0.040/34.2% |
关键点:BDH-CQ以$0.0007/task的成本突破此前的成本-精度帕累托前沿------此前没有任何系统在同等或更低成本下达到29.5%以上的精度。
5.3 成本对比
考虑OpenAI在2026年7月30日对GPT 5.6 Luna公开API价格降低80%后,BDH-CQ仍然比GPT 5.6 Luna便宜约11倍。这还是在BDH-CQ只有150M参数的情况下。
5.4 独立验证
论文的一个亮点是独立黑盒审计。来自Bielik AI和纽约大学的共同作者对部署的推理服务进行了独立评估,在ARC-AGI-1和ConceptARC上复现了报告结果。这不是团队自评,而是第三方验证。
六、ConceptARC:能力画像
6.1 16个概念族的表现
ConceptARC将ARC任务组织为16个概念族,每个族10个任务30个测试对。这提供了比单一分数更细粒度的能力画像:
| 概念族 | pass@2 | 概念族 | pass@2 | |
|---|---|---|---|---|
| 填充/非填充 | 9/10 | 内外 | 4/10 | |
| 上下2D | 9/10 | 同/异 | 4/10 | |
| 扩展到边界 | 9/10 | 复制 | 2/10 | |
| 清理 | 8/10 | 排序 | 2/10 | |
| 水平/垂直 | 7/10 | 总计 | 96/160 | |
| 上下3D | 7/10 | 60.00% | ||
| 提取对象 | 6/10 | |||
| 中心 | 7/10 |
关键发现:简单空间变换(填充、边界扩展)表现优异(8-9/10),而需要序列构建的操作(排序、复制)表现最差(2/10)。
6.2 任务内一致性问题
在ConceptARC上,测试对精度(77.92%)远高于严格任务精度(59.38%)。这意味着系统在很多任务上能解决部分测试对,但无法在任务的所有输入上一致地应用推断出的规则:
- 0个测试对正确:13个任务
- 1个测试对正确:15个任务
- 2个测试对正确:37个任务
- 3个测试对全正确:95个任务
52/160个任务有部分成功但未完全解决------这表明系统在某些输入上正确推断并应用了规则,但在同一任务的其他输入上未能一致地执行。
6.3 标识符和批处理消融
一个关键担忧:系统是否利用了语义任务标识符或概念分组来"作弊"?消融实验给出了否定答案:
- 语义ID执行:95/160任务,374/480测试对
不透明ID执行:96/160任务,374/480测试对
聚合表现几乎没有变化。在配对测试对结果中,恰好6个仅语义ID成功,6个仅不透明ID成功------没有任何方向性差异。系统确实是从网格内容中学习,而非利用元数据捷径。
七、控制实验:泛化边界在哪里
7.1 四个泛化族
研究团队在冻结模型后构造了全新的ARC-like任务,系统地测试四个维度的泛化:
传播到边界(距离2-8):
- 训练示例展示距离1-3的传播
- 泛化结果:48/48正确------完美外推到距离8
- 结论:传播操作完全可泛化
复制到锚点(1-4个目标):
- 训练示例展示1-2个复制
- 泛化结果:48/48正确------完美外推到4个
- 结论:复制操作完全可泛化
排序(序列长度2-8):
- 训练示例展示长度2-4
- 泛化结果:5以下饱和,6时29/36,7时8/24,8时1/24
- 结论:存在执行瓶颈,非外推瓶颈
嵌套(深度1-5):
- 训练示例展示深度1-3
- 泛化结果:4以下饱和,5时29/36
- 结论:外推瓶颈,非执行瓶颈
7.2 失败模式的差异
排序和嵌套的失败有不同的特征:
- 排序长度8:只有3/24个输出有正确的维度------整体构建失败
- 嵌套深度5:全部36个输出都有正确维度,平均单元格精度>99.9%------仅在单个包含关系决策上出错
排序失败是结构性的(整个输出崩塌),嵌套失败是局部性的(结构正确但个别关系错误)。
7.3 上下文支持恢复
当在测试复杂度处添加一个示例("支持"上下文)时:
| 失败模式 | 短上下文 | 支持上下文 | 恢复 |
|---|---|---|---|
| 排序长度8 | 0/24 | 13/24 | +13 |
| 嵌套深度5 | 19/24 | 24/24 | +5 |
嵌套的瓶颈主要是外推能力(加一个示例就能完全恢复),排序的瓶颈既包含外推也包含执行能力(加示例也无法完全恢复)。
7.4 操作组合
测试单一操作与组合操作的能力:
| 操作 | 单独 | 与重定位组合 |
|---|---|---|
| 重定位 | 72/72 | --- |
| 旋转 | 72/72 | 72/72 |
| 反射 | 72/72 | 47/72 |
| 颜色交换 | 26/72 | 0/72 |
旋转与重定位完美组合,反射在大部分情况可组合,颜色交换在单独执行时就困难,组合时完全失败。这说明操作的组合能力高度依赖于具体操作类型。
八、推理努力缩放
8.1 三档推理深度
BDH-CQ支持在推理时调整循环深度------类似人类面对简单问题快速作答,复杂问题反复思考:
| 推理努力 | pass@2 | 成本削减 |
|---|---|---|
| HIGH | 29.5% | 0%(基准) |
| MEDIUM | 27.0% | 11% |
| LOW | 21.0% | 22% |
从LOW到HIGH,精度从21%提升到29.5%(+8.5个百分点),成本增加约28%。这验证了计算深度是一个可调节的推理缩放轴。
8.2 重复性
重复相同请求在两个努力级别上都产生了字节级完全一致的输出------标准重复运行匹配了全部419个测试输入。这不是随机采样,而是确定性的迭代计算。
8.3 努力级别的实际含义
MIN设置(最低努力)的成本为0.000884/task,标准设置为0.002652/task------但标准设置在400个任务中多解决了7个(118 vs 111)。在配对比较中,105个任务被两种设置都解决,13个仅标准解决,6个仅MIN解决------统计上未解决(McNemar p=0.167)。
九、训练数据与方法
9.1 训练数据组成
150M参数模型在一个精心策划的ARC风格数据集合上训练,结合了:
- ARC-AGI-1训练集:官方公开训练数据
- RE-ARC:程序化生成的示例增强
- ConceptARC:按概念组织的任务集
- ARC-Heavy:高难度任务集
- ARC-GEN100K:10万规模的生成任务
- 额外数据增强以提高训练数据多样性
9.2 训练目标
训练目标是让系统在先前示例被纳入循环上下文后,预测精确的目标网格。系统在训练时使用不同的推理努力级别,推理时可以选择不同的推理深度。
9.3 无任务特定优化
BDH-CQ与HRM和TRM等方法的一个关键区别:不需要对未见过的任务进行反向传播适应。任务信息通过上下文写入循环记忆,隐计算应用它------无需任务特定的优化。HRM和TRM在ARC上的成本分别为1.48/task和1.76/task,反映了它们将任务特定优化与推理耦合的代价。
十、与连续思考方法的关系
10.1 Coconut:连续思考的先驱
Coconut将Transformer的前一层隐状态作为下一轮输入嵌入反馈,通过课程学习逐步用连续思考替代语言CoT步骤。它证明了连续隐状态反馈可以在自回归语言模型中工作,并且一个状态可以保持多个候选续接。
BDH-CQ探索了不同的运行模式:示例更新循环任务记忆,结构化多向量工作空间解决未见过的视觉变换。
10.2 循环深度模型
循环深度语言模型反复将共享块应用于序列级隐状态,可以通过增加迭代次数改善某些推理基准。循环Transformer提供了理论和实证证据:许多迭代问题不需要每层都有不同参数的有效深度。
BDH-CQ与这些工作的区别在于:它关注的是依赖于示例的学习和视觉变换的表达,而非参数高效的架构设计或测试时计算缩放。
10.3 抽象CoT
Abstract-CoT用学习的保留词汇表替换语言推理链,报告推理token减少最多11.6倍。它位于非语言推理频谱的离散端------压缩且抽象,但仍然串行且需要外部解码。BDH-CQ的RLR完全在连续空间中操作,不需要任何中间解码。
十一、架构扩展潜力
11.1 模型规模缩放
BDH-CQ架构自然扩展到更大的模型规模,继承了BDH架构的张量分片模式,使其在1T规模下特别容易训练。早期实验确认Transformer类缩放定律在1B到600B参数的预训练中适用,同时保留了BDH-CQ特有的隐推理能力。
11.2 未来方向
论文概述了几个扩展方向:
| 方向 | 潜力 |
|---|---|
| 模型缩放 | 150M → 1T+,缩放定律已验证 |
| 更长训练 | 更长时间的数据曝光 |
| 语言推理 | 文本示例驱动学习 |
| 数学推理 | 符号验证和证明 |
| 约束满足 | 数独等长期隐优化 |
| 更难ARC任务 | ARC-AGI-2级别 |
| 混合推理 | 隐计算 + 语言token按需切换 |
11.3 混合推理的愿景
最终愿景是一个混合推理系统:在需要高效计算时使用隐空间循环(零token消耗),在需要通信、验证或工具调用时输出语言token。BDH层同时支持语言建模和隐推理,使这种混合成为可能。
这与认知科学的发现一致:人类的语言系统和非语言推理系统部分独立运作------不需要假设模型复现了对应的生物机制,但可以借鉴这种功能分离的设计思路。
十二、局限性与开放问题
| 局限 | 分析 |
|---|---|
| 生成能力 | 当前是纯推理系统,不生成自然语言 |
| 可解释性 | 中间隐状态无法人类解读 |
| 排序瓶颈 | 序列长度>5时执行能力急剧下降 |
| 颜色交换 | 最难获取的操作,组合时完全失败 |
| 通用性 | 仅在ARC-AGI-1验证,通用语言能力未测试 |
| 训练细节 | 确切更新规则和维度保持专有 |
关键开放问题
- 循环记忆能否从文本示例中学习? 当前系统在视觉网格上验证,文本示例驱动学习是否可行?
- 隐推理能否与语言生成无缝结合? 混合模式的技术实现路径是什么?
- 排序瓶颈的根源是什么? 是工作记忆容量限制还是迭代精度的上限?
- 颜色交换为什么特别难? 固定颜色布局使交换更容易------这是否暗示系统对颜色-语义绑定有特殊困难?
十三、影响分析
对AI行业意味着什么
BDH-CQ的29.5%结果如果可泛化到其他推理领域,将动摇"参数规模=推理能力"的基本假设:
- 小团队也能竞争:150M参数可以单GPU训练,不需要万卡集群
- 推理成本崩塌:$0.0007/task vs CoT大量token消耗
- 架构多样化:不再是Transformer一统天下
- 推理缩放新维度:不增加参数,增加循环深度也能提升精度
更大图景
当行业发现增加参数的边际收益递减时,BDH-CQ提供了另一条路:计算深度作为独立的推理缩放轴。如果未来AI芯片不是追求更大的芯片面积,而是追求更深的计算流水线------同一组计算单元反复使用------BDH-CQ可能就是那个起点。
更重要的是,BDH-CQ证明了隐空间推理和上下文学习可以共存于一个紧凑的实用系统。这为下一代AI架构提供了一个新的设计空间:不再是在"大参数"和"小参数"之间选择,而是在"参数规模"、"计算深度"和"上下文学习"三个维度上自由组合。
参数量不是AI能力的唯一尺度------计算深度、上下文学习和推理效率,可能是更好的尺度。