深度拆解:150M循环模型如何用循环推理击败大Transformer

深度拆解:150M循环模型如何用循环推理击败大Transformer

150M参数,29.5% ARC-AGI-1 pass@2,每次推理成本$0.0007------不到一美分的十分之一。这不是"小模型也可以很强"的励志故事。这是对整个AI行业"参数规模=推理能力"假设的系统性挑战。BDH-CQ用一套全新的架构证明:推理能力不一定要靠更多参数,可以靠更多计算步骤------而且这些步骤不需要输出任何中间token。

上图:BDH-CQ的双循环系统------循环记忆处理上下文学习,循环潜在推理空间执行迭代推理,两者协作完成从示例到答案的全过程


一、核心矛盾:参数量 vs 计算深度

1.1 标准Transformer的囚徒困境

标准Transformer的推理是一次性前向传播:输入token序列 → 嵌入 → N层注意力计算 → 输出答案。推理能力与参数量直接挂钩:

复制代码
推理能力 ∝ 参数量 × 输入长度

要提升推理能力?加参数。GPT-4有万亿级参数,o1有大推理模型------整个行业都在走"大参数"路线。但这是一条成本不归路:参数越大,推理越慢、显存越大、部署越难、成本越高。

更关键的是,CoT(Chain-of-Thought)推理进一步加剧了成本问题:每一步中间推理都需要前向传播 → softmax采样 → 重新编码------三个操作循环执行,token消耗巨大。

1.2 BDH-CQ的核心洞察

BDH-CQ提出了一条完全不同的路线:

推理不是通过更多参数,而是通过更多计算步骤------而且这些步骤在连续隐空间中执行,不产生任何中间token。

这意味着计算深度与参数规模被解耦了。同一组150M参数可以被反复使用,每次循环都是一轮推理,而不需要增加任何额外参数。

1.3 生物学启示

人类大脑有约100万亿突触------但不是每次思考都激活全部。大脑通过循环回路(皮层-丘脑环路)反复处理信息,每次循环使用同一组神经元。认知科学的研究也表明,人类的语言系统和概念推理系统部分独立运作。

BDH-CQ的设计受到类似启发:不是模仿大脑,而是提取大脑"走对路"的原则------局部交互、稀疏激活、持久状态、持续调整------然后应用到一个现代序列模型上。


二、BDH架构:不是Transformer的替代品

2.1 Dragon Hatchling(BDH)架构族

BDH-CQ建立在BDH(Dragon Hatchling)架构之上------这不是Transformer的变体,而是一个后Transformer序列模型架构。其核心设计要素:

组件 设计 作用
高维正激活 ReLU驱动的稀疏激活 大特征空间中的局部交互
低秩通信 低秩矩阵连接层 跨位置信息传递的压缩通道
循环关联状态 持久化的状态记忆 避免增长的KV缓存
线性注意力 线性复杂度注意力 高效的上下文关联

BDH层将ReLU低秩变换与线性注意力结合在一个大神经元/特征空间中。这个设计是"脑启发但非脑模仿"------提取生物计算的关键原则,而非复制神经机制。

2.2 从BDH到BDH-CQ

BDH架构本身已支持循环约束满足系统------研究团队此前已用它构建了数独求解器,通过迭代优化视觉状态直到满足约束。BDH-CQ将这条路线扩展到了推理领域:

  • BDH:架构家族,支持语言建模和序列建模

  • BDH-CQ:在BDH上构建的推理系统,结合结构化隐空间和循环计算

  • 完整系统:还包括输入变换、候选构建、排序和推理流水线

    BDH架构(基础)
    ↓ 添加循环记忆 + 隐空间推理
    BDH-CQ系统(推理)
    ↓ 添加候选生成 + 排序 + 流水线
    完整评估系统(端到端)


三、双循环系统:记忆与推理的分离

上图:BDH-CQ的双循环协作------循环记忆从示例中学习规则,循环推理在隐空间中迭代求解,两者通过不同的状态空间独立运作

3.1 循环记忆:从示例中学习

BDH-CQ的第一个核心是循环记忆(Recurrent Memory),负责上下文学习。

给定一个任务的K个示例和一个查询输入,BDH-CQ不将示例压缩为单一向量,而是顺序处理每个示例,让记忆逐步演化:

复制代码
S_t = U_θ(S_{t-1}, D_t)

其中:

  • S_t:第t步的循环上下文状态
  • D_t:第t个示例的内容
  • U_θ:固定参数的状态更新函数
  • θ:模型参数(在推理时不更新)

这个循环上下文状态的作用类似于注意力机制构建的上下文关联,但有一个关键优势:避免了不断增长的显式KV缓存。它与快速权重记忆和线性注意力有概念上的关联,线性注意力是其最简化的特例。

3.2 循环潜在推理:在隐空间中"思考"

BDH-CQ的第二个核心是循环潜在推理(Recurrent Latent Reasoning, RLR)。示例和查询被摄入后,模型进入隐空间的迭代推理阶段:

复制代码
H_r = f_θ(H_{r-1})    # 循环更新隐状态
                    # 不产生任何token
                    # 不输出任何中间结果
直到收敛 → 输出层 → 解码答案

关键区别在于:循环记忆S_t负责"学习任务是什么",循环推理H_r负责"计算答案是什么"。两者有不同的概念角色,使用不同的状态空间。

3.3 为什么分离记忆与推理?

这个设计回应了一个深层次的问题:上下文学习和推理计算是否应该共享同一个状态空间?

标准Transformer将两者混合在同一个注意力机制中------KV缓存既存储上下文信息,也参与推理计算。BDH-CQ将它们分离:

维度 循环记忆 S_t 循环推理 H_r
职责 从示例中学习规则 在隐空间中迭代求解
更新方式 随示例顺序演化 随推理步骤迭代
概念角色 类似注意力上下文 类似工作记忆
状态空间 关联状态空间 结构化多向量工作空间

这种分离使得系统可以在不干扰已学规则的前提下,进行深度推理计算。


四、循环潜在推理(RLR)vs 思维链(CoT)

4.1 三种推理范式

复制代码
标准推理:  输入 → [0步思考] → 输出
CoT推理:   输入 → [输出N个思考token] → 输出
RLR推理:   输入 → [隐空间循环R次, 0 token] → 输出

4.2 CoT的计算瓶颈

CoT的每个中间token需要三个操作:

  1. 前向传播:计算下一个token的分布
  2. 解码:通过softmax采样生成token
  3. 重新编码:将token作为下一轮输入重新嵌入

每个操作都有计算开销,而且步骤2和3引入了信息瓶颈------连续的隐状态必须通过离散的token词汇表"序列化"再"反序列化"。

4.3 RLR的效率优势

RLR直接传递隐状态,跳过了解码和重新编码:

复制代码
CoT:h → token → h' → token → h'' ...    (每步3个操作)
RLR:h → h' → h'' ...                    (每步1个操作)

更深层优势在于:一个连续隐状态可以同时携带多个活跃假设。理论研究表明,对于有向图可达性问题,连续思考可以编码多个搜索前沿并同时扩展------这在token级别的序列推理中几乎不可能实现。

4.4 可解释性代价

RLR的代价是可解释性。CoT的中间token至少提供了可审查的推理链------虽然不总是可靠,但至少可见。RLR的中间隐状态是高维连续向量,人类无法直接解读。

这引出了一个设计选择:未来系统可能需要混合模式------在需要通信、验证或工具调用时输出语言token,在需要深度推理时使用隐空间循环。论文指出,BDH层同时支持语言建模和隐推理,因此未来系统可以在同一循环架构中结合两种模式。


五、ARC-AGI-1评测:29.5%意味着什么

上图:ARC-AGI-1成本-精度帕累托前沿------BDH-CQ以$0.0007/task的成本突破此前所有系统建立的成本-精度边界

5.1 ARC-AGI-1是什么

ARC-AGI(Abstraction and Reasoning Corpus)是François Chollet设计的推理基准,专门测试技能获取效率

  • 每个任务通过2-5个示例指定一个全新的变换规则
  • 系统必须从示例中推断出规则并应用到新输入
  • 每个任务都是新的------无法通过记忆解决
  • 要求精确输出------不是生成相似文本,而是精确的网格变换

ARC-AGI-1的评估使用pass@2指标:系统可以提交两个候选答案,只要有一个正确即得分。

5.2 BDH-CQ的评测结果

指标 数值 说明
pass@2 29.5% 400个公开评测任务中解决118个
pass@1 24.25% 单候选答案的正确率
测试对精度 31.03% 419个测试对中解决130个
每任务成本 $0.00070 0.85 H200 GPU秒
每任务成本对比 57倍更便宜 对比GPT 5.6 Luna (Low)的$0.040/34.2%

关键点:BDH-CQ以$0.0007/task的成本突破此前的成本-精度帕累托前沿------此前没有任何系统在同等或更低成本下达到29.5%以上的精度

5.3 成本对比

考虑OpenAI在2026年7月30日对GPT 5.6 Luna公开API价格降低80%后,BDH-CQ仍然比GPT 5.6 Luna便宜约11倍。这还是在BDH-CQ只有150M参数的情况下。

5.4 独立验证

论文的一个亮点是独立黑盒审计。来自Bielik AI和纽约大学的共同作者对部署的推理服务进行了独立评估,在ARC-AGI-1和ConceptARC上复现了报告结果。这不是团队自评,而是第三方验证。


六、ConceptARC:能力画像

6.1 16个概念族的表现

ConceptARC将ARC任务组织为16个概念族,每个族10个任务30个测试对。这提供了比单一分数更细粒度的能力画像:

概念族 pass@2 概念族 pass@2
填充/非填充 9/10 内外 4/10
上下2D 9/10 同/异 4/10
扩展到边界 9/10 复制 2/10
清理 8/10 排序 2/10
水平/垂直 7/10 总计 96/160
上下3D 7/10 60.00%
提取对象 6/10
中心 7/10

关键发现:简单空间变换(填充、边界扩展)表现优异(8-9/10),而需要序列构建的操作(排序、复制)表现最差(2/10)。

6.2 任务内一致性问题

在ConceptARC上,测试对精度(77.92%)远高于严格任务精度(59.38%)。这意味着系统在很多任务上能解决部分测试对,但无法在任务的所有输入上一致地应用推断出的规则:

  • 0个测试对正确:13个任务
  • 1个测试对正确:15个任务
  • 2个测试对正确:37个任务
  • 3个测试对全正确:95个任务

52/160个任务有部分成功但未完全解决------这表明系统在某些输入上正确推断并应用了规则,但在同一任务的其他输入上未能一致地执行。

6.3 标识符和批处理消融

一个关键担忧:系统是否利用了语义任务标识符或概念分组来"作弊"?消融实验给出了否定答案:

  • 语义ID执行:95/160任务,374/480测试对
    不透明ID执行:96/160任务,374/480测试对

聚合表现几乎没有变化。在配对测试对结果中,恰好6个仅语义ID成功,6个仅不透明ID成功------没有任何方向性差异。系统确实是从网格内容中学习,而非利用元数据捷径。


七、控制实验:泛化边界在哪里

7.1 四个泛化族

研究团队在冻结模型后构造了全新的ARC-like任务,系统地测试四个维度的泛化:

传播到边界(距离2-8):

  • 训练示例展示距离1-3的传播
  • 泛化结果:48/48正确------完美外推到距离8
  • 结论:传播操作完全可泛化

复制到锚点(1-4个目标):

  • 训练示例展示1-2个复制
  • 泛化结果:48/48正确------完美外推到4个
  • 结论:复制操作完全可泛化

排序(序列长度2-8):

  • 训练示例展示长度2-4
  • 泛化结果:5以下饱和,6时29/36,7时8/24,8时1/24
  • 结论:存在执行瓶颈,非外推瓶颈

嵌套(深度1-5):

  • 训练示例展示深度1-3
  • 泛化结果:4以下饱和,5时29/36
  • 结论:外推瓶颈,非执行瓶颈

7.2 失败模式的差异

排序和嵌套的失败有不同的特征

  • 排序长度8:只有3/24个输出有正确的维度------整体构建失败
  • 嵌套深度5:全部36个输出都有正确维度,平均单元格精度>99.9%------仅在单个包含关系决策上出错

排序失败是结构性的(整个输出崩塌),嵌套失败是局部性的(结构正确但个别关系错误)。

7.3 上下文支持恢复

当在测试复杂度处添加一个示例("支持"上下文)时:

失败模式 短上下文 支持上下文 恢复
排序长度8 0/24 13/24 +13
嵌套深度5 19/24 24/24 +5

嵌套的瓶颈主要是外推能力(加一个示例就能完全恢复),排序的瓶颈既包含外推也包含执行能力(加示例也无法完全恢复)。

7.4 操作组合

测试单一操作与组合操作的能力:

操作 单独 与重定位组合
重定位 72/72 ---
旋转 72/72 72/72
反射 72/72 47/72
颜色交换 26/72 0/72

旋转与重定位完美组合,反射在大部分情况可组合,颜色交换在单独执行时就困难,组合时完全失败。这说明操作的组合能力高度依赖于具体操作类型。


八、推理努力缩放

8.1 三档推理深度

BDH-CQ支持在推理时调整循环深度------类似人类面对简单问题快速作答,复杂问题反复思考:

推理努力 pass@2 成本削减
HIGH 29.5% 0%(基准)
MEDIUM 27.0% 11%
LOW 21.0% 22%

从LOW到HIGH,精度从21%提升到29.5%(+8.5个百分点),成本增加约28%。这验证了计算深度是一个可调节的推理缩放轴

8.2 重复性

重复相同请求在两个努力级别上都产生了字节级完全一致的输出------标准重复运行匹配了全部419个测试输入。这不是随机采样,而是确定性的迭代计算。

8.3 努力级别的实际含义

MIN设置(最低努力)的成本为0.000884/task,标准设置为0.002652/task------但标准设置在400个任务中多解决了7个(118 vs 111)。在配对比较中,105个任务被两种设置都解决,13个仅标准解决,6个仅MIN解决------统计上未解决(McNemar p=0.167)。


九、训练数据与方法

9.1 训练数据组成

150M参数模型在一个精心策划的ARC风格数据集合上训练,结合了:

  • ARC-AGI-1训练集:官方公开训练数据
  • RE-ARC:程序化生成的示例增强
  • ConceptARC:按概念组织的任务集
  • ARC-Heavy:高难度任务集
  • ARC-GEN100K:10万规模的生成任务
  • 额外数据增强以提高训练数据多样性

9.2 训练目标

训练目标是让系统在先前示例被纳入循环上下文后,预测精确的目标网格。系统在训练时使用不同的推理努力级别,推理时可以选择不同的推理深度。

9.3 无任务特定优化

BDH-CQ与HRM和TRM等方法的一个关键区别:不需要对未见过的任务进行反向传播适应。任务信息通过上下文写入循环记忆,隐计算应用它------无需任务特定的优化。HRM和TRM在ARC上的成本分别为1.48/task和1.76/task,反映了它们将任务特定优化与推理耦合的代价。


十、与连续思考方法的关系

10.1 Coconut:连续思考的先驱

Coconut将Transformer的前一层隐状态作为下一轮输入嵌入反馈,通过课程学习逐步用连续思考替代语言CoT步骤。它证明了连续隐状态反馈可以在自回归语言模型中工作,并且一个状态可以保持多个候选续接。

BDH-CQ探索了不同的运行模式:示例更新循环任务记忆,结构化多向量工作空间解决未见过的视觉变换。

10.2 循环深度模型

循环深度语言模型反复将共享块应用于序列级隐状态,可以通过增加迭代次数改善某些推理基准。循环Transformer提供了理论和实证证据:许多迭代问题不需要每层都有不同参数的有效深度。

BDH-CQ与这些工作的区别在于:它关注的是依赖于示例的学习和视觉变换的表达,而非参数高效的架构设计或测试时计算缩放。

10.3 抽象CoT

Abstract-CoT用学习的保留词汇表替换语言推理链,报告推理token减少最多11.6倍。它位于非语言推理频谱的离散端------压缩且抽象,但仍然串行且需要外部解码。BDH-CQ的RLR完全在连续空间中操作,不需要任何中间解码。


十一、架构扩展潜力

11.1 模型规模缩放

BDH-CQ架构自然扩展到更大的模型规模,继承了BDH架构的张量分片模式,使其在1T规模下特别容易训练。早期实验确认Transformer类缩放定律在1B到600B参数的预训练中适用,同时保留了BDH-CQ特有的隐推理能力。

11.2 未来方向

论文概述了几个扩展方向:

方向 潜力
模型缩放 150M → 1T+,缩放定律已验证
更长训练 更长时间的数据曝光
语言推理 文本示例驱动学习
数学推理 符号验证和证明
约束满足 数独等长期隐优化
更难ARC任务 ARC-AGI-2级别
混合推理 隐计算 + 语言token按需切换

11.3 混合推理的愿景

最终愿景是一个混合推理系统:在需要高效计算时使用隐空间循环(零token消耗),在需要通信、验证或工具调用时输出语言token。BDH层同时支持语言建模和隐推理,使这种混合成为可能。

这与认知科学的发现一致:人类的语言系统和非语言推理系统部分独立运作------不需要假设模型复现了对应的生物机制,但可以借鉴这种功能分离的设计思路。


十二、局限性与开放问题

局限 分析
生成能力 当前是纯推理系统,不生成自然语言
可解释性 中间隐状态无法人类解读
排序瓶颈 序列长度>5时执行能力急剧下降
颜色交换 最难获取的操作,组合时完全失败
通用性 仅在ARC-AGI-1验证,通用语言能力未测试
训练细节 确切更新规则和维度保持专有

关键开放问题

  1. 循环记忆能否从文本示例中学习? 当前系统在视觉网格上验证,文本示例驱动学习是否可行?
  2. 隐推理能否与语言生成无缝结合? 混合模式的技术实现路径是什么?
  3. 排序瓶颈的根源是什么? 是工作记忆容量限制还是迭代精度的上限?
  4. 颜色交换为什么特别难? 固定颜色布局使交换更容易------这是否暗示系统对颜色-语义绑定有特殊困难?

十三、影响分析

对AI行业意味着什么

BDH-CQ的29.5%结果如果可泛化到其他推理领域,将动摇"参数规模=推理能力"的基本假设:

  • 小团队也能竞争:150M参数可以单GPU训练,不需要万卡集群
  • 推理成本崩塌:$0.0007/task vs CoT大量token消耗
  • 架构多样化:不再是Transformer一统天下
  • 推理缩放新维度:不增加参数,增加循环深度也能提升精度

更大图景

当行业发现增加参数的边际收益递减时,BDH-CQ提供了另一条路:计算深度作为独立的推理缩放轴。如果未来AI芯片不是追求更大的芯片面积,而是追求更深的计算流水线------同一组计算单元反复使用------BDH-CQ可能就是那个起点。

更重要的是,BDH-CQ证明了隐空间推理和上下文学习可以共存于一个紧凑的实用系统。这为下一代AI架构提供了一个新的设计空间:不再是在"大参数"和"小参数"之间选择,而是在"参数规模"、"计算深度"和"上下文学习"三个维度上自由组合。

参数量不是AI能力的唯一尺度------计算深度、上下文学习和推理效率,可能是更好的尺度。

相关推荐
txg66644 分钟前
LLM 驱动漏洞传播验证:TransferFuzz-Pro 如何自动调试“继承“来的安全债
人工智能·深度学习·安全
Rocky Ding*1 小时前
【三年面试五年模拟】2026-08-18_哔哩哔哩_AI应用岗Agent开发一面面经(含完整答案)
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
CedarQR2 小时前
云卓 G20 遥控器 Android 开发实录:从 USB 设备到读取摇杆/按键通道值
android·linux·无人机
2601_957879332 小时前
Seedance排队太久怎么办?2026免排队AI视频工具与替代方案怎么选
大数据·人工智能·深度学习
a187927218312 小时前
从一条直线到大模型输出一个token(九):输出矩阵与多层堆叠
深度学习·ai·transformer·token·注意力机制·deepseek·多层堆叠
pengyu2 小时前
【Kotlin 协程修仙录 · 炼虚境 · 初阶】 | 虚空造物:Channel 基础与协程间通信的管道艺术
android·前端·kotlin
jay神2 小时前
YOLO模型什么时候应该加注意力机制?
人工智能·深度学习·yolo·分类·回归·毕业设计
小强闯江湖3 小时前
ViewCompose:让原生 Android View 进入声明式时代
android·开源·kotlin
sel_93 小时前
【多轮对话论文导读(二)】多轮对话与LLM Agent论文阅读:长期记忆、多轮评估与Agent训练
人工智能·深度学习·算法·语言模型·自然语言处理