真没想到,AI 圈又杀出来一匹黑马!

上周,我看到了海外知名 AI 研究者 AK 的一个帖子。

图源:AK 原帖

这个帖子介绍的是一个名为 NeoHorse-1 的开源模型,主打通过后训练与路由框架,探索通往递归自我改进(Recursive Self-Improvement,简称 RSI)的工程路径。

看到后训练和 RSI 这两个在大模型前沿极其抢眼的热词,我下意识以为这又是哪家顶尖基础模型大厂(如 OpenAI、Anthropic、阿里、智谱等)或高校实验室在展示前沿成果。但点开 ArXiv 上的技术报告看到作者团队时,说实话我是有点困惑的。

这个模型背后的主导者,居然是基元律动(TokenRhythm)。

基元律动?这不是一个搞开源、搞多模型聚合路由 API 的厂商么。

他们有一个很出名的 Agent 运行框架,就是 OpenSquilla ,也叫做皮皮虾,就是这个

这个 GitHub 项目已经有 7k star 了,确实很火,而且 Issue 和 PR 也非常多,社区很活跃。

除此之外,这个厂商还搞了一个多模型聚合路由 API ,TokenRhythm API

这立刻引发了我的好奇:一家做中间层路由调度、帮开发者省 Token 账单的中间件公司,不好好做工具,怎么自己挽起袖子下场训模型了?

而且上来一发不可收拾的直接搞 RSI 去了?这可是一个 Agent-Native 的模型啊。

带着这种类似反直觉的疑问,我通读了他们的技术报告,发现背后隐藏着一套极具启发性的技术与商业逻辑闭环。

下面就跟大家聊聊这事儿。

后训练与 RSI

我觉得要理解这件事情的起因经过结果升华 :) ,得先从后训练和 RSI 来说起。

在行业早期内,大家都认为一个超级大模型能够上下通吃,多场景吞并。但现实是全球模型持续赛马,各自在代码、数学推理、中文语境、超长上下文或推理成本上各有所长,我觉得百花齐放这个词用到这里还挺搭的。

在真实的 Agent 任务中,一个复合型任务有可能会串联调度多个模型,模型之间的账单成本根本不一样,比如刚上线的 GPT-6 Astra,你会拿他来做测试吗?之前 A 社还单独发了一篇文章就在说,Opus 负责规划,Sonnet 负责执行,Haiku 负责做测试验证。

根据基元律动提供的平台账单统计,最贵、最顶级的模型往往只承担了大约 10% 的核心复杂决策,却消耗了 75% 以上的 Token 账单预算。

Token 账单在成为显性刺客

而且大模型的进化也在迅速加快,从最初的 Chat (一问一答式) -> Reasoning(思维推理)-> Coding(执行验证反馈)-> Agent(多步规划、多工具交互、反馈)。

当公开网络上的高质量人类语料基本被预训练吃干抹净后,行业的胜负手已经转移到了后训练(Post-Training) ,以及更长远的目标递归自我改进(RSI)

RSI 描绘的是一个极其诱人的图景:AI 系统能够观测自身执行任务的表现,并将这些经验反馈转化为下一轮自我升级的依据,让每一代模型助力下一代模型的生成,把原本孤立的训练转变为复利增长。

写到这里我停下来想了一个问题:这种迭代式增长,和斐波那契数列是一样的吗?

想了想,还是不一样。斐波那契是一场纯粹的数学游戏:每一项由前两项机械相加,规则一旦给定,数列就无条件地滚下去,中间没有任何质量把关。而 RSI 式的增长更像复利:每一轮的「本金」是上一轮沉淀下来的执行轨迹,但这些本金必须先经过评测与筛选这道「风控」,确认哪些经验真的值得学,才允许进入下一轮。所以这种增长能不能滚起来,关键在于每一轮的评测和筛选是否可靠。

RSI 最大的工程难点在于:模型无法在真空里自我进化,它必须在一个具备真实交互和严密反馈的环境中历练。

当 Agent 在编写代码、排查系统故障或处理数据时,它在环境中所做出的每一次决策、工具调用、报错以及最后的修复,都会留下一串结构化的记录,也就是所谓的交互轨迹(Trajectory)

这些 Trajectory 并不是静态的问答语料,它记录了模型完整的纠偏和进化能力的过程,包括如何尝试、碰壁、调整并解决最终问题的。

而掌握这些 Trajectory 的,就是大家所熟知的驭马工程(Harness)

Harness 是如何把执行反馈变成训练数据的?

所谓的驭马工程(Harness),你可以理解成 Agent Runtime 外面的执行层:它管理着模型的上下文、可用工具集、外部环境反馈以及多轮会话状态。

当 Harness 引入了 **Agentic Routing(智能路由)**机制后,它不仅能根据任务复杂度将请求分发给最合适、最经济的模型,还能完整记录下任务在不同阶段的模型调用轨迹与执行成败。

在基元律动的技术报告中给出的系统架构,也极其生动地展示了这一闭环:

图源:NeoHorse-1 技术报告

仔细拆解上图,整个系统实际上构成了 Data-RSI(数据飞轮)Model-RSI(模型飞轮) 的协同双环:

  1. 环境与轨迹收集(Routing Harness): 面对外部多样化的任务(Diverse tasks),Routing Harness 通过智能路由器(Router)在异构模型池(Model pool)中分派任务并执行,完整沉淀出包含工具调用与环境交互的原始轨迹数据。
  2. 能力反馈与数据筛选(Capability Feedback -> Training Mixture): 执行记录并不等于训练样本。系统通过自动化评测模块,时刻监控模型当前能力的短板。评测反馈会动态调整下一轮训练的数据配比(Training mixture),确保模型缺什么补什么。
  3. 针对性智能体训练(Agentic Training): 有了高质量轨迹和筛选后的数据配比,系统采用三阶段训练机制:
  4. Agent 执行监督(Agentic Supervision):学习严谨的推理步骤、工具调用格式与错误恢复;
  5. 路由课程学习(Routing Curriculum):将路由系统的复杂度分级(如 C0--C3)作为课程表,由易到难逐步增加学习难度;
  6. 路由引导的在策略蒸馏(Routing-guided On-Policy Distillation, OPD):让小模型实际生成行动路径,再由更强的模型针对其生成过程提供即时纠偏与指导。
  7. 模型回流与下一轮迭代(Next Iteration) : 按照这套设计,完成训练后的 NeoHorse-1 可以重新部署回模型池(Model pool),在 Harness 的调度下承接实际任务,为下一轮观测和改进提供新数据。

技术报告里有个项目排期案例,特别适合解释这事。

Qwen3.5-4B 找到了工作目录里的相关文件,却漏读了一封包含最新依赖关系的经理邮件。结果它拿着过期信息做排期,生成了一份无效计划,连文件都放错了位置。

NeoHorse-1-4B 却继续找到这封邮件,识别更新后的依赖关系,重新计算并验证排期,最后把文件存到要求的路径。两个模型最后都会回复,差别在于有没有把事情真的做完。

图源:NeoHorse-1 技术报告 5.1 节

NeoHorse-1 的技术报告里最硬核的地方,我觉得是它对 Trajectory 的处理规范:

图源:NeoHorse-1 技术报告

如上图所示,每一条复杂的长程 Trajectory,首先会被切分为拥有局部目标的子场景(Subscene Si),再从 场景(SCENE)目标(GOAL)结果(OUTCOME) 三个角度描述任务本身:

1. 场景维度(SCENE)

  • Task(任务类型):区分是信息检索(Information retrieval)、分析诊断(Analysis / diagnosis)还是软件工程(Software engineering);
  • Domain(业务领域):标注知识工作(Knowledge work)、软件代码(Software)还是金融计算(Finance);
  • Use context(使用场景):工作生产(Work)、学术研究(Schoolwork)还是个人生活(Personal);
  • Asking / Doing(交互性质):严格区分是普通的咨询问答(Information seeking)、实际执行系统操作(Execution),还是最终产出具体交付制品(Artifact production)。

2. 目标维度(GOAL)

  • Acceptance(验收标准):从正确性(Correctness)、完整性(Completeness)到格式规范(Format compliance)多重验证;
  • Cross-turn relation(跨轮次关系):判断当前轮次是开启了全新任务(New)、延续此前进度(Continued),还是用户根据中间结果调整了需求(Modified)。

3. 结果维度(OUTCOME)

  • Verifiable result(可验证产物):是否有确切的产物生成(Artifact produced)、系统状态是否发生改变(State change)、是否有充分的事实证据(Evidence available);
  • Goal satisfaction(目标达成判定):严格给出最终布尔值(True / False)。

这三个角度描述「用户要做什么、想做到什么、最后拿到了什么」。轨迹质量则另外看六个维度:目标达成、指令遵循、工具使用、证据一致性、错误恢复和正常终止。

这一设计的精髓在于把任务完成(Completed)与质量达标(Satisfied)严格区分开来。 很多时候 Agent 以为自己回复了就是完成了,但只有质量评估达标、结果也能验证的轨迹,才有资格进入训练集。

4B/9B 小模型的跑分越级表现

基元律动这次开源的 NeoHorse-1 采用了 Qwen3.5 作为初始化底座,发布了 4B 与 9B 两个主流小模型规格。

目前 4B、9B、GGUF 量化版和 Apple Silicon 可用的 MLX 版本都已经放出来了,采用 Apache 2.0 协议,原生上下文长度为 262,144。模型可以在 Hugging Face 和魔搭社区下载,部署方式与完整评测也放在了 GitHub 上,相关链接见文末。

在涵盖智能体框架交互、指令遵循、代码编写、复杂工具调用等 10 项基准测试中,其官方自测表现如下:

图源:NeoHorse-1 技术报告

从具体的各项智能体基准对比中,可以看到几个非常显著的特征:

  • 4B 赛道(4B Track) : 在后训练加持下,NeoHorse-1-4B 的综合平均分从底座的 58.94 跃升至 64.87(+5.93)。10 项评测全部高于原始的 Qwen3.5-4B,在 τ²-Bench 复杂工具交互上拿到了 88.46,在 PinchBench 上也达到了 77.33。按这组官方评测的平均分,它在 4B 同尺寸对比中最高,也已经逼近未经后训练的 9B 基座水平。
  • 9B 赛道(9B Track) : NeoHorse-1-9B 的综合平均分从 65.60 提升到 69.04(+3.44),多数项目都有提升。不过 LiveCodeBench 和 IFBench 与底座持平,IFEval 还低了 0.37 分。它的提升更集中在长程工具调度、执行与容错这些 Agent 任务上。
  • 真实轨迹 vs 合成数据 : 技术报告中还有一个关键对比:在相同底座、课程表、优化器、随机种子和评测协议下,使用 Harness 沉淀轨迹训练的模型,在 5 项可比评测上比使用公开合成工具数据集 Toucan 平均高出了 6.26 分。至少在这组配置和这 5 项测试里,经过筛选的真实执行轨迹更有效。

当然,技术团队在报告中写得挺克制:对于极端复杂的跨文件架构重构、长程状态保持任务,4B 小模型仍有自身上限,仍然需要路由调度到更强大的前沿大模型,但这恰恰是 Harness 存在和协同调度的意义所在。

我在想这是哪个团队做的事情?直到我翻到技术报告的最后我才懂了。

图源:NeoHorse-1 技术报告附录 A

无问芯穹官方披露的说法是:NeoHorse-1 由基元律动与无问芯穹联合发布,无问芯穹提供大模型基础设施支持,清华大学、北京大学团队参与算法和训练方法研究。技术报告附录列出的作者机构还包括香港中文大学、阿里巴巴集团等。

怪不得。

最后的思考

回到我们最初的疑问:一家做 API 和 Harness 调度工具的公司,为什么下场训模型?

看完 NeoHorse-1,答案已经非常清晰了。基元律动其实是在用一个模型,串联起了一套极为严密的商业与技术飞轮:

OpenSquilla 负责把 Agent 任务跑起来,TokenRhythm API 负责在不同模型之间做调度。而 Harness 每跑完一个任务,其实都是一层反馈信号:这一步路由给了谁、工具调用、失败之后如何回复、结果有没有验证。这些信号经过结构校验、质量评估和筛选之后,才成为 NeoHorse-1 后训练的教材;训练好的模型再回到模型池里,去承接下一批任务。

技术路线上,NeoHorse-1 跑通了面向 RSI 的一次单轮工程验证。尽管从严格意义上讲,目前的奖励信号设计、数据配比与训练流程仍需工程师人工干预,尚未达到全自动、无人干预的终极自进化形态,但这无疑迈出了极具实践价值的一步。

相关链接

相关推荐
richard_first1 小时前
第3章 PTQ:不用重新训练也能量化 LLM
人工智能·深度学习·语言模型·自然语言处理·transformer
萌新小码农‍1 小时前
KL散度的介绍
人工智能·深度学习·机器学习
张祥6422889041 小时前
牛顿迭代法求解开普勒方程:从RTKLIB源码到数值分析
人工智能·算法·机器学习
tq10861 小时前
归属感产生临境创造性
人工智能
Theo_xx1 小时前
声学感知基础:8.Range Bin、Range Profile 与 Range-Time Map
人工智能·无线感知·声学感知
欣欣之王来了1 小时前
AI合规学习:核心知识点梳理与学习路径规划
人工智能
二川bro1 小时前
Playwright MCP浏览器自动化实战,AI直接操控浏览器
人工智能
虞七月1 小时前
2026企业AI办公工具选型完全指南
人工智能·ai编程
掘金者阿豪1 小时前
极空间 NAS 部署 Typecho:从 Docker 安装、主题配置到固定公网访问
后端