Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么
标签:#Harbor #Agent开发 #AI评测 #强化学习 #LLM
前面五篇把 Harbor 的里里外外都拆了。这篇聊一个最容易被人搞错、也最该说清的边界:它到底不是什么。
一句话先放这:Harbor 是评测本体,不是训练框架。它给你结果奖励和轨迹,但跑梯度、更参数、做过程奖励,这些它一概不碰。把这句话说清楚,能帮你避开八成对 Harbor 的误用。
边界一:评测 vs 训练,它只做前半段
Agent 的变强分两半:评测(知道它现在行不行、哪不行)和训练(真的改它的参数让它变强)。这两半的复杂度、代码、所需基础设施完全不同。
Harbor 明确只做评测这一半:
- 出题(Dataset / Registry);
- 开考(编排引擎拉 Trial);
- 判卷(脚本退出码 → pass/fail,reward 0.0~1.0);
- 留痕(ATIF 轨迹 +
success_rate)。
训练那一半(optimizer、rollout、reward model、PPO / GRPO 循环)完全在 Harbor 边界之外。你拿 Harbor 跑完一轮,得到一堆过了没过加轨迹,然后这堆东西交给你的训练管线去消化,Harbor 不会替你训。
这就是为什么系列引子里我说它是 RL 数据生产端、不是 RL 框架。它产原料,不炒菜。
边界二:结果奖励 vs 过程奖励,它只给前者
强化学习里有两种奖励,很多人混为一谈:
- 结果奖励(outcome reward):这道题最后过了没?过了记 1.0,没过记 0,中间值表示部分通过。粗,但客观、好实现。
- 过程奖励(process reward):Agent 第 3 步绕了弯路、第 5 步踩了坑,逐步打分。细,但需要一个 reward model,且容易被人刷分。
Harbor 的判卷脚本天然产出的是结果奖励:一条 Trial,退出码 0 即 1.0,否则按比例。它不内置过程奖励,也不逼你接 reward model。
这对你是好事也是限制:
- 好事:你不用先养一个 PRM 才能开始评测,门槛低;
- 限制:如果你要逐步纠错信号做细粒度 RL,Harbor 给不了,得自己在外面加一层过程标注。
边界三:它不替你决策用哪个模型
Harbor 能跑出 success_rate,但它不告诉你「所以该上线 Opus」。公开榜口径差异很大------发布时榜首约 49.6%(Codex CLI / GPT-5),到 2026 年公开榜首已升至 80%+(如 Codex CLI 82.2%),选谁要你结合成本、延迟、合规自己拍板。Harbor 是尺子,不是老板。
那它到底能产出什么
把边界说清后,Harbor 的真实产出其实很值钱,列一张清单:
- 可复现的 pass/fail 成绩单(发版守门用);
- 标准 ATIF 轨迹(回放、分析、当 RL 原料);
- 跨 Agent / 跨模型 / 跨版本的横向对比(同一套题);
- 结果奖励标签(0.0~1.0,可直接喂 outcome-based RL)。
它产出,但不消费这些产物去做训练。这条界线画成时序是这样:
对比:Harbor vs 你手头的备选
| 方案 | 横向对比 | 可复现 | 隔离安全 | 轨迹标准 | 训练 |
|---|---|---|---|---|---|
| Harbor | 内置(同题多 Agent) | 强(镜像环境) | 强(沙箱) | ATIF 标准 | 不负责 |
| 手动脚本评测 | 自己写对比逻辑 | 自定义 | 自定义 | 自定义 | 不负责 |
| 各家自建评测 | 通常不通用 | 看实现 | 看实现 | 自定义 | 不负责 |
| 完整 RL 平台 | 含评测 | 强 | 强 | 自定义 | 负责 |
一句话差异:Harbor 是公平考场,RL 平台是考场加补习班。你要的只是公平地知道谁行、产出可复用数据,Harbor 足够;你要的是端到端把模型训强,那是另一类工具的事。
两个真实踩坑(边界相关的)
- 环境不一致:手动脚本评测最常在「我本地能过,CI 挂了」上翻车。Harbor 用镜像化环境治这个,但前提是你把依赖真的写进镜像或题目初始化,别依赖宿主机全局装的东西。
- 并行翻车:本地开
--n-concurrent 50但 Docker 资源不够,Trial 互相 OOM。这不是 Harbor 的 bug,是你环境 Provider 的容量没配够。上云(Daytona / Modal)就是为避免这个问题。
一句话总结
别被「优化框架」四个字骗去指望 Harbor 帮你训练模型。它不跑训练、不算过程奖励,只做评测本体,产出结果奖励加标准轨迹。把它当公平考场加数据生产端用,价值最大;指望它当 RL 平台,你会失望。
下一篇 给你一张「什么时候该用、不该用」的决策表,能直接拿去说服团队。
系列连载 · 上一篇《Harbor的设计哲学:三个关键取舍》· 下一篇《什么时候该用 Harbor,什么时候别用:决策指南》
评论区聊聊:你拿 Harbor 干过最出格的事是什么?