Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么

Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么

标签:#Harbor #Agent开发 #AI评测 #强化学习 #LLM

前面五篇把 Harbor 的里里外外都拆了。这篇聊一个最容易被人搞错、也最该说清的边界:它到底不是什么。

一句话先放这:Harbor 是评测本体,不是训练框架。它给你结果奖励和轨迹,但跑梯度、更参数、做过程奖励,这些它一概不碰。把这句话说清楚,能帮你避开八成对 Harbor 的误用。

flowchart TB H["Harbor:评测本体"] E["评测:出题 + 判卷 + 出 pass/fail"] R["结果奖励:每条 Trial 一个 0.0~1.0 分"] OUT["产出:RL 原料(轨迹 + 结果奖励)"] T["训练循环:参数更新 / 梯度 / 过程奖励 ------ Harbor 不碰"] H --> E --> R --> OUT OUT --> T style H fill:#1e80ff,stroke:#1e80ff,color:#ffffff style E fill:#e8ffea,stroke:#00b42a,color:#00875a style R fill:#e8f3ff,stroke:#1e80ff,color:#1d2129 style OUT fill:#fff7e8,stroke:#ff7d00,color:#d25f00 style T fill:#fff1f0,stroke:#f53f3f,color:#cf1322

边界一:评测 vs 训练,它只做前半段

Agent 的变强分两半:评测(知道它现在行不行、哪不行)和训练(真的改它的参数让它变强)。这两半的复杂度、代码、所需基础设施完全不同。

Harbor 明确只做评测这一半:

  • 出题(Dataset / Registry);
  • 开考(编排引擎拉 Trial);
  • 判卷(脚本退出码 → pass/fail,reward 0.0~1.0);
  • 留痕(ATIF 轨迹 + success_rate)。

训练那一半(optimizer、rollout、reward model、PPO / GRPO 循环)完全在 Harbor 边界之外。你拿 Harbor 跑完一轮,得到一堆过了没过加轨迹,然后这堆东西交给你的训练管线去消化,Harbor 不会替你训。

这就是为什么系列引子里我说它是 RL 数据生产端、不是 RL 框架。它产原料,不炒菜。

边界二:结果奖励 vs 过程奖励,它只给前者

强化学习里有两种奖励,很多人混为一谈:

  • 结果奖励(outcome reward):这道题最后过了没?过了记 1.0,没过记 0,中间值表示部分通过。粗,但客观、好实现。
  • 过程奖励(process reward):Agent 第 3 步绕了弯路、第 5 步踩了坑,逐步打分。细,但需要一个 reward model,且容易被人刷分。

Harbor 的判卷脚本天然产出的是结果奖励:一条 Trial,退出码 0 即 1.0,否则按比例。它不内置过程奖励,也不逼你接 reward model。

这对你是好事也是限制:

  • 好事:你不用先养一个 PRM 才能开始评测,门槛低;
  • 限制:如果你要逐步纠错信号做细粒度 RL,Harbor 给不了,得自己在外面加一层过程标注。

边界三:它不替你决策用哪个模型

Harbor 能跑出 success_rate,但它不告诉你「所以该上线 Opus」。公开榜口径差异很大------发布时榜首约 49.6%(Codex CLI / GPT-5),到 2026 年公开榜首已升至 80%+(如 Codex CLI 82.2%),选谁要你结合成本、延迟、合规自己拍板。Harbor 是尺子,不是老板。


那它到底能产出什么

把边界说清后,Harbor 的真实产出其实很值钱,列一张清单:

  1. 可复现的 pass/fail 成绩单(发版守门用);
  2. 标准 ATIF 轨迹(回放、分析、当 RL 原料);
  3. 跨 Agent / 跨模型 / 跨版本的横向对比(同一套题);
  4. 结果奖励标签(0.0~1.0,可直接喂 outcome-based RL)。

它产出,但不消费这些产物去做训练。这条界线画成时序是这样:

sequenceDiagram participant H as Harbor(评测) participant D as 你的训练管线(RL) H->>H: 出题 + 判卷 → pass/fail H->>H: 录 ATIF 轨迹 + reward 0.0~1.0 H-->>D: 交付:轨迹 + 结果奖励 D->>D: optimizer / reward model / PPO·GRPO 循环 Note right of D: Harbor 不碰这一步

对比:Harbor vs 你手头的备选

方案 横向对比 可复现 隔离安全 轨迹标准 训练
Harbor 内置(同题多 Agent) 强(镜像环境) 强(沙箱) ATIF 标准 不负责
手动脚本评测 自己写对比逻辑 自定义 自定义 自定义 不负责
各家自建评测 通常不通用 看实现 看实现 自定义 不负责
完整 RL 平台 含评测 自定义 负责

一句话差异:Harbor 是公平考场,RL 平台是考场加补习班。你要的只是公平地知道谁行、产出可复用数据,Harbor 足够;你要的是端到端把模型训强,那是另一类工具的事。


两个真实踩坑(边界相关的)

  1. 环境不一致:手动脚本评测最常在「我本地能过,CI 挂了」上翻车。Harbor 用镜像化环境治这个,但前提是你把依赖真的写进镜像或题目初始化,别依赖宿主机全局装的东西。
  2. 并行翻车:本地开 --n-concurrent 50 但 Docker 资源不够,Trial 互相 OOM。这不是 Harbor 的 bug,是你环境 Provider 的容量没配够。上云(Daytona / Modal)就是为避免这个问题。

一句话总结

别被「优化框架」四个字骗去指望 Harbor 帮你训练模型。它不跑训练、不算过程奖励,只做评测本体,产出结果奖励加标准轨迹。把它当公平考场加数据生产端用,价值最大;指望它当 RL 平台,你会失望。

下一篇 给你一张「什么时候该用、不该用」的决策表,能直接拿去说服团队。


系列连载 · 上一篇《Harbor的设计哲学:三个关键取舍》· 下一篇《什么时候该用 Harbor,什么时候别用:决策指南》

评论区聊聊:你拿 Harbor 干过最出格的事是什么?

相关推荐
QYR_113 小时前
光伏级ETFE薄膜市场2032年预计达5.54亿元,10.6%增速打开轻量化光伏新空间
人工智能
小黄人软件3 小时前
【证书批量转换】PEM->CER证书批量转换工具.exe 纯 Python实现,无需安装OpenSSL
人工智能·学习
tanglinS3 小时前
工业陶瓷在半导体设备里都用哪里?氮化铝基板与氮化硅结构件的静电无尘角色
大数据·运维·人工智能·自动化·材质
ZJU_统一阿萨姆3 小时前
【推理优化】连续批处理:当推理吞吐量遇到天花板
人工智能·语言模型·系统架构
AI攻城狮小关3 小时前
Claude Code 接入 DeepSeek 完整教程:3 步配置,告别订阅限额
人工智能·程序人生·api·agent·配置教程
aiot189189352183 小时前
2026IOTE国际物联网展,深圳国际会展中心10B52蓝牙AOA行业内卷到头没有?
人工智能·人员定位·室内定位·蓝牙aoa·核芯物联
flashier3 小时前
半年没写博客了,聊聊 AI、技术和生活
人工智能·生活
deepdata_cn3 小时前
向量数据库是非结构化数据的AI检索底座
数据库·人工智能
zzz_23683 小时前
长程 Agent 怎么评测:Task、Trial、Grader、Outcome 与 Evaluation Harness
人工智能·agent·agent测评