Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么

Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么

标签:#Harbor #Agent开发 #AI评测 #强化学习 #LLM

前面五篇把 Harbor 的里里外外都拆了。这篇聊一个最容易被人搞错、也最该说清的边界:它到底不是什么。

一句话先放这:Harbor 是评测本体,不是训练框架。它给你结果奖励和轨迹,但跑梯度、更参数、做过程奖励,这些它一概不碰。把这句话说清楚,能帮你避开八成对 Harbor 的误用。

flowchart TB H["Harbor:评测本体"] E["评测:出题 + 判卷 + 出 pass/fail"] R["结果奖励:每条 Trial 一个 0.0~1.0 分"] OUT["产出:RL 原料(轨迹 + 结果奖励)"] T["训练循环:参数更新 / 梯度 / 过程奖励 ------ Harbor 不碰"] H --> E --> R --> OUT OUT --> T style H fill:#1e80ff,stroke:#1e80ff,color:#ffffff style E fill:#e8ffea,stroke:#00b42a,color:#00875a style R fill:#e8f3ff,stroke:#1e80ff,color:#1d2129 style OUT fill:#fff7e8,stroke:#ff7d00,color:#d25f00 style T fill:#fff1f0,stroke:#f53f3f,color:#cf1322

边界一:评测 vs 训练,它只做前半段

Agent 的变强分两半:评测(知道它现在行不行、哪不行)和训练(真的改它的参数让它变强)。这两半的复杂度、代码、所需基础设施完全不同。

Harbor 明确只做评测这一半:

  • 出题(Dataset / Registry);
  • 开考(编排引擎拉 Trial);
  • 判卷(脚本退出码 → pass/fail,reward 0.0~1.0);
  • 留痕(ATIF 轨迹 + success_rate)。

训练那一半(optimizer、rollout、reward model、PPO / GRPO 循环)完全在 Harbor 边界之外。你拿 Harbor 跑完一轮,得到一堆过了没过加轨迹,然后这堆东西交给你的训练管线去消化,Harbor 不会替你训。

这就是为什么系列引子里我说它是 RL 数据生产端、不是 RL 框架。它产原料,不炒菜。

边界二:结果奖励 vs 过程奖励,它只给前者

强化学习里有两种奖励,很多人混为一谈:

  • 结果奖励(outcome reward):这道题最后过了没?过了记 1.0,没过记 0,中间值表示部分通过。粗,但客观、好实现。
  • 过程奖励(process reward):Agent 第 3 步绕了弯路、第 5 步踩了坑,逐步打分。细,但需要一个 reward model,且容易被人刷分。

Harbor 的判卷脚本天然产出的是结果奖励:一条 Trial,退出码 0 即 1.0,否则按比例。它不内置过程奖励,也不逼你接 reward model。

这对你是好事也是限制:

  • 好事:你不用先养一个 PRM 才能开始评测,门槛低;
  • 限制:如果你要逐步纠错信号做细粒度 RL,Harbor 给不了,得自己在外面加一层过程标注。

边界三:它不替你决策用哪个模型

Harbor 能跑出 success_rate,但它不告诉你「所以该上线 Opus」。公开榜口径差异很大------发布时榜首约 49.6%(Codex CLI / GPT-5),到 2026 年公开榜首已升至 80%+(如 Codex CLI 82.2%),选谁要你结合成本、延迟、合规自己拍板。Harbor 是尺子,不是老板。


那它到底能产出什么

把边界说清后,Harbor 的真实产出其实很值钱,列一张清单:

  1. 可复现的 pass/fail 成绩单(发版守门用);
  2. 标准 ATIF 轨迹(回放、分析、当 RL 原料);
  3. 跨 Agent / 跨模型 / 跨版本的横向对比(同一套题);
  4. 结果奖励标签(0.0~1.0,可直接喂 outcome-based RL)。

它产出,但不消费这些产物去做训练。这条界线画成时序是这样:

sequenceDiagram participant H as Harbor(评测) participant D as 你的训练管线(RL) H->>H: 出题 + 判卷 → pass/fail H->>H: 录 ATIF 轨迹 + reward 0.0~1.0 H-->>D: 交付:轨迹 + 结果奖励 D->>D: optimizer / reward model / PPO·GRPO 循环 Note right of D: Harbor 不碰这一步

对比:Harbor vs 你手头的备选

方案 横向对比 可复现 隔离安全 轨迹标准 训练
Harbor 内置(同题多 Agent) 强(镜像环境) 强(沙箱) ATIF 标准 不负责
手动脚本评测 自己写对比逻辑 自定义 自定义 自定义 不负责
各家自建评测 通常不通用 看实现 看实现 自定义 不负责
完整 RL 平台 含评测 自定义 负责

一句话差异:Harbor 是公平考场,RL 平台是考场加补习班。你要的只是公平地知道谁行、产出可复用数据,Harbor 足够;你要的是端到端把模型训强,那是另一类工具的事。


两个真实踩坑(边界相关的)

  1. 环境不一致:手动脚本评测最常在「我本地能过,CI 挂了」上翻车。Harbor 用镜像化环境治这个,但前提是你把依赖真的写进镜像或题目初始化,别依赖宿主机全局装的东西。
  2. 并行翻车:本地开 --n-concurrent 50 但 Docker 资源不够,Trial 互相 OOM。这不是 Harbor 的 bug,是你环境 Provider 的容量没配够。上云(Daytona / Modal)就是为避免这个问题。

一句话总结

别被「优化框架」四个字骗去指望 Harbor 帮你训练模型。它不跑训练、不算过程奖励,只做评测本体,产出结果奖励加标准轨迹。把它当公平考场加数据生产端用,价值最大;指望它当 RL 平台,你会失望。

下一篇 给你一张「什么时候该用、不该用」的决策表,能直接拿去说服团队。


系列连载 · 上一篇《Harbor的设计哲学:三个关键取舍》· 下一篇《什么时候该用 Harbor,什么时候别用:决策指南》

评论区聊聊:你拿 Harbor 干过最出格的事是什么?

相关推荐
ai小陈1 小时前
PyTorch DataLoader数据加载性能排查:GPU利用率低的实操指南
人工智能·pytorch·python·深度学习·ai·gpu算力
测试者家园2 小时前
为什么意图驱动测试是自动化测试的下一站,而不是替代品
自动化测试·软件测试·人工智能·持续测试·ai赋能·智能化测试·软件测试变革
D202020203 小时前
TikTok Shop禁止AI语音直播落地后,跨境卖家如何通过达秘合规调整带货内容
人工智能
像风一样自由20204 小时前
20.Milvus常见问题检索不到维度错误和数据一致性
人工智能·大模型·milvus
现代野蛮人4 小时前
【深度学习实验】—— 基于 LSTM 与 Optuna 调参的丙型肝炎预测
人工智能·深度学习·lstm
支支დ4 小时前
VO by Vercel 前端特定优势:为什么它是构建 AI 应用的新范式
前端·人工智能
ZGIAI4 小时前
ZGI 让那些"等你去处理"的事,真正跑起来
人工智能·架构
ZGIAI4 小时前
ZGI:别再做Agent Demo了,先问问它在业务里能不能撑过下周三
人工智能·架构
香芋芋圆4 小时前
AI 冲击内卷之下,普通前端如何破局?WebGIS—— 低门槛突围赛道
前端·javascript·人工智能·学习·职场发展
m0_614523555 小时前
完整教程|输入一句描述,能不能直接生成一段可以继续剪辑的视频:写结构化描述到生成短样片
人工智能·音视频