Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么

Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么

标签:#Harbor #Agent开发 #AI评测 #强化学习 #LLM

前面五篇把 Harbor 的里里外外都拆了。这篇聊一个最容易被人搞错、也最该说清的边界:它到底不是什么。

一句话先放这:Harbor 是评测本体,不是训练框架。它给你结果奖励和轨迹,但跑梯度、更参数、做过程奖励,这些它一概不碰。把这句话说清楚,能帮你避开八成对 Harbor 的误用。

flowchart TB H["Harbor:评测本体"] E["评测:出题 + 判卷 + 出 pass/fail"] R["结果奖励:每条 Trial 一个 0.0~1.0 分"] OUT["产出:RL 原料(轨迹 + 结果奖励)"] T["训练循环:参数更新 / 梯度 / 过程奖励 ------ Harbor 不碰"] H --> E --> R --> OUT OUT --> T style H fill:#1e80ff,stroke:#1e80ff,color:#ffffff style E fill:#e8ffea,stroke:#00b42a,color:#00875a style R fill:#e8f3ff,stroke:#1e80ff,color:#1d2129 style OUT fill:#fff7e8,stroke:#ff7d00,color:#d25f00 style T fill:#fff1f0,stroke:#f53f3f,color:#cf1322

边界一:评测 vs 训练,它只做前半段

Agent 的变强分两半:评测(知道它现在行不行、哪不行)和训练(真的改它的参数让它变强)。这两半的复杂度、代码、所需基础设施完全不同。

Harbor 明确只做评测这一半:

  • 出题(Dataset / Registry);
  • 开考(编排引擎拉 Trial);
  • 判卷(脚本退出码 → pass/fail,reward 0.0~1.0);
  • 留痕(ATIF 轨迹 + success_rate)。

训练那一半(optimizer、rollout、reward model、PPO / GRPO 循环)完全在 Harbor 边界之外。你拿 Harbor 跑完一轮,得到一堆过了没过加轨迹,然后这堆东西交给你的训练管线去消化,Harbor 不会替你训。

这就是为什么系列引子里我说它是 RL 数据生产端、不是 RL 框架。它产原料,不炒菜。

边界二:结果奖励 vs 过程奖励,它只给前者

强化学习里有两种奖励,很多人混为一谈:

  • 结果奖励(outcome reward):这道题最后过了没?过了记 1.0,没过记 0,中间值表示部分通过。粗,但客观、好实现。
  • 过程奖励(process reward):Agent 第 3 步绕了弯路、第 5 步踩了坑,逐步打分。细,但需要一个 reward model,且容易被人刷分。

Harbor 的判卷脚本天然产出的是结果奖励:一条 Trial,退出码 0 即 1.0,否则按比例。它不内置过程奖励,也不逼你接 reward model。

这对你是好事也是限制:

  • 好事:你不用先养一个 PRM 才能开始评测,门槛低;
  • 限制:如果你要逐步纠错信号做细粒度 RL,Harbor 给不了,得自己在外面加一层过程标注。

边界三:它不替你决策用哪个模型

Harbor 能跑出 success_rate,但它不告诉你「所以该上线 Opus」。公开榜口径差异很大------发布时榜首约 49.6%(Codex CLI / GPT-5),到 2026 年公开榜首已升至 80%+(如 Codex CLI 82.2%),选谁要你结合成本、延迟、合规自己拍板。Harbor 是尺子,不是老板。


那它到底能产出什么

把边界说清后,Harbor 的真实产出其实很值钱,列一张清单:

  1. 可复现的 pass/fail 成绩单(发版守门用);
  2. 标准 ATIF 轨迹(回放、分析、当 RL 原料);
  3. 跨 Agent / 跨模型 / 跨版本的横向对比(同一套题);
  4. 结果奖励标签(0.0~1.0,可直接喂 outcome-based RL)。

它产出,但不消费这些产物去做训练。这条界线画成时序是这样:

sequenceDiagram participant H as Harbor(评测) participant D as 你的训练管线(RL) H->>H: 出题 + 判卷 → pass/fail H->>H: 录 ATIF 轨迹 + reward 0.0~1.0 H-->>D: 交付:轨迹 + 结果奖励 D->>D: optimizer / reward model / PPO·GRPO 循环 Note right of D: Harbor 不碰这一步

对比:Harbor vs 你手头的备选

方案 横向对比 可复现 隔离安全 轨迹标准 训练
Harbor 内置(同题多 Agent) 强(镜像环境) 强(沙箱) ATIF 标准 不负责
手动脚本评测 自己写对比逻辑 自定义 自定义 自定义 不负责
各家自建评测 通常不通用 看实现 看实现 自定义 不负责
完整 RL 平台 含评测 强 强 自定义 负责

一句话差异:Harbor 是公平考场,RL 平台是考场加补习班。你要的只是公平地知道谁行、产出可复用数据,Harbor 足够;你要的是端到端把模型训强,那是另一类工具的事。


两个真实踩坑(边界相关的)

  1. 环境不一致:手动脚本评测最常在「我本地能过,CI 挂了」上翻车。Harbor 用镜像化环境治这个,但前提是你把依赖真的写进镜像或题目初始化,别依赖宿主机全局装的东西。
  2. 并行翻车:本地开 --n-concurrent 50 但 Docker 资源不够,Trial 互相 OOM。这不是 Harbor 的 bug,是你环境 Provider 的容量没配够。上云(Daytona / Modal)就是为避免这个问题。

一句话总结

别被「优化框架」四个字骗去指望 Harbor 帮你训练模型。它不跑训练、不算过程奖励,只做评测本体,产出结果奖励加标准轨迹。把它当公平考场加数据生产端用,价值最大;指望它当 RL 平台,你会失望。

下一篇 给你一张「什么时候该用、不该用」的决策表,能直接拿去说服团队。


系列连载 · 上一篇《Harbor的设计哲学:三个关键取舍》· 下一篇《什么时候该用 Harbor,什么时候别用:决策指南》

评论区聊聊:你拿 Harbor 干过最出格的事是什么?

相关推荐
回眸&啤酒鸭6 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智6 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅6 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein6 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu6 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台6 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb6 天前
智能网联汽车安全能力框架
人工智能
龙亘川6 天前
明月照湾区,智启新赛道:从顶流文旅IP盛会看智慧文旅升级路径
人工智能·智慧城市·开源软件·数据可视化
飞猫的边缘AI6 天前
边缘AI应用:家用AI摄像头怎么做数据训练?
人工智能·边缘计算·ai算法·边缘ai