OSReward:为跨平台计算机使用奖励模型建立标准化评估
论文重点
OSReward是一个针对计算机使用智能体(CUA)轨迹验证任务的标准化评估基准,由来自香港大学、南京大学、新加坡国立大学等多所顶尖机构的23位研究者共同完成。研究发现,当前最先进的视觉语言模型(VLM)作为CUA轨迹的评判者存在系统性的宽松偏差(leniency bias) ------倾向于将失败轨迹误判为成功,而少数足够可靠的模型又因成本过高而无法规模化部署。为此,研究团队构建了OS-Shepherd系列开源奖励模型(9B和35B),在匹配商业级评判模型性能的同时,将成本降低至前者的30-60分之一。
核心研究内容
问题定义
计算机使用智能体(CUA)正在快速渗透数字世界的各个角落------网页、移动应用、桌面软件。一个CUA轨迹记录了智能体的动作、状态和推理过程 ,验证该轨迹是否完成了任务指令,是CUA评估、数据筛选和强化学习的核心环节。然而,无论是人工编写的验证器还是人类标注者,都无法在大规模场景下提供这种验证。因此,该领域越来越依赖VLM作为CUA轨迹的"评判者"。但一个根本性的问题始终未被认真审视:这些VLM评判者到底有多可靠?
创新方法
OSReward的核心创新体现在三个层面:
1. 基准构建(OSReward Benchmark) :不同于复用现有Agent基准中的现成轨迹(这种做法会将评判者错误与轨迹本身缺陷混为一谈),OSReward从零搭建了专用的跨平台数据基础设施,在网页、移动端和桌面端四个平台上运行多种Agent主干模型执行人工验证的指令,再通过多阶段人工标注生成高质量的"金标准"标签。
2. 挑战集设计 :OSReward进一步衍生出两个子集------OSReward-Hard 专注于真正困难的案例(标注者自身都存在分歧的轨迹),用于诊断评判模型的错误模式;OSReward-Multi则在二分类判定之上叠加了细粒度的效率和对齐评分。
3. 开源奖励模型(OS-Shepherd) :基于评估发现的洞见,团队构建了包含10万条推理标注轨迹评判的开放语料库OS-Shepherd-100K,并采用两阶段训练策略训练出OS-Shepherd-9B和OS-Shepherd-35B两款开源奖励模型。
研究成果
研究团队对27个模型进行了迄今为止最全面的VLM评判者评估。核心发现包括:
-
准确性上限 :在OSReward完整集上,只有最前沿的闭源模型接近90%的二分类准确率(Claude-Opus-4-8达到89.7%),但到了OSReward-Hard上,最佳评判者准确率跌破70%,平均仅52%。
-
系统性宽松偏差 :所有VLM评判者共享一个令人不安的特征------对失败轨迹过于宽容,尤其是当智能体"声称"任务完成但实际失败时,评判者极易被误导。
-
开源与闭源的鸿沟 :闭源模型在几乎所有维度上领先开源模型,差距在小规模开源VLM上最为显著。但OS-Shepherd在OSReward-Hard的成本-准确率前沿上,以极低成本达到了接近最昂贵商业模型的表现。
实际落地应用的可能性
OSReward的价值具有多重落地场景:
- CUA训练与评估:为CUA的强化学习提供可靠且低成本的奖励信号,使规模化训练成为可能。
- 数据筛选与质量把控:在构建CUA训练数据集时,自动过滤低质量轨迹。
- 模型选型参考:为开发者提供了一个标准化的评判模型对比平台。
- 开源生态建设:OS-Shepherd系列模型和OS-Shepherd-100K数据集已全部开源,极大降低了CUA研发的门槛。
技术细节
数据采集与标注流程
OSReward的数据构建采用了严格的端到端流程:
- 环境准备:在桌面和移动端搭建专用的执行环境,远超一般基准的覆盖范围。
- 指令编写:针对各平台生成经过人工验证的指令集。
- Agent执行:在多种Agent主干模型上执行指令,收集完整轨迹(包含截图、动作序列和推理过程)。
- 多阶段人工标注 :每条预筛选的轨迹由三位独立标注者 进行标注;标注者之间存在分歧的案例被归入OSReward-Hard。
评价指标体系
研究采用了多维度的评价指标:
- 二分类准确率(Binary Accuracy) :最基本的评判指标。
- 成功召回率(Success Recall) :真正成功的轨迹中被正确接受的比例------低值表示评判者过于严格。
- 失败召回率(Fail Recall) :真正失败的轨迹中被正确捕获的比例------低值表示评判者过于宽松。
- 平衡准确率(Balanced Accuracy) :上述两者的均值,避免了类别不平衡(OSReward中成功/失败比例为43%/57%)对结果的扭曲。
在OSReward-Multi中,成功轨迹还会在对齐度(Alignment) 和效率(Efficiency) 两个维度上接受3级评分(0/0.5/1)。
两阶段训练策略
OS-Shepherd的训练采用了针对宽松偏差的专门设计:
- 第一阶段:建立准确的轨迹评判能力。
- 第二阶段 :直接针对"虚假成功(false success) "------即研究揭示的最严重失败模式------进行优化。
成本-性能分析
研究的一个重要贡献是绘制了OSReward-Hard上的成本-准确率前沿(cost-accuracy frontier) 。分析显示:可靠的评判模型极为昂贵,而低成本的开放模型又表现不佳。OS-Shepherd恰好填补了这一空白------以远低于前沿模型的成本达到了接近其准确率的水平。
研究设定
硬件与软件配置
- 模型规模:OS-Shepherd提供9B和35B(MoE架构)两个版本。
- 推理设置:研究中固定了帧数、红色点击标记等参数,并在消融实验中逐一扰动分析。
- 解码策略:采用贪心解码(greedy decoding)。
数据规模
- OSReward基准:包含1,019条跨平台轨迹。
- OSReward-Hard:284条高难度案例。
- OS-Shepherd-100K:从超过30万个评判实例中筛选出的近10万条训练样本。
实验设计
研究对27个VLM模型 进行了系统评估,涵盖了从开源到闭源、从小型到超大规模的各类模型。实验设计特别注意了训练集与测试集的严格分离------OS-Shepherd的训练语料与OSReward基准完全不相交。
综合分析
核心贡献的学术价值
OSReward的贡献远不止于提供一个基准。它系统地揭示了一个此前被忽视但至关重要的问题:VLM作为评判者的可靠性远未达到理想状态。这一发现对CUA领域的发展具有警示意义------如果连任务完成与否的判断都不可靠,那么基于此的评估、数据筛选和强化学习都可能建立在不稳固的基础之上。
尤为值得关注的是宽松偏差的系统性。研究发现,这种偏差并非某个模型的偶然缺陷,而是跨模型、跨平台的普遍现象。这意味着简单的"换一个更好的模型"无法解决问题------需要从根本上重新思考评判模型的设计和训练范式。
方法论上的创新
OSReward在方法论上提供了一个值得借鉴的范式:先系统性地诊断问题,再有针对性地构建解决方案 。研究团队没有止步于"发现VLM评判者不可靠"这一结论,而是基于诊断结果构建了OS-Shepherd-100K训练语料和两阶段训练策略。这种"诊断→数据→模型"的闭环思路,为AI安全和对齐研究提供了可复用的方法论参考。
开源生态的意义
OSReward团队将代码、基准、数据集和模型权重全部开源 。考虑到CUA是当前AI领域最热门的赛道之一,这一决定具有重要的生态价值------它使得中小型团队也能开展CUA相关研究,而无需承担高昂的商业API调用成本。OS-Shepherd将成本降低至商业模型的1/30到1/60,这一数量级的差距足以改变整个领域的研究范式。
局限性与展望
从论文摘要和初步分析来看,OSReward仍存在一些值得关注的局限性:
- 动态验证的缺失 :当前基准基于静态轨迹的离线评判,而实际的CUA强化学习需要在线奖励信号------这一差距如何弥合尚不明确。
- 人类标注的质量边界:即使是多阶段人工标注,"金标准"本身也受限于人类标注者的判断能力------OSReward-Hard正是标注者分歧的集合,说明有些案例连人类也难以达成共识。
- 跨平台泛化能力:虽然OSReward覆盖了四个平台,但CUA的应用场景仍在快速扩展,基准的覆盖面能否跟上领域发展仍需观察。
实践应用
对研究者的建议
-
评估CUA时请勿盲信VLM评判者:OSReward的研究表明,即使是GPT-5.5、Claude-Opus-4-8等前沿模型,在困难案例上的准确率也仅徘徊在70%左右。建议在研究设计中加入人工抽检或交叉验证机制。
-
优先使用OS-Shepherd作为奖励模型:对于需要规模化部署CUA奖励信号的场景,OS-Shepherd-35B在成本-性能权衡上表现最优。如果资源有限,9B版本也是一个合理的选择。
-
关注宽松偏差的缓解 :在构建自己的评判模型时,应有意识地在训练数据中增加失败案例的比重,特别是那些"看似成功实则失败"的边界案例。
对工程师的建议
-
直接使用开源资源:OSReward的代码、模型权重和数据集均已开源,可立即集成到现有CUA开发流程中。
-
成本优化策略 :如果当前使用GPT-4o或Claude等商业模型进行轨迹评判,迁移到OS-Shepherd可将成本降低30-60倍,同时保持相近的准确率。
-
利用OSReward-Hard进行压力测试:在部署CUA系统前,可使用OSReward-Hard子集对评判模型进行压力测试,识别其在困难案例上的表现短板。
对决策者的建议
-
重视CUA的可验证性问题 :OSReward揭示的评判者可靠性问题提醒我们,CUA的"自动化"不能以牺牲"可验证性"为代价。在将CUA投入关键业务场景前,应建立多层次的质量把控机制。
-
投资开源基础设施建设:OSReward的成功表明,开源社区能够以远低于商业方案的成本提供高质量的AI基础设施。在AI研发投入上,支持开源生态可能比单纯采购商业API更具长期价值。