OSReward:为跨平台计算机使用奖励模型建立标准化评估
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
论文信息
标题: OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
作者: Qiushi Sun, Kanzhi Cheng, Yian Wang, et al.
发布日期: 2026-07-30
arXiv ID: 2607.28609v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决的是计算机使用代理(CUA)轨迹评估中视觉语言模型(VLM)裁判的可靠性问题,即这些模型能否准确判断任务是否成功完成。
- 核心方法:构建了 OSReward 基准,通过跨平台(Web、Windows、Ubuntu、移动端)环境收集真实轨迹,由三名独立标注员进行人工标注和元审查,生成 1019 个带有黄金标签的轨迹,并在此基础上测试 27 个 VLM 裁判的性能。
- 关键结果:几乎所有 VLM 裁判都存在系统性 “宽容偏见”,即容易将失败的运行误判为成功;在 OSReward-Hard 挑战子集上,最佳裁判准确率从约 90% 降至不足 70%,而可负担的开源模型与前沿闭源模型之间存在巨大性能差距。
- 主要局限:基准本身规模有限(1019 个轨迹),OSReward-Multi 的精细评分(对齐性和效率)仍是探索性指标,且训练 OS-Shepherd 所需的数据蒸馏过程依赖于已有强裁判的一致性,可能继承其偏见。
- 适合读者:从事计算机使用代理、GUI 自动化、强化学习奖励建模,以及关注多模态模型评估与对齐的研究人员和工程师。
论文背景和研究动机
计算机使用代理(CUA)正迅速进入数字世界的各个角落,能够在网页、移动应用和桌面软件上执行复杂操作。一个 CUA 轨迹记录了代理的行动、状态和推理过程。验证一个轨迹是否完成了任务指令,是 CUA 评估、数据筛选和强化学习的核心环节。然而,传统的人工编写验证器和人类标注在规模化面前力不从心。因此,领域内越来越多地转向使用视觉语言模型(VLM)来充当裁判,无论是作为奖励模型还是自动评分器。
但一个根本问题长期未被深究:这些 VLM 裁判到底有多可靠?与评判纯文本或多模态回答不同,评判一个 CUA 轨迹要求模型阅读一个包含屏幕截图、行动和文本推理的长序列,并判断环境状态是否真正达到了任务目标,而非代理口头宣称的那样。此前的试点研究(见论文第 1 节)已经揭示,即使是最好的 VLM 裁判,在桌面端轨迹的评判上与现有基准的手写验证器也存在约四分之一的意见分歧。
为了系统研究这个问题,作者构建了 OSReward。与复用已有基准的轨迹不同,OSReward 建立在从零开始设计的跨平台数据基础设施之上。这避免了将裁判的错误与轨迹运行本身的缺陷相混淆,因为新增的轨迹来自四种不同模型家族的代理,产生了真实的成功与失败案例。每条轨迹都经过严格的多阶段人工标注,形成了 1019 个高质量黄金标签数据。在此基础上,作者进而提出了 OSReward-Hard(集中了难题的挑战集)和 OSReward-Multi(用于细粒度评分的子集),并最终发布了一个开源的训练语料库 OS-Shepherd-100K 和两个开放奖励模型 OS-Shepherd-9B 与 35B,以极低成本提供了可靠、稳定的奖励信号。
核心方法和技术细节
OSReward 的构建核心在于高质量、跨平台的数据收集与标注流程。
跨平台基础设施:作者为四个主流平台(Web、Windows、Ubuntu 和移动端)分别搭建了接近真实用户使用状态的环境。例如,Windows 和 Ubuntu 环境均预装了约 20 到 30 个日常和专业应用,并初始化了真实文件、用户配置等,确保任务具有现实挑战性。Web 端则直接在真实互联网上运行,利用浏览器池处理反爬虫问题。
任务指令与轨迹收集:任务指令由标注员在探索环境后编写,并经过作者外的其他标注员交叉验证,排除了有歧义或无法落地的指令。约 800 条通过审查的指令,然后被分配给来自 Claude、Gemini、Kimi 和 Qwen 四个模型家族的代理去执行。这种多代理后端的多样性,确保了基准不会偏向代理的特定操作习惯和失败模式。收集到的轨迹首先经过自动预过滤,剔除掉由网络封锁、环境死机等非代理能力导致的失败案例。
严格的黄金标注:最终存活的轨迹进入一个极其严格的标注流程。每个轨迹由三名独立标注员审查。标注标准明确指出,哪怕代理 “蒙对” 了结果,但没有通过环境交互去获取和验证,依然被判为失败。这与裁判提示(judging prompt)中的规则一致。当三人意见一致时,判定为最终标签;若存在分歧(约占 25%),则提交给两名高级审查员进行 “元审查”,通过讨论而非多数投票做出最终判断。这一流程共耗去约 800 人时(见论文第 3.3 节和附录 B.2)。最终形成了 1019 个轨迹的黄金集合(成功率 43%,失败率 57%)。
OSReward-Hard 的构建:这是一个包含 284 个轨迹的挑战子集,主要来源于标注员之间产生意见分歧的案例。这些案例的共同特点是:轨迹记录看起来像是完成了任务,或者虽然成功但路径非常曲折,连人类标注员和裁判模型都经常判断错误或意见不一。其成功/失败比例调整为约 30/70,用以进一步暴露裁判将失败误判为成功的 “虚假成功” 错误模式(见论文第 3.4 节)。
OS-Shepherd 的训练方法:OS-Shepherd 基于 Qwen3.5 模型,经历了两个训练阶段。第一阶段(SFT),在由多个强 VLM 裁判达成高度一致的约 9.66 万个轨迹-判决样本上微调。第二阶段(RL),利用 GRPO 算法,专门针对 SFT 后模型依然会犯的 “虚假成功” 错误进行强化学习优化,迫使模型更严格地审查代理是否真正完成了任务(见论文第 6.2 节和附录 D.2)。
创新点和贡献
这篇论文的核心贡献体现在三个层面:
1. 标准化评估基准 OSReward:这是第一个跨平台、基于全新采集的、由人工提供黄金标签的 CUA 奖励信号基准。不同于以往工作仅依赖单一平台或复用已有基准的轨迹和验证器,OSReward 从环境准备、指令编写、代理执行到人工标注全链条构建,确保了标签的纯净性和挑战的真实性。
2. 对 VLM 裁判最全面的评估与故障诊断:论文对 27 个 VLM 模型进行了统一协议的测试,揭示了一个关键的系统性偏差:“宽容偏见”(leniency bias)。几乎所有裁判都表现出高成功召回率(sRec)和低失败召回率(fRec),即倾向于接受一切,尤其容易被代理最终宣称成功的叙事所欺骗(图 5)。错误分析表明,“接受未完成的任务” 是压倒性的失败模式,在所有模型的错误中占比不低于 48%(图 6)。进一步的输入消融实验证实,文字历史对判决的影响(平均 7.2 个百分点)远超视觉输入,这解释了宽容偏见的根源:裁判更看重代理的自述而非屏幕实际状态(见论文第 5.2 节)。
3. 开放数据与模型 OS-Shepherd:面对前沿模型准确但昂贵、开源模型便宜但效果差的两难困境,论文构建并开源了 OS-Shepherd-100K——首个大规模、推理标注的 CUA 轨迹判断语料库,并训练了 OS-Shepherd-9B 和 35B 两个模型。在成本-准确度曲线上,OS-Shepherd 模型以低于前沿模型 30-60 倍的成本,达到了与商业级中等水平裁判相当的性能,并且在 OSReward-Hard 上保留了大部分可靠性,有效弥合了开源和闭源模型之间的巨大鸿沟(图 1)。
实验结果分析
总体准确性:在 OSReward 全量集上,只有少数前沿模型(如 Claude-Opus-4-8,准确率 89.7%)接近 90% 的训练级奖励信号需求门槛。然而,开源模型的性能大幅落后(表 1)。
OSReward-Hard 上的 “崩塌”:所有裁判在 OSReward-Hard 上的性能急剧下降,最佳模型准确率跌至约 70%,平均水平降至 52%(表 1)。这暴露了基准评估的乐观性。难度分析还显示,Windows 平台和使用屏幕阅读才能发现的错误(如感知错误、动作错误)对裁判最具挑战性(图 7)。
OS-Shepherd 的性能:OS-Shepherd-9B 在全量集上准确率达到 86.1%,进入了中等商业模型行列,但在成本上具有绝对优势。更令人关注的是其在 OSReward-Hard 上的表现:失败召回率(fRec)达到 57.6%,远超其他同价位的 “宽容” 裁判,并且保持在 “严格-宽容” 平面的平衡对角线上,而其他廉价模型则严重偏向宽容端。这一去偏见的能力,在三个未曾参与训练的现有基准(WebArena、AndroidWorld、OSWorld)上也得到了验证,证明其抵抗宽容偏见的能力是学到的,并能跨基准迁移(见论文第 7.2 节,图 10)。
OSReward-Multi 的探索:在成功轨迹的精细评分上,所有模型表现均不佳。最佳模型的宏召回率仅约 60%,且问题主要出在对齐性(Alignment)评分上,法官倾向于给出最高分,而无法有效判别劣质执行(表 2,见论文第 4.5 节)。
实践建议
对于将 VLM 裁判用于 CUA 强化学习或轨迹筛选的研究者和工程师,本论文提供了直接且可操作的指导:
1. 避免单一依赖代理的文本叙事:研究证明 VLM 裁判的判决主要由文本历史驱动,很容易被代理自信的 “任务完成” 声明所欺骗。设计评判提示时,不应仅依赖代理自身的推理步骤。可以考虑明确指示裁判 “忽略代理的成功/失败声明,仅根据最终执行状态的屏幕截图进行判断”,或者对关键步骤强制要求视觉验证。
2. 以极低成本部署可靠的奖励模型:OS-Shepherd-9B 模型开源且可自托管,论文估算,在一次包含 200 次更新、批次大小为 16、每次更新 16 个轨迹的在线强化学习微调中,使用 Claude-Opus-4-8 作为裁判的成本约为$4000,而使用 OS-Shepherd-9B 仅需约$68(API 等价成本)。在学术预算下进行规模化 CUA 训练时,直接部署 OS-Shepherd 系列模型是平衡成本与可靠性的更优选择。
3. 关注 “虚假成功” 问题的针对性优化:在训练自己的 CUA 奖励模型时,应将 “虚假成功”(即代理未完成但声称完成的轨迹)作为最难、最值得关注的负样本。OS-Shepherd 的两阶段训练中,专门针对此类样本进行强化学习微调的策略被证明有效。从业者可借鉴此思路,构建或挖掘此类样本,增加其损失权重或进行专门训练,以缓解裁判的宽容偏见。
4. 谨慎对待裁判成本与平台难度的关联:不同平台的轨迹对裁判挑战不同(如桌面环境普遍比移动端更难),裁判在难题上的性能与其成本几乎呈正比。在预算有限时,可以根据任务平台和难度进行针对性选择,而非寻找一个普适的裁判。例如,对于移动端相对简单的任务,使用低成本裁判或许足够,而面对长周期的复杂桌面任务,则需投入更多计算资源。