遇见数据集

CUARewardBench

收藏
github2026-05-20 更新2026-05-29 收录
官方服务:

资源简介:

CUARewardBench是一个全面、实用且可靠的数据集,涵盖来自10个软件类别和7种代理架构的轨迹,这些轨迹具有不同的性能水平(成功率为25.9%–50.8%)。所有轨迹均通过精心设计的协议进行专家标注,并经过严格的质量控制。

CUARewardBench is a comprehensive, practical, and reliable dataset that encompasses trajectories from 10 software categories and 7 agent architectures, with varying performance levels (success rates ranging from 25.9% to 50.8%). All trajectories are expertly annotated via a meticulously designed protocol and subjected to strict quality control.

创建时间:
2026-05-20
原始信息汇总

数据集概述

CUARewardBench 是一个用于评估计算机智能体(CUA)奖励模型的综合性基准数据集。它是首个系统评估结果奖励模型(ORM)和过程奖励模型(PRM)在 CUA 任务上表现的基准。

核心特点

  • 首创综合基准:为 CUA 任务中的 ORM 和 PRM 提供统一的评估框架,支持轨迹级和步骤级评估。
  • 多样性数据集:涵盖 10 个软件类别、7 种智能体架构的轨迹数据,成功率范围为 25.9%–50.8%。所有轨迹均经过专家标注,并配有严格的质量控制流程。
  • 深入分析:对 7 种视觉语言模型和 3 种提示模板进行广泛实验,揭示了当前 CUA 奖励模型在视觉推理能力不足、知识缺陷等方面的关键局限性。
  • 一致提示集成方法(UPE):通过严格的全体一致投票和策略性提示模板配置,显著提升奖励模型可靠性。ORM 可实现 88.0% 的精确率和 95.3% 的负预测值(NPV),PRM 可实现 83.1% 的精确率和 86.2% 的 NPV。

数据组成

  • 数据文件位于 data/ 目录下:
    • data/annotations/cuarewardbench-v0.4.json:包含轨迹级标签和步骤级标注。
    • data/trajectories/osworld_verified/:包含轨迹截图和动作记录,需通过 scripts/download_data.sh 脚本从原始数据源下载并本地预处理。
  • 数据集不直接分发轨迹截图/图像,用户需下载原始档案并按照 data/manifest.jsonl 中的校验码进行验证。

评估模式

数据集支持三种评估模式:

  • zerogui:基于 ZeroGUI 提示的轨迹级成功评估(ORM)。
  • sewsm_thinking:基于截图的轨迹分析和步骤奖励解析,同时支持 ORM 和 PRM。
  • opencua_reflect_thinking:用于步骤级过程奖励评估的思考型模型反思提示(PRM)。

使用方法

  1. 安装:在仓库根目录下执行 python3 -m pip install -e .
  2. 数据准备:运行 bash scripts/download_data.sh 以下载并预处理轨迹数据。
  3. 基准评估:使用 python3 -m cuarewardbench.cli.eval_benchmark 命令,指定标注文件、轨迹根目录、提示目录、评估模式、模型配置等参数。
  4. 评估新轨迹:使用 python3 -m cuarewardbench.cli.eval_trajectory 评估新的智能体轨迹。
  5. 投票与UPE:使用 python3 -m cuarewardbench.cli.vote 执行投票集成,支持 UPE、多数投票等多种模式。

输出指标

评估结果包含以下核心指标:精确率、负预测值(NPV)、召回率、特异性、总体准确率、F1 分数以及混淆矩阵(TP/FP/FN/TN)。指标按任务类型、模型配置和步骤数进行细分。

许可与引用

  • 代码、标注、元数据和文档采用 Apache License 2.0 许可。
  • 轨迹截图/图像不包含在仓库内,需用户自行下载并遵守上游数据集使用条款。
  • 引用论文:Lin et al. “CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent” (arXiv:2510.18596, 2025)。
搜集汇总
数据集介绍
CUARewardBench 数据集图片
构建方式
在计算机使用智能体(CUA)任务中,奖励模型的评估长期受限于脚本化验证器的可扩展性与细粒度不足。为突破这一瓶颈,CUARewardBench应运而生,作为首个系统化评估CUA任务奖励模型的综合性基准。其构建过程严谨而多维:首先,广泛采集来自10类软件应用与7种智能体架构的轨迹数据,涵盖不同性能层次(成功率25.9%–50.8%),确保数据的多样性与代表性。随后,通过精心设计的标注协议,由领域专家对每条轨迹进行终局奖励与步骤级奖励的双重标注,并执行严格的质量控制流程,最终形成包含轨迹级与步骤级标签的高质量标注文件(cuarewardbench-v0.4.json)。所有轨迹截图与动作记录均统一整理至标准化目录结构,并辅以校验清单保障数据完整性,形成了一个既具备实际挑战性又可靠可信的评估数据集。
特点
CUARewardBench数据集展现出显著的结构化与实用化特征。其核心亮点在于首次统一整合了终局奖励模型(ORM)与过程奖励模型(PRM)的评估框架,支持从轨迹整体到单一步骤的多粒度性能度量,为奖励模型研究提供了前所未有的细节视角。数据集中囊括了多种视觉-语言模型(VLMs)及提示模板下的评估结果,揭示了当前CUA奖励模型普遍存在的视觉推理不足、知识盲区等关键局限。尤为创新的是,该基准不仅提供静态评估,还提出了“一致提示集成”(UPE)方法——通过严格的一致投票策略与策略性提示模板配置,显著提升了奖励模型的可靠性,使得ORM的精确度高达88.0%,阴性预测值达95.3%;PRM亦取得了83.1%的精确度与86.2%的阴性预测值。这一特性使得CUARewardBench不仅是评测工具,更是推动奖励模型优化的助力器。
使用方法
使用CUARewardBench进行模型评估遵循清晰且灵活的流水线。用户首先需通过脚本下载并预处理原始轨迹数据,随后利用命令行工具(如python3 -m cuarewardbench.cli.eval_benchmark)执行基准评估,指定标注文件、轨迹根目录、提示模板目录以及模型配置等参数。评估支持多种模式:zerogui模式专注于轨迹级ORM评估,sewsm_thinking模式同时输出ORM与PRM结果,而opencua_reflect_thinking模式专用于步骤级PRM评估。产出结果以JSON与可选Excel格式存储,涵盖精确度、召回率、F1分数等核心指标,并细分至任务类型、模型配置与步数维度。对于已有详细结果文件的场景,用户可通过--only_metric参数快速重算指标而无需重复调用模型。此外,该基准还提供了对全新智能体轨迹的单次或批量评估工具,并支持投票集成方法(如UPE),使得CUARewardBench在模型开发迭代与最终验证中均能发挥多重作用。
背景与挑战
背景概述
随着大语言模型与视觉语言模型的迅猛发展,计算机使用智能体(Computer-Using Agent, CUA)在自动化操作图形用户界面方面展现出巨大潜力。然而,现有评估体系多依赖脚本验证器,受限于扩展性且无法提供细粒度的步骤级评判。为填补这一空白,Haojia Lin等研究者在2025年提出了CUARewardBench——首个针对CUA任务奖励模型(Reward Model)的综合性基准。该数据集由上海交通大学等机构联合创建,系统性地覆盖了结果奖励模型(ORM)与过程奖励模型(PRM)的评估框架,包含来自10类软件应用和7种智能体架构的轨迹数据,并经由专家精心标注。其发布标志着CUA评估从粗粒度任务判定迈向精细化过程监督的关键一步,为提升智能体的可靠性与可解释性奠定了重要基础。
当前挑战
CUARewardBench致力于应对两大核心挑战。其一,在领域问题层面,现有CUA评估主要依赖脚本验证器,难以衡量智能体在复杂多步操作中的中间表现与推理能力,亟需能提供轨迹级与步骤级反馈的奖励模型,而当前视觉语言模型在视觉推理与领域知识方面存在明显不足,导致评估准确性受限。其二,在数据集构建过程中,需采集并标准化来自多个上游源的轨迹数据,涵盖不同智能体架构与任务类型,成功率为25.9%至50.8%不等,数据多样性高。同时,为保证标注质量,研究团队设计了严格的人工标注协议与质量控制流程,应对轨迹截图不公开分发带来的复现挑战,并通过校验机制确保数据完整性。此外,如何设计有效的集成策略以提升奖励模型可靠性也是关键难题,如所提出的Unanimous Prompt Ensemble方法需在严格一致性投票与提示模板配置间取得精妙平衡。
常用场景
经典使用场景
CUARewardBench凭借其独特的架构设计,成为评估计算机操作智能体奖励模型的首选基准。研究者利用该数据集系统性地对输出奖励模型和过程奖励模型进行轨迹级与步骤级双维度评估。具体而言,数据集收录了横跨10类软件应用和7种智能体架构的执行轨迹,其成功率在25.9%至50.8%之间形成梯度分布,为奖励模型的精细化评测提供了天然的分层验证条件。通过精心设计的标注协议与严格质量控制,所有轨迹均获得专家级标注,使得该基准在CUA奖励模型评估领域具有开创性的标杆地位。
衍生相关工作
CUARewardBench催生了多项具有启发性的衍生研究。其提出的UPE集成方法为多模型投票机制在奖励模型领域的应用开创了新范式,促使后续研究探索更高效的模型协作策略。该基准揭示了通用视觉语言模型在CUA任务上优于专用CUA模型的引人深思的结论,直接推动了视觉语言模型在智能体任务中适应性的深度研究。此外,其首次对ORM与PRM在CUA任务上进行系统性对比的实验范式,已成为该方向后续研究的标准参照框架,众多学者基于该基准的数据与评估协议开展了奖励模型架构优化与训练方法创新工作。
数据集最近研究
最新研究方向
随着基于视觉语言模型的计算机使用智能体(CUA)在自动化桌面操作等场景中展现出巨大潜力,如何对其行为进行精准、可扩展的评估成为亟待突破的瓶颈。传统基于脚本的验证器因难以泛化且无法提供细粒度步骤级反馈而日益显露出局限性。在此背景下,CUARewardBench作为首个专用于CUA任务的奖励模型综合评测基准应运而生,系统性地涵盖结果奖励模型(ORM)与过程奖励模型(PRM),覆盖10类软件场景和7种智能体架构。该数据集通过精心设计的标注协议和严格质量控制,深入揭示了当前奖励模型在视觉推理、领域知识等方面的严重不足,并创新性地提出了一致性提示集成方法(UPE),通过严格的投票机制显著提升了奖励模型的可靠性。这一前沿工作不仅为CUA系统的可信评估奠定了标准化基础设施,更推动了奖励模型从简单结果判断向复杂过程理解的关键演进,对构建更安全、更智能的人机协作系统具有深刻的指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务