遇见数据集

RuVerBench

收藏
github2026-07-11 更新2026-07-23 收录
数据链接:
官方服务:

资源简介:

RuVerBench是一个用于评估LLM作为裁判在长代理场景中可靠性的准则验证基准。该基准要求裁判模型判断输出是否满足单个准则,每个判断都根据人类黄金标准进行评估。数据集包含494个案例和2,458个准则验证实例,涵盖DeepResearch(问题-报告对)和AgenticCoding(序列化代理轨迹)两个领域,并提供了标准化输入、准则/检查清单、标签、响应/轨迹和分类分配。

RuVerBench is a criterion validation benchmark for evaluating the reliability of LLMs acting as referees in long-horizon agent scenarios. This benchmark requires the referee model to determine whether an output meets a single criterion, with each judgment evaluated against human gold standards. The dataset comprises 494 cases and 2,458 criterion validation instances, covering two domains: DeepResearch (question-report pairs) and AgenticCoding (serialized agent trajectories). Additionally, it provides standardized inputs, criteria/checklists, labels, responses/trajectories, and classification assignments.

创建时间:
2026-06-24
原始信息汇总

数据集名称

RuVerBench

数据集简介

RuVerBench 是一个用于评估大模型作为评判者(LLM-as-a-Judge)在长智能体场景中可靠性的标准验证基准(rubric verification benchmark)。该基准要求评判模型判断输出是否满足单个标准(rubric),并将每个判断与人工标注的黄金标签进行对比。

领域与规模

  • DeepResearch:问题-报告对,包含 284 个评分案例和 1,615 个标准点(rubric points)。原始文件中包含 298 条问题-报告记录,但主要基准和排行榜使用已完成最终标准分类分配的 284 条记录。
  • AgenticCoding:序列化的智能体轨迹,包含 210 个案例和 843 个检查项(checklist items)。

整个评分基准共计 494 个案例2,458 个标准验证实例

数据内容

发布的基准文件包含标准化输入、标准/检查清单、标签、响应/轨迹以及标准分类分配。固定策略子集使用与主要基准相同的紧凑标签方案。

仓库结构

RuVerBench/ README.md RUN_STEPS.md DATASET_CARD.md DATA_LICENSE.md requirements.txt

data/ benchmark/ 基准输入、标签和分类文件 predictions/examples/ 示例评判预测文件 strategy_fixed20_subset/ 策略分析所用的固定子集文件

code/ main_leaderboard/ 排行榜重新计算 run_judges/ 评判输出生成包装器 strategies/ 策略生成与聚合脚本 figures/ 论文结果图生成 prompts/ 评判提示词

results/ main_leaderboard/ 重新计算的排行榜表格 dataset/ 数据集/类别摘要 strategies/ 提示词、批处理和投票摘要 error_analysis/ 模型错误重叠文件 figures/ 生成的论文结果图

许可信息

代码和数据分别许可。代码许可见 LICENSE 文件,数据集条款和第三方声明见 DATA_LICENSE.md 文件。

搜集汇总
数据集介绍
RuVerBench 数据集图片
构建方式
RuVerBench基准测试通过聚焦于长程智能体场景中的评价标准核验任务,系统性地评估LLM作为裁判的可靠性。该数据集覆盖两大领域:DeepResearch包含问题-报告配对数据,AgenticCoding涵盖序列化的智能体轨迹。整体基准涉及494个案例与2,458条核验标准实例,其中DeepResearch领域包含284个经评分案例与1,615个标准节点,AgenticCoding领域则整合210个案例与843条检查项。数据集构建过程中,对原始DeepResearch数据源中的298条问题-报告记录进行筛选,最终保留284条已完成标准分类法标注的记录纳入基准与排行榜体系。
特点
RuVerBench具备显著的结构化与专业化特征:每个核验实例均由规范化的输入、评价标准/检查表、人工标签、响应/轨迹及分类法分配五要素构成。该数据集创新性地设计了固定策略子集,采用与主基准一致的紧凑标签体系,便于进行策略分析。数据来源清晰可溯,代码与数据采用独立的许可协议,数据集条款及第三方声明在专有文件中详述。此外,基准提供了完整的可复现性边界,支持对排行榜表格、策略分析表格及固定子集文件进行直接检查。
使用方法
RuVerBench的使用方法体现为多层次的操作路径。基础层支持通过已导出的排行榜表格和固定子集文件直接进行结果检查与策略分析。对于需要生成新预测结果的研究,可通过运行Judge包装器调用兼容OpenAI格式的API端点,设置环境变量JUDGE_MODEL、JUDGE_BASE_URL与JUDGE_API_KEY,随后执行run_deepresearch_judge.sh与run_agenticcoding_judge.sh脚本。策略分析可通过code/strategies/目录下的脚本完成,但需注意新鲜API调用结果会受端点行为、模型版本、提示设置、采样参数及运行时间等多因素影响,因此仅导出的表格位于可确定性复现路径之内。
背景与挑战
背景概述
RuVerBench是一个面向长程智能体场景中LLM作为评判者可靠性评估的规则验证基准。该基准创建于2025年,由相关研究机构主导开发,旨在系统性地评估大语言模型在复杂智能体任务中判断输出是否满足特定规则的能力。基准涵盖DeepResearch与AgenticCoding两大领域,前者聚焦问-答对报告,后者涉及序列化智能体轨迹。通过494个案例与2458条规则验证实例的精心构建,RuVerBench为衡量评判模型提供了一套标准化评估框架,其发布的规范化输入、规则清单及人工黄金标签等资源,为相关领域的研究奠定了坚实基础,对推动长程智能体场景中LLM评判可靠性的研究具有重要影响力。
当前挑战
RuVerBench所面临的挑战首先体现在领域共性问题上:长程智能体场景中,智能体输出复杂且涉及多步骤决策,评判模型需精准识别细粒度规则是否被满足,这远超传统简单问答任务的难度。在构建过程中,挑战尤为显著:一是如何确保不同领域(如DeepResearch与AgenticCoding)的规则定义一致且无歧义,以避免评判偏差;二是解决评判结果的可复现性问题——由于依赖外部API端点,模型版本、提示设置及采样参数的变化均可能导致结果波动,从而增加基准评估的稳定性难度;三是人工标注黄金标签的精确性与成本平衡,需要在繁杂的长程输出中确保标签质量,同时控制标注开销。
常用场景
经典使用场景
RuVerBench是一个专门用于评估大语言模型作为评判者(LLM-as-a-Judge)在长智能体场景下可靠性的基准数据集。它涵盖了DeepResearch(问题-报告对)与AgenticCoding(序列化智能体轨迹)两大核心领域,包含494个案例与2,458个规则验证实例。该数据集最经典的使用场景是让评判模型对每个输出是否满足独立的评分规则进行二元判定,并将判定结果与人工标注的金标准进行比对,从而量化模型在复杂、多步骤智能体任务中的判断对齐能力。
解决学术问题
该数据集系统性地解决了当前学术研究中LLM作为自动评估器在长文本、多步骤智能体任务中可靠性不明的关键问题。它弥补了现有评估基准多聚焦于短文本或简单分类任务的不足,通过构建带有精细规则分类和人工标签的验证集,首次实现了对评判模型在长期依赖、跨步推理场景下游判断能力的大规模量化分析。其引入的规则分类体系与策略固定子集为研究评判者偏差、提示设计、批量采样与投票策略等学术问题提供了标准化实验框架。
衍生相关工作
RuVerBench的发布催生了一批以自动评估器可靠性为核心的研究工作。该基准推动了评判模型在长序列输出中的一致性分析方法,衍生出针对提示工程优化、批量处理策略与投票机制的系统性比较。研究者基于其固定策略子集开展了跨模型的评审判定规律研究,揭示了不同架构在大场景下的判别偏好差异。此外,该数据集中的分类学分配与错误分析文件为后续构建自纠错、多轮反馈的智能体评估系统提供了可复用的数据基础与实验范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务