RuVerBench
收藏资源简介:
RuVerBench是一个用于评估LLM作为裁判在长代理场景中可靠性的准则验证基准。该基准要求裁判模型判断输出是否满足单个准则,每个判断都根据人类黄金标准进行评估。数据集包含494个案例和2,458个准则验证实例,涵盖DeepResearch(问题-报告对)和AgenticCoding(序列化代理轨迹)两个领域,并提供了标准化输入、准则/检查清单、标签、响应/轨迹和分类分配。
RuVerBench is a criterion validation benchmark for evaluating the reliability of LLMs acting as referees in long-horizon agent scenarios. This benchmark requires the referee model to determine whether an output meets a single criterion, with each judgment evaluated against human gold standards. The dataset comprises 494 cases and 2,458 criterion validation instances, covering two domains: DeepResearch (question-report pairs) and AgenticCoding (serialized agent trajectories). Additionally, it provides standardized inputs, criteria/checklists, labels, responses/trajectories, and classification assignments.
数据集名称
RuVerBench
数据集简介
RuVerBench 是一个用于评估大模型作为评判者(LLM-as-a-Judge)在长智能体场景中可靠性的标准验证基准(rubric verification benchmark)。该基准要求评判模型判断输出是否满足单个标准(rubric),并将每个判断与人工标注的黄金标签进行对比。
领域与规模
- DeepResearch:问题-报告对,包含 284 个评分案例和 1,615 个标准点(rubric points)。原始文件中包含 298 条问题-报告记录,但主要基准和排行榜使用已完成最终标准分类分配的 284 条记录。
- AgenticCoding:序列化的智能体轨迹,包含 210 个案例和 843 个检查项(checklist items)。
整个评分基准共计 494 个案例 和 2,458 个标准验证实例。
数据内容
发布的基准文件包含标准化输入、标准/检查清单、标签、响应/轨迹以及标准分类分配。固定策略子集使用与主要基准相同的紧凑标签方案。
仓库结构
RuVerBench/ README.md RUN_STEPS.md DATASET_CARD.md DATA_LICENSE.md requirements.txt
data/ benchmark/ 基准输入、标签和分类文件 predictions/examples/ 示例评判预测文件 strategy_fixed20_subset/ 策略分析所用的固定子集文件
code/ main_leaderboard/ 排行榜重新计算 run_judges/ 评判输出生成包装器 strategies/ 策略生成与聚合脚本 figures/ 论文结果图生成 prompts/ 评判提示词
results/ main_leaderboard/ 重新计算的排行榜表格 dataset/ 数据集/类别摘要 strategies/ 提示词、批处理和投票摘要 error_analysis/ 模型错误重叠文件 figures/ 生成的论文结果图
许可信息
代码和数据分别许可。代码许可见 LICENSE 文件,数据集条款和第三方声明见 DATA_LICENSE.md 文件。




