遇见数据集

RankJudge

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

RankJudge是一个合成基准生成数据集,专门用于评估大型语言模型(LLM)在多轮对话中作为法官的能力。该数据集旨在解决现有LLM-as-a-Judge基准主要关注简单问答任务,无法匹配复杂多轮对话评估需求的问题。其核心内容基于参考文档(包括计算机科学论文、医学论文和10-K财务报告)构建对话对,每个对话对包含一个好的对话和一个在某一轮次注入了单一特定缺陷(如逃避回答、捏造答案等)的坏的对话,从而能够明确标记优劣并隔离失败类别,为法官评估提供严格的联合正确性标准。数据集包含两个主要配置:pairs(包含652个对话对及其真实标签、领域、元数据、缺陷轮次和源文档上下文)和matches(包含13,692条记录,对应21个前沿LLM法官对对话对的预测结果,包括优劣判断、缺陷预测、与真实标签的对比、原始响应文本和API使用统计)。该数据集适用于文本分类、问答等任务,主要用于LLM评估、基准测试和多轮对话系统性能研究,数据规模在1万到10万之间,语言为英语,采用CC BY 4.0许可证发布。

RankJudge is a synthetic benchmark generation dataset for evaluating large language models (LLMs) as judges in multi-turn dialogues. It aims to address the limitation of existing LLM-as-a-Judge benchmarks that primarily focus on simple QA tasks and cannot meet the needs of complex multi-turn dialogue evaluation. The core content is based on reference documents (computer science papers, medical papers, or 10-K financial reports) to construct dialogue pairs. Each pair includes a good dialogue and a bad dialogue with a single specific defect (such as evasion or fabrication) injected into one turn. This construction allows for clear labeling of better or worse dialogues and isolates failure categories to individual turns, providing a strict joint correctness standard for judge evaluation. The dataset consists of two main configurations: 1) pairs containing 652 dialogue pairs with ground truth labels, including dialogue content, domain (machine learning, biomedical, finance), true superiority judgment, generation plan, user/assistant behavior type metadata, defect turn, and source document context; and 2) matches containing 13,692 records corresponding to predictions from 21 state-of-the-art LLM judges on the 652 dialogue pairs, including model information, predictions on superiority, defect turn and type, comparison with ground truth (including strict joint correctness judgment), original response text, and API usage and cost statistics. It is suitable for tasks like text classification and QA, primarily used for LLM evaluation, benchmarking, and multi-turn dialogue system performance research. The data scale ranges from 10,000 to 100,000, the language is English, and it is released under the CC BY 4.0 license.

创建时间:
2026-05-21
原始信息汇总

数据集概述

RankJudge 是一个用于评估 LLM 在多轮对话中作为评判者(LLM-as-a-judge)能力的合成基准生成器。

核心任务

  • 文本分类问答
  • 专注于多轮对话场景,每对对话中一个为优质对话,另一个被注入了单一弱点。

数据规模

  • 总样本数:10,000 到 100,000 之间。
  • 已发布评估切片
    • pairs 配置:652 对对话(优质与劣质对话配对),包含真实标签。
    • matches 配置:13,692 条预测记录,每个(对话对,评判模型)组合对应一行。

语言

  • 英语(en)。

领域

  • 机器学习(ml)、生物医学(med)、金融(fin)。

数据内容

  • pairs 数据集字段

    字段 描述
    id 对话对唯一标识,可与 matches 连接
    domain 领域(ml / med / fin)
    convo_a / convo_b 对话 A 与对话 B(角色与内容列表)
    better_is_a 真实标签:A 是否优质对话
    plan 对话生成方案(优质/劣质)
    metadata.user_behavior_type 7 种用户行为之一(如 focused, skeptical)
    metadata.assistant_behavior_type 7 种助手弱点之一(如 evasion, fabricated_answer)
    metadata.n_rounds 对话轮次数
    metadata.bad_round_index 弱点所在轮次(从 1 开始)
    metadata.context 源文档上下文(标题、摘要、参考问答对)
  • matches 数据集字段(部分关键字段):

    字段 描述
    id 对话对标识
    model.name 评判模型名称
    judge.answer 评判模型预测的优质对话(A 或 B)
    judge.correct_verdict 预测结果是否正确
    judge.correct_bad_round 弱点轮次预测是否正确
    judge.correct_behavior_type 弱点类型预测是否正确
    judge.correct 三项全部正确(严格正确性标准)

数据来源与构建

  • 基于源文档(计算机科学论文、医学论文或 10-K 文件)生成。
  • 通过注入单一弱点构造对话对,确保优劣标签明确,并能将失败类别精确归因到特定轮次。

许可协议

  • CC BY 4.0(源文档保留其原始许可)。

引用

  • 如需引用,请参考论文:arXiv:2605.21748
搜集汇总
数据集介绍
RankJudge 数据集图片
构建方式
RankJudge数据集的构建源自对多轮对话中模型评估难题的深刻洞察。研究者采用了一种精巧的合成策略:首先,依据机器学习、生物医学和金融三大领域的源文档(包括学术论文与财务报告),生成高质量的参考对话;继而,在每一对对话中,精确地向其中一条对话的某一轮次注入单一类型的缺陷,如回避问题或虚构答案。如此构造出的成对对话,可被明确无误地标注为优劣之别,并将错误类别精准定位至特定轮次,为评判者设定了严格的联合正确性标准。数据集最终收录了652对经此流程处理的多轮对话样本。
特点
该数据集最显著的特点在于其多维度、精细化的评估设计。它不仅提供了对话对孰优孰劣的全局标注(better_is_a),更细致地记录了缺陷发生的轮次索引(bad_round_index)与具体缺陷类型(assistant_behavior_type),形成了从整体到局部的完整评价链条。此外,数据集还引入了用户行为模式(如多疑型、误导型)与助手弱点类别的交叉组合,极大地丰富了评估场景的多样性。配套的13,692条评判记录涵盖了21种前沿大语言模型的预测结果,包括其判断、推理过程及成本数据,为深入分析模型评估行为提供了宝贵资源。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载RankJudge数据集的两种配置:'pairs'配置包含652对基础对话样本,'matches'配置则提供了每对对话与每个评判模型的13,692条预测记录。典型的使用流程是,首先加载'pairs'作为基准真相(ground truth),然后加载'matches'以获取各语言模型评判者的具体预测表现。通过分析'judge.correct'等字段,可以严格评估不同评判模型的准确性。数据集还支持根据对话对的难度等级动态筛选评估子集,以降低标签噪声,并借助Bradley-Terry模型对评判者进行排名,从而系统性地比较各模型在多轮对话评估中的性能优劣。
背景与挑战
背景概述
RankJudge数据集由Layer6 AI团队于2026年创建,旨在填补多轮对话场景下大语言模型(LLM)作为评判者的评估基准空白。随着基于LLM的交互式应用日益复杂,传统依赖人工评估的方式在面对海量生成文本时显得力不从心,自动评估成为了重要替代方案。然而,现有的LLM-as-a-Judge基准多聚焦于简单问答任务,难以匹配多轮对话的复杂性与动态性。RankJudge通过生成基于参考文档的多轮对话对,在单个轮次中注入特定缺陷,从而构建出明确优劣的对比样本,并引入严格联合正确性标准来评判模型表现。该数据集涵盖机器学习、生物医学和金融三大领域,评测了21个前沿LLM评判者,其基于Bradley-Terry模型的排名机制为评估领域提供了可靠且可重复的范式,对推动自动评估在复杂对话系统中的实际应用具有重要意义。
当前挑战
RankJudge所解决的核心挑战在于多轮对话场景下自动评估的可靠性。一方面,传统基于简单问答的评估基准无法捕捉多轮对话中信息流转、用户意图演变与助手行为一致性的细微差异,导致对模型真实能力的高估或误判;另一方面,构建基准时需确保对话对标签的精确性,即在单轮中人为注入如回避回答、虚构信息等七类缺陷,同时维持其余轮次的自然性,这对数据生成流程的设计提出了极高要求。此外,为确保评判标准的严谨性,数据集采用了联合正确性指标,要求模型同时判对优劣对话、定位缺陷轮次并识别缺陷类型,显著提升了自动评估的难度与区分度,但也带来了标注噪声与模型间排名稳定性的挑战。
常用场景
经典使用场景
RankJudge 数据集专为多轮对话场景下的大语言模型评判能力评估而设计。其核心任务要求评判模型在给定参考文档的基础上,对一对多轮对话进行质量比较,并精准识别出较差对话中特定轮次的缺陷类型。这种精巧的对照构造方式,使得评判任务具备明确、可验证的标注标准,为系统性评测 LLM 在复杂交互语境中的判别能力提供了标准化的基准框架。
解决学术问题
该数据集直面现有 LLM 评判基准过度聚焦于单轮问答、缺乏多轮对话复杂性的学术困境。RankJudge 通过注入精心设计的单轮缺陷,并辅以严格的联合正确性评判标准,有效解决了多轮对话评估中标签噪声大、故障归因模糊等核心难题。其 Bradley-Terry 评分机制与动态难度筛选方法,显著提升了评估结果的稳定性与可靠性,为推动自动评估方法论向真实交互场景迈进提供了关键支撑。
衍生相关工作
围绕 RankJudge 已涌现出多项具有启发性的衍生工作。研究者基于其多轮缺陷注入框架,拓展至信息检索中的深度问答验证领域。部分工作借鉴其动态难度筛选策略,发展出低噪声自动评估管线。此外,利用 RankJudge 的训练数据微调小型评判模型、提升其多轮判别能力的探索亦初见成效,推动了 LLM-as-Judge 研究方向从单轮简约评价向多电复杂交互评判的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务