遇见数据集

VERDICTSPairwise

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

VERDICTS: Pairwise 是一个人工标注的成对模型响应比较数据集,专门用于评估大语言模型(LLM)作为评判者的能力。该数据集中的每个样本包含两个不同模型(model_a 和 model_b)对同一问题的回答,问题来自 BFF-Bench 或 (C)MT-Bench 基准。胜者(winner)由人工标注确定。数据集字段包括:问题ID(qid)、轮次(turn)、来源数据集(dataset)、模型名称(model_a 和 model_b)、每个模型的完整对话历史(model_a_conv 和 model_b_conv,每条记录包含内容 content 和角色 role)、问题文本(question)、模型回答(model_a_response 和 model_b_response)以及参考答案(ref_answer)。训练集共包含 604 个样本,数据集大小约为 6.3 MB。该数据集可用于研究 LLM 作为评判者的可靠性、训练偏好模型或进行人工与自动评估的对比分析。

VERDICTS: Pairwise is a human-annotated pairwise model response comparison dataset, specifically designed for evaluating the ability of large language models (LLMs) as judges. Each sample in this dataset contains responses from two different models (model_a and model_b) to the same question, where questions are sourced from BFF-Bench or (C)MT-Bench benchmarks. The winner is determined by human annotation. Dataset fields include: question ID (qid), turn, source dataset (dataset), model names (model_a and model_b), complete conversation history for each model (model_a_conv and model_b_conv, each record containing content and role), question text (question), model responses (model_a_response and model_b_response), and reference answer (ref_answer). The training set contains 604 samples, and the dataset size is approximately 6.3 MB. This dataset can be used to study the reliability of LLMs as judges, train preference models, or conduct comparative analysis between human and automatic evaluations.

创建时间:
2026-08-10
原始信息汇总

VERDICTS: Pairwise 数据集详情

数据集概览

VERDICTS: Pairwise 是一个用于评估"LLM作为裁判"(LLM-as-a-judge)能力的人类标注数据集,专注于模型响应的成对比较。

数据集内容

  • 核心任务:每一行数据将两个模型(model_amodel_b)针对同一问题(来自 BFF-Bench 或 (C)MT-Bench)的回答进行成对比较。
  • 标注方式winner 字段由人类标签得出,标识两个模型中哪个回答更优。
  • 相关数据集:点级(pointwise)标签可参见 kensho/VERDICTS 数据集。

数据规模与结构

  • 总样本数:604 条(训练集)
  • 数据集大小:约 6.33 MB(下载大小约 4.34 MB)
  • 数据划分:仅包含训练集(train)

字段说明

字段名 类型 描述
qid 字符串 问题标识符
turn 整数 对话轮次
dataset 字符串 来源数据集(bffbench 或 mtbmr)
model_a / model_b 字符串 参与比较的两个模型名称
winner 字符串 人类标注的胜出模型
model_a_conv / model_b_conv 列表 模型对话记录(含内容与角色)
question 字符串 原始问题
model_a_response / model_b_response 字符串 两个模型的回答
ref_answer 字符串 参考答案

许可与引用

  • 许可证:Apache 2.0
  • 相关论文No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding(arXiv:2503.05061),作者包括 Michael Krumdick、Charles Lovering、Varshini Reddy、Seth Ebner 和 Chris Tanner。
搜集汇总
数据集介绍
VERDICTSPairwise 数据集图片
构建方式
VERDICTSPairwise数据集构建于大型语言模型(LLM)评估领域,旨在弥补自动评估中缺乏人类基准的不足。其数据源自两个具有代表性的基准测试集:BFF-Bench和(C)MT-Bench,选取其中问题,配对两个模型(model_a与model_b)生成回答,并记录完整对话流(model_a_conv、model_b_conv)及参考答案(ref_answer)。人类标注者为每对回答判定胜负,生成`winner`字段,作为LLM-as-a-judge评估的黄金标准。数据集共包含604个训练样本,每个样本均含qid、turn、dataset等元数据,确保来源可追溯。通过此构建流程,VERDICTSPairwise实现了对模型比较判断的结构化、多维度数据捕获,为评估器校准提供了坚实基础。
使用方法
使用VERDICTSPairwise时,研究者可将模型对作为输入,设计评估器预测胜负,并与人类`winner`标签对比,计算准确率或一致性指标。典型应用包括微调裁判模型、基准测试LLM-as-a-judge的鲁棒性,或分析特定基准上的偏见模式。数据集的字段结构支持直接加载至Pandas或HuggingFace datasets库,便于快速集成至现有训练管道。引用配套论文(arXiv:2503.05061)可获取详细实验设计,指导实验变体(如单侧参考启用)。该数据集亦适合教学示例,演示人类偏好如何锚定自动评估体系。
背景与挑战
背景概述
随着大语言模型(LLM)在自然语言处理领域的广泛应用,如何公正、高效地评估其生成质量成为研究焦点。传统的自动评估指标难以捕捉语义细微差异,而人工评估成本高昂且可扩展性差,因此LLM-as-a-judge范式应运而生,即利用强大语言模型对候选响应进行评判。然而,这类自动评判器的可靠性和偏差问题尚待深入探究。VERDICTSPairwise数据集由Kensho Technologies的研究团队于2025年创建,核心成员包括Michael Krumdick、Charles Lovering、Varshini Reddy等,旨在通过人类标注的成对比较数据,系统评估LLM-as-a-judge的局限性。该数据集基于BFF-Bench和(C)MT-Bench的604个问题,每个问题包含两个模型响应及对应的专家人类评判胜负,覆盖了多轮对话场景,为研究自动评判与人类判断的一致性提供了宝贵资源。其发布推动了LLM评估方法的可信度研究,对构建更稳健、更贴合人类偏好的自动评估体系具有重要参考价值。
当前挑战
VERDICTSPairwise数据集所面临的挑战首先体现在其背后的领域问题上:LLM-as-a-judge尽管高效,却常受限于模型自身的偏好偏差、上下文长度限制及推理能力短板,导致评判结果与人类判断存在分歧。该数据集旨在量化这种分歧,为改进自动评判提供基础,但挑战在于如何设计能充分暴露这些局限性的对比任务,以及选择具有代表性的模型组合和问题集,以确保数据集能全面反映真实应用场景的复杂性。其次,在数据集构建过程中,挑战尤为严峻:需要收集大量高质量的人工标签,这涉及标注者的选取、标注指南的制定,以及保证跨标注者的一致性;同时,数据的质量控制、隐私问题(如涉及用户对话)和成本控制也是难点。此外,从模型响应、人类评判到最终数据格式的标准化处理,需要精细的清洗和验证流程,以防噪声引入偏差。这些问题共同构成了数据集从设计到发布过程中的重大障碍,亦为后续研究指明了优化方向。
常用场景
经典使用场景
VERDICTSPairwise数据集的核心用途在于为大型语言模型(LLM)作为评判者的评估框架提供人工标注的成对比较基准。该数据集汇聚了BFF-Bench与(C)MT-Bench两大评测基准中的问题,将两个模型的响应并置,并附上基于人类判断的胜者标签,从而构建了一个严谨的、可复现的评估环境。研究者可借此直接衡量不同LLM在评判任务中的一致性、准确性和偏差,是验证LLM-as-a-judge范式有效性的关键资源。
解决学术问题
该数据集直面LLM-as-a-judge缺乏人类监督这一核心缺陷,系统性地解决了一个关键学术难题:即自动评估模型是否能够可靠地替代人类评判。通过提供多源问题、多模型响应及客观人类胜负判定,VERDICTSPairwise使得研究者能够量化LLM评判的偏差、噪声及局限性,促进了对自动评估机制信任度的审慎审视。其意义在于推动开发更稳健、更具人类对齐性的评估协议,为自然语言处理领域中的模型评测方法论奠定了实证基础。
实际应用
在实际应用中,VERDICTSPairwise可服务于模型开发与迭代的全流程。在模型调优阶段,工程师可利用该数据集作为验证集,快速检测新模型在成对比较中的优劣,而无需冗长的人工评审。此外,该数据集也适用于构建自动化评估流水线,作为基准以校准LLM评判者的偏好,从而优化奖励模型的训练。对于AI安全与对齐研究,它提供了一种手段来监控模型响应质量漂移,确保部署前的模型在关键维度上符合人类期望。
数据集最近研究
最新研究方向
VERDICTS-Pairwise数据集聚焦于人类标注的模型响应成对比较,旨在为LLM-as-a-Judge评估范式提供不可或缺的基准。其最新研究动向集中于利用该数据集揭示大语言模型在无人类监督情况下评判的固有局限性,强调人类标注的不可替代性。前沿工作通过分析不同模型对在复杂指令(如BFF-Bench的约束性任务和MT-Bench的多轮对话)上的胜出关系,深入探究裁判模型与人类偏好的一致性,并据此优化自动评估协议。该数据集的应用推动了更为严谨的模型评估框架的构建,对确保人工智能系统的可信与安全具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务