遇见数据集

VERDICTS

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

VERDICTS数据集包含对人类标注的模型回答正确性数据,用于评估大语言模型作为裁判(LLM-as-a-judge)的性能。每个样本对应一个模型对来自BFF-Bench或( C)MT-Bench问题的回答,并附有人的标签(label)。数据集字段包括:问题ID(qid)、对话ID(cid)、轮次(turn)、模型名称(model)、标签(label)、时间(time)、来源数据集(dataset)以及完整对话历史(conv,包含content和role)。训练集包含3600个样本。该数据集可用于LLM-as-a-judge的评估与基准测试,许可证为Apache-2.0。

The VERDICTS dataset contains human-annotated correctness data of model responses, used to evaluate the performance of LLM-as-a-judge. Each sample corresponds to a models response to a question from BFF-Bench or (C)MT-Bench, along with a human label. The dataset fields include: question ID (qid), conversation ID (cid), turn, model name, label, time, source dataset, and complete conversation history (conv, including content and role). The training set contains 3600 samples. This dataset can be used for evaluation and benchmarking of LLM-as-a-judge, licensed under Apache-2.0.

创建时间:
2026-08-10
原始信息汇总

VERDICTS 数据集概述

基本信息

  • 许可证:Apache-2.0
  • 数据集大小:约 12.19 MB(下载大小约 11.98 MB)
  • 数据集划分:仅包含训练集(train),共 3600 条样本

数据集内容

VERDICTS 数据集用于评估 LLM 作为裁判(LLM-as-a-judge)的可靠性,包含人类对模型回答正确性的标注。每条数据记录了一个模型对某个问题的回答及其对应的人类标签。

数据来源

数据来源于两个基准数据集:

  • BFF-Bench(标识为 bffbench
  • (C)MT-Bench(标识为 mtbmr

特征字段

每条数据包含以下字段:

  • qid(字符串):问题标识符
  • cid(字符串):对话标识符
  • turn(整数):对话轮次
  • model(字符串):生成回答的模型名称
  • label(字符串):人类标注的正确性标签
  • time(浮点数):时间信息
  • dataset(字符串):来源数据集标识(bffbenchmtbmr
  • conv(列表):对话内容,包含 content(字符串)和 role(字符串)两个子字段

关联数据集

该数据集还提供成对比较版本:kensho/VERDICTSPairwise,用于需要成对比较的场景。

引用信息

该数据集相关论文为《No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding》,发表于 arXiv(编号:2503.05061)。

搜集汇总
数据集介绍
VERDICTS 数据集图片
构建方式
VERDICTS数据集由Kensho研究团队构建,旨在为评估LLM-as-a-judge机制的可靠性提供人工标注基准。其构建过程基于两个知名的多轮对话基准数据集:BFF-Bench与(C)MT-Bench,从中抽取模型响应,并邀请人类标注者对这些响应的正确性进行二元判定。数据集包含3600个训练样本,每个样本记录了问题标识、对话轮次、模型名称、人工标签、耗时、来源数据集以及完整的对话历史,从而系统性地捕捉了不同模型在多样化查询下的表现。
特点
该数据集的核心特征在于其专注于LLM-as-a-judge场景下的人工标签,为自动评估方法的局限性研究提供了关键数据支持。每条数据都包含细粒度的元信息,如对话轮次和模型标识,使得研究者能够分析模型在不同对话阶段的表现差异。此外,数据集的构建兼顾了多样性与均衡性,来源覆盖了通用与专业领域,确保了评估的全面性。其与配套的Pairwise版本共同构成了对点式与配对式评估模式的完整覆盖,为比较不同评估策略提供了独特资源。
使用方法
VERDICTS数据集主要面向自然语言处理研究者,可用于训练和验证自动化评估模型,或作为基准来测试LLM-as-a-judge方法的准确性。使用者可通过HuggingFace平台直接加载训练集,利用其中的对话历史和人工标签进行监督学习或零样本评估。同时,数据集的元数据字段(如模型、轮次)支持分层分析,有助于深入探究评估偏差的来源。该数据集采用Apache-2.0许可,便于学术与商业应用,其配套的Pairwise版本则适用于偏好学习或配对比较实验。
背景与挑战
背景概述
VERDICTS数据集由Kensho Technologies的研究团队于2025年创建,主要研究人员包括Michael Krumdick、Charles Lovering等,旨在为评估大型语言模型(LLM)作为评判者的可靠性提供人工标注基准。该数据集基于BFF-Bench和(C)MT-Bench两个问答集,涵盖3600个模型响应样本,每项均包含人工正确性标注,核心研究问题在于探究LLM评判与人类判断的一致性。在LLM评估领域,该数据集首次系统性地揭示了LLM评判的局限性,为后续研究提供了关键的实证基础,对提升模型评估的准确性和可信度具有重要影响力,已发表于arXiv并受到广泛关注。
当前挑战
构建过程中面临多重挑战:首先,领域问题在于LLM作为评判者时可能产生偏差或错误,需通过人工标注来揭示这些偏差,但人工标注成本高昂且耗时。其次,构建过程中需确保标注的准确性和一致性,通过设计标注规范并筛选标注人员以降低主观差异,同时需处理多轮对话的复杂性和跨数据集的异质性。此外,时间维度上的标注(如响应时间)增加了数据收集的复杂性,需协调不同模型和数据集,确保标签分布的平衡性。这些挑战使得构建高质量人工基准成为艰巨任务,但VERDICTS成功克服了这些难题,为后续研究提供了宝贵资源。
常用场景
经典使用场景
VERDICTS数据集的核心用途在于为“大语言模型作为裁判”(LLM-as-a-judge)这一新兴范式提供人工标注的评判基准。该数据集汇聚了来自BFF-Bench与(C)MT-Bench两大基准的模型响应,每个样本均附带人类对响应正确性的精细标签,从而构建了一个高可信度的金标准集合。研究者得以借此深入评估各类裁判模型(如GPT-4等)在自动评估任务中的准确性、偏见与泛化能力,是验证自动评估方法有效性的关键试金石。
实际应用
在实际应用中,VERDICTS为模型开发与部署中的质量监控提供了关键支撑。研发团队可利用该数据集对自家或第三方裁判模型进行校准与审计,识别并修正其评估偏差,从而提升自动化评估管线在模型选型、RLHF训练及在线评测中的可靠性。此外,该数据集也可用于训练更为精准的评判器模型,以替代昂贵且耗时的人类反馈,加速迭代流程,具有显著的工业应用价值。
衍生相关工作
该数据集衍生出一系列围绕LLM-as-a-judge校准与改进的研究工作。基于其揭示的局限性,研究者们探索了多种缓解策略,如引入对比学习框架来增强裁判模型的区分能力,或设计去偏算法以消除固有偏好。此外,相关工作还涉及构建更优化的提示词模板、开发针对裁判模型的自适应训练方法,以及将人工标注知识迁移至无监督评估场景。这些衍生工作共同推动了自动评估领域向更高精度与强鲁棒性方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务