VERDICTS
收藏资源简介:
VERDICTS数据集包含对人类标注的模型回答正确性数据,用于评估大语言模型作为裁判(LLM-as-a-judge)的性能。每个样本对应一个模型对来自BFF-Bench或( C)MT-Bench问题的回答,并附有人的标签(label)。数据集字段包括:问题ID(qid)、对话ID(cid)、轮次(turn)、模型名称(model)、标签(label)、时间(time)、来源数据集(dataset)以及完整对话历史(conv,包含content和role)。训练集包含3600个样本。该数据集可用于LLM-as-a-judge的评估与基准测试,许可证为Apache-2.0。
The VERDICTS dataset contains human-annotated correctness data of model responses, used to evaluate the performance of LLM-as-a-judge. Each sample corresponds to a models response to a question from BFF-Bench or (C)MT-Bench, along with a human label. The dataset fields include: question ID (qid), conversation ID (cid), turn, model name, label, time, source dataset, and complete conversation history (conv, including content and role). The training set contains 3600 samples. This dataset can be used for evaluation and benchmarking of LLM-as-a-judge, licensed under Apache-2.0.
VERDICTS 数据集概述
基本信息
- 许可证:Apache-2.0
- 数据集大小:约 12.19 MB(下载大小约 11.98 MB)
- 数据集划分:仅包含训练集(train),共 3600 条样本
数据集内容
VERDICTS 数据集用于评估 LLM 作为裁判(LLM-as-a-judge)的可靠性,包含人类对模型回答正确性的标注。每条数据记录了一个模型对某个问题的回答及其对应的人类标签。
数据来源
数据来源于两个基准数据集:
- BFF-Bench(标识为
bffbench) - (C)MT-Bench(标识为
mtbmr)
特征字段
每条数据包含以下字段:
qid(字符串):问题标识符cid(字符串):对话标识符turn(整数):对话轮次model(字符串):生成回答的模型名称label(字符串):人类标注的正确性标签time(浮点数):时间信息dataset(字符串):来源数据集标识(bffbench或mtbmr)conv(列表):对话内容,包含content(字符串)和role(字符串)两个子字段
关联数据集
该数据集还提供成对比较版本:kensho/VERDICTSPairwise,用于需要成对比较的场景。
引用信息
该数据集相关论文为《No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding》,发表于 arXiv(编号:2503.05061)。





