遇见数据集

LongJudgeBench

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

LongJudgeBench是由清华大学和北京科技大学联合创建的长文本输出评估基准,旨在系统评估大语言模型作为裁判在长文本生成任务中的可靠性。该数据集包含1944个实例,涵盖深度研究、科学综述、创意写作、长链分析和系统综述五大现实场景,平均输出长度达9249.7个token,数据来源于六个异构数据集并经过专家标注规范化处理。数据集通过整合多语言文档和多样化评估协议,模拟真实世界文档级评估需求,其核心应用在于揭示当前LLM裁判在长文本评估中的可靠性差距,推动开发更鲁棒、上下文感知且与人类对齐的自动评估方法。

LongJudgeBench is a long-text output evaluation benchmark jointly created by Tsinghua University and University of Science and Technology Beijing, aiming to systematically evaluate the reliability of large language models (LLMs) acting as judges in long-text generation tasks. This dataset contains 1944 instances, covering five realistic scenarios: in-depth research, scientific review, creative writing, long-chain analysis and systematic review. The average output length reaches 9249.7 tokens. The dataset is derived from six heterogeneous datasets and has been standardized via expert annotation. By integrating multilingual documents and diverse evaluation protocols, it simulates the real-world document-level evaluation demands. Its core application lies in revealing the reliability gap of current LLM judges in long-text evaluation, and promoting the development of more robust, context-aware and human-aligned automatic evaluation methods.

创建时间:
2026-06-01
原始信息汇总

LongJudgeBench 数据集详情

概述

LongJudgeBench 是针对长文本输出评估场景下,衡量“LLM作为评判者”(LLM-as-a-Judge)可靠性的首个专用元评估基准。数据集覆盖5个实际场景(深度研究报告评分、文档质量评估、写作偏好比较、医学元分析、综述生成),包含6个子数据集,平均输出长度超过9,000个token。所有数据采用统一评估模式并配有高质量专家标注参考判断。

数据集组成

数据集 评估模式 语言 文档数 平均Token数 任务描述
deepresearch_bench pointwise 中文 200 18,013 深度研究报告评分(4个加权维度)
realdr pointwise 英文/中文 640 10,131 文档质量评分(3个加权维度)
verify_bench_hard pointwise 英文 316 3,053 二元验证(是/否)
wp_bench pairwise 英文/中文 526(263对×2) 3,509 写作偏好比较
ma pairwise 英文 120 4,764 医学元分析比较(洞察维度)
surge listwise 英文 164(41主题×4) 28,758 计算机科学综述生成排序

关键发现

可靠性差异

  • 不同模型和数据集的成对准确率差异显著,范围约为55%(接近随机)到85%。
  • 没有哪个评判者是普遍可靠的。

长度影响

  • 大多数数据集上,输出越长准确率越低。在realdr和verify_bench_hard数据集上,最长四分位(Q4)的准确率低于60%。
  • 长度与评判准确率的关系是数据集特异性的:realdr、surge(内容和结构维度)、verify呈现单调递减趋势;deepresearch_bench呈现倒U型模式;wp_bench呈微弱正向趋势;ma无显著关系。

提示模式效果

  • 参考模式(reference)在verify_bench_hard上提升了准确率(70.9% → 82.3%),但在wp_bench上反而下降(75.3% → 65.2%)。
  • 效果取决于任务特性。

主要失败模式

  1. 粗粒度语义匹配:裁判按关键词匹配而非验证概念一致性。例如在Streamable HTTP案例中,Qwen3-Max因关键词重叠给出了8.85分,而人工评分仅为5.37分。
  2. 评估需求不匹配:裁判评估表面主题覆盖度,人类评估精确任务完成度。在高斯电场案例中,裁判给9.26分(基于表面覆盖),人类仅给5.87分(因未聚焦具体问题)。
  3. 其他模式:规则集僵化(如deepseek-v4-flash使用清单式规则评分偏低)、成对任务中的位置偏差(glm-5.1在ma上的位置偏差高达93.3%)、分数压缩(仅gpt-4o-mini严重,标准差0.55 vs 人工1.22)、特定任务盲区(verify_bench_hard中14.9%的案例所有8个裁判均错误)。

评估配置

评估模式

  • pointwise:对每个回答独立评分(0-10或0/1),适用于deepresearch_bench、realdr、verify_bench_hard
  • pairwise:比较两个回答,选择偏好A/B,适用于wp_bench、ma
  • listwise:对多个回答进行排序(点式评分+排序),适用于surge

提示变体

每个数据集支持4种提示模式:

  • vanilla:基础评分指令
  • rubric:带标准列表的维度评分
  • reference:提供参考文章进行评分
  • rubric_reference:评分标准+参考结合

评估指标

  • 成对准确率(pairwise ACC)
  • Spearman相关系数
  • Kendalls τ

数据格式

标准化数据采用统一的JSONL模式,包含以下字段:

  • dataset:数据集名称
  • id:唯一标识符
  • instruction:任务提示
  • responses:回应列表(包含模型名称和内容)
  • ground_truth:真实标签(格式因评估模式而异)
  • meta:元信息(语言、任务类型、来源)

项目结构

  • config/:评估配置和提示模板
  • data/:原始数据集
  • data_standardized/:标准化JSONL数据
  • ground_truth/:真实标签
  • src/evaluation/:评估流水线和数据集适配器
  • src/judge/:裁判实现(点式/成对/列表式)
  • src/reliability/:一致性指标计算
  • src/length_analysis/:长度敏感性分析
  • src/case_study/:失败模式案例研究
  • scripts/:Shell启动脚本
  • outputs/:评估输出(运行时生成)
搜集汇总
数据集介绍
LongJudgeBench 数据集图片
构建方式
LongJudgeBench的构建旨在弥补现有LLM评判基准在长文本输出评估上的空白。研究团队首先从五个真实世界场景(深度研究、科学综述、创意写作、长链分析和系统评价)中选取了六个数据集,包括DeepResearch Bench、RealDeepResearch、SurGE、WritingPreferenceBench、VerifyBench和MA。每个实例被规范化为统一的格式,包含指令、内容和响应三个组件。其中,指令指定了评判上下文,内容为待评估的长文本候选输出,响应则包含参考评判。所有参考评判均来自专家注释,包括直接打分、偏好标注、排序和参考验证,并经过了严格的质量控制。最终,LongJudgeBench包含了1,944个实例,候选输出平均长度为9,249.7个token,远超过现有基准的几百个token。
特点
LongJudgeBench的核心特点在于其针对长文本评估的全面性和真实性。与现有聚焦于短文本输出的基准不同,该基准候选输出的平均长度超过9,000个token,且涵盖了多种评估协议(点式、成对、列表式)。更重要的是,它涉及文档级别的复杂评估需求,如整体组织结构、跨章节一致性、多子主题的覆盖深度等。此外,基准集成了多样的任务难度和语言(中英文),并提供了任务特定的评估协议和专家参考评判,使得评估更接近真实世界的长文本评价场景。实验结果表明,现有LLM评判方法在LongJudgeBench上表现不稳定,且不同模型和场景间差异显著,凸显了长文本评判的挑战性。
使用方法
使用LongJudgeBench时,研究者可以系统性地评估多种LLM评判器的可靠性。具体而言,需将待评估的LLM评判器与不同的评判设置(如普通提示、基于评分标准、基于参考、及两者结合)进行组合。每个实例包含指令、待评估的长文本输出及专家参考评判。评判器的输出需与参考评判进行对比,通过准确率、Spearman秩相关系数和Kendall's τb等指标计算一致性。为减少位置偏差,成对评估时需交换答案顺序并取平均值。研究者可根据需要选择特定的数据集、场景或评判协议进行针对性分析,从而评估LLM评判器在不同长文本评估任务中的表现。
背景与挑战
背景概述
随着大语言模型在深度研究、科学综述与创意写作等长文本生成任务中的广泛应用,如何可靠地评估其长格式输出已成为一项核心挑战。现有的LLM-as-a-Judge元评估基准主要聚焦于短文本输出,其候选回答平均长度不足500 token,难以反映长文本评估中涉及的文档级质量需求,如整体结构组织、跨章节一致性与多子主题的覆盖深度。为填补这一空白,清华大学计算机科学与技术系的研究团队联合北京科技大学,于2025年发布了LongJudgeBench基准。该基准涵盖深度研究、科学综述、创意写作、长链分析与系统综述五大真实场景,整合六个数据集,包含近2000个实例,平均输出长度超过9000 token,并配有专家标注的参考判断,为系统评估LLM法官在长文本场景中的可靠性提供了重要平台。
当前挑战
LongJudgeBench揭示了当前LLM法官在长文本评估中面临的多重挑战:首先,法官易被长文本的表面覆盖与结构化外观所迷惑,将泛泛的背景知识视为实质性回答,导致对未真正回应用户核心需求的输出给出虚高分数;其次,在领域特定场景中,法官常出现概念误判,例如混淆技术实现中的关键概念,尤其在医疗等高专业度任务中表现尤为突出;此外,法官还存在位置偏差、长度偏差等系统性偏见,其判断易受候选输出顺序等无关因素影响。在基准构建过程中,团队亦面临多元评价协议统一化、跨语言文档格式保留、以及专家标注成本高昂等现实困难,最终投入约2260美元完成高质量标注。这些结果表明,构建鲁棒、上下文感知且与人类对齐的LLM法官仍是亟需攻克的难题。
常用场景
经典使用场景
LongJudgeBench 专为评估大语言模型作为评判者(LLM-as-a-judge)在长文本输出场景中的可靠性而设计。其经典使用场景涵盖五大真实世界应用:深度研究报告评估、科学综述生成、创意写作偏好判断、长链推理分析验证以及系统性医学综述评价。每个场景均包含平均超过9000个令牌的长文本候选输出,并配备专家标注的参考判断,使得研究者能够在多维度、跨语言、多协议的评价框架下,系统性地衡量不同LLM评判模型在长文档级评估任务中的表现。
衍生相关工作
LongJudgeBench 的发布推动了多项相关工作的衍生与发展。在模型层面,研究者基于其场景多样性探索了检索增强评判、多智能体协作评判和校准式评判等新型架构;在方法论层面,该数据集催生了对位置偏差、长度偏差及安全策略拒绝等系统性问题更加深入的分析研究。此外,该基准还启发了长格式奖励模型评估(如 Long-form RewardBench)的改进方向,促使学界将注意力从短文本转向更具挑战性的长文档评价范式,进一步推动了LLM评判方法的标准化与透明化进程。
数据集最近研究
最新研究方向
LongJudgeBench的提出标志着大语言模型长文本输出评估领域的重要突破。当前前沿研究聚焦于LLM-as-a-Judge范式在长文本场景下的可靠性验证,该基准覆盖深度研究、科学综述、创意写作等真实场景,揭示出当前LLM裁判在长文本评估中存在显著的可靠性鸿沟——即使借助评分标准或参考答案,其判断稳定性仍显不足。这一发现直接呼应了生成式AI向长文档、多维度输出发展的技术趋势,推动学界从短文本评分向文档级一致性、跨章节逻辑连贯性等复杂评估范式转型。研究证实,单纯增加输出长度并非主要挑战,评估目标的显式性、结构化程度与客观性才是决定裁判性能的核心变量。该基准的建立为开发更鲁棒、更具场景感知能力的人类对齐评估方法提供了关键测试平台,有望重塑长文本生成系统的质量监控标准。
相关研究论文
  • 1
    Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation清华大学·计算机科学与技术系; 北京科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务