LongJudgeBench
收藏资源简介:
LongJudgeBench是由清华大学和北京科技大学联合创建的长文本输出评估基准,旨在系统评估大语言模型作为裁判在长文本生成任务中的可靠性。该数据集包含1944个实例,涵盖深度研究、科学综述、创意写作、长链分析和系统综述五大现实场景,平均输出长度达9249.7个token,数据来源于六个异构数据集并经过专家标注规范化处理。数据集通过整合多语言文档和多样化评估协议,模拟真实世界文档级评估需求,其核心应用在于揭示当前LLM裁判在长文本评估中的可靠性差距,推动开发更鲁棒、上下文感知且与人类对齐的自动评估方法。
LongJudgeBench is a long-text output evaluation benchmark jointly created by Tsinghua University and University of Science and Technology Beijing, aiming to systematically evaluate the reliability of large language models (LLMs) acting as judges in long-text generation tasks. This dataset contains 1944 instances, covering five realistic scenarios: in-depth research, scientific review, creative writing, long-chain analysis and systematic review. The average output length reaches 9249.7 tokens. The dataset is derived from six heterogeneous datasets and has been standardized via expert annotation. By integrating multilingual documents and diverse evaluation protocols, it simulates the real-world document-level evaluation demands. Its core application lies in revealing the reliability gap of current LLM judges in long-text evaluation, and promoting the development of more robust, context-aware and human-aligned automatic evaluation methods.
LongJudgeBench 数据集详情
概述
LongJudgeBench 是针对长文本输出评估场景下,衡量“LLM作为评判者”(LLM-as-a-Judge)可靠性的首个专用元评估基准。数据集覆盖5个实际场景(深度研究报告评分、文档质量评估、写作偏好比较、医学元分析、综述生成),包含6个子数据集,平均输出长度超过9,000个token。所有数据采用统一评估模式并配有高质量专家标注参考判断。
数据集组成
| 数据集 | 评估模式 | 语言 | 文档数 | 平均Token数 | 任务描述 |
|---|---|---|---|---|---|
| deepresearch_bench | pointwise | 中文 | 200 | 18,013 | 深度研究报告评分(4个加权维度) |
| realdr | pointwise | 英文/中文 | 640 | 10,131 | 文档质量评分(3个加权维度) |
| verify_bench_hard | pointwise | 英文 | 316 | 3,053 | 二元验证(是/否) |
| wp_bench | pairwise | 英文/中文 | 526(263对×2) | 3,509 | 写作偏好比较 |
| ma | pairwise | 英文 | 120 | 4,764 | 医学元分析比较(洞察维度) |
| surge | listwise | 英文 | 164(41主题×4) | 28,758 | 计算机科学综述生成排序 |
关键发现
可靠性差异
- 不同模型和数据集的成对准确率差异显著,范围约为55%(接近随机)到85%。
- 没有哪个评判者是普遍可靠的。
长度影响
- 大多数数据集上,输出越长准确率越低。在realdr和verify_bench_hard数据集上,最长四分位(Q4)的准确率低于60%。
- 长度与评判准确率的关系是数据集特异性的:realdr、surge(内容和结构维度)、verify呈现单调递减趋势;deepresearch_bench呈现倒U型模式;wp_bench呈微弱正向趋势;ma无显著关系。
提示模式效果
- 参考模式(reference)在verify_bench_hard上提升了准确率(70.9% → 82.3%),但在wp_bench上反而下降(75.3% → 65.2%)。
- 效果取决于任务特性。
主要失败模式
- 粗粒度语义匹配:裁判按关键词匹配而非验证概念一致性。例如在Streamable HTTP案例中,Qwen3-Max因关键词重叠给出了8.85分,而人工评分仅为5.37分。
- 评估需求不匹配:裁判评估表面主题覆盖度,人类评估精确任务完成度。在高斯电场案例中,裁判给9.26分(基于表面覆盖),人类仅给5.87分(因未聚焦具体问题)。
- 其他模式:规则集僵化(如deepseek-v4-flash使用清单式规则评分偏低)、成对任务中的位置偏差(glm-5.1在ma上的位置偏差高达93.3%)、分数压缩(仅gpt-4o-mini严重,标准差0.55 vs 人工1.22)、特定任务盲区(verify_bench_hard中14.9%的案例所有8个裁判均错误)。
评估配置
评估模式
- pointwise:对每个回答独立评分(0-10或0/1),适用于deepresearch_bench、realdr、verify_bench_hard
- pairwise:比较两个回答,选择偏好A/B,适用于wp_bench、ma
- listwise:对多个回答进行排序(点式评分+排序),适用于surge
提示变体
每个数据集支持4种提示模式:
vanilla:基础评分指令rubric:带标准列表的维度评分reference:提供参考文章进行评分rubric_reference:评分标准+参考结合
评估指标
- 成对准确率(pairwise ACC)
- Spearman相关系数
- Kendalls τ
数据格式
标准化数据采用统一的JSONL模式,包含以下字段:
dataset:数据集名称id:唯一标识符instruction:任务提示responses:回应列表(包含模型名称和内容)ground_truth:真实标签(格式因评估模式而异)meta:元信息(语言、任务类型、来源)
项目结构
config/:评估配置和提示模板data/:原始数据集data_standardized/:标准化JSONL数据ground_truth/:真实标签src/evaluation/:评估流水线和数据集适配器src/judge/:裁判实现(点式/成对/列表式)src/reliability/:一致性指标计算src/length_analysis/:长度敏感性分析src/case_study/:失败模式案例研究scripts/:Shell启动脚本outputs/:评估输出(运行时生成)

- 1Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation清华大学·计算机科学与技术系; 北京科技大学 · 2026年



