XL-DocBench
收藏资源简介:
XL-DocBench 是一个用于评估多文档和超长文档理解的证据推理基准。数据集包含 1,345 个由 194 位人类专家验证的问答对,覆盖 292 个文档,涵盖六个专业领域。其中,单文档问答有 1,191 个,跨文档问答有 154 个。数据集旨在测试系统在超长文档(上下文可达 2,935 页)中寻找证据、组合支持、应用规则并判断何时应放弃回答的能力。数据集中包含 975 个(76.2%)需要多页证据的问题,429 个(31.9%)问题涉及多模态证据,188 个问题要求答案为 None。数据集提供了四个配置:single_doc(单文档问答)、cross_doc(跨文档问答)、documents(文档元数据)、scores(评估结果)。评估指标包括基于规则的 Accuracy、Token-level F1 和 ANLS。数据集包含详细的记录结构,包括问题、答案、文档、证据页面和元数据。
XL-DocBench is a benchmark for evaluating evidence reasoning in multi-document and ultra-long document understanding. The dataset contains 1,345 question-answer pairs verified by 194 human experts, covering 292 documents across six professional domains. Among them, there are 1,191 single-document QA pairs and 154 cross-document QA pairs. The dataset aims to test the systems ability to find evidence, combine support, apply rules, and decide when to abstain from answering in ultra-long documents (context up to 2,935 pages). The dataset includes 975 (76.2%) questions requiring multi-page evidence, 429 (31.9%) questions involving multimodal evidence, and 188 questions requiring the answer to be None. The dataset provides four configurations: single_doc (single-document QA), cross_doc (cross-document QA), documents (document metadata), and scores (evaluation results). Evaluation metrics include rule-based Accuracy, Token-level F1, and ANLS. The dataset contains detailed record structures, including questions, answers, documents, evidence pages, and metadata.
数据集概述
XL-DocBench 是一个用于评估模型在超长文档上基于证据进行推理能力的基准测试,问题需在数百上千页文档中寻找证据、整合支持信息并正确应用规则。该数据集包含 1,345 条问答记录,覆盖 292 份文档,全部由 194 位人类专家验证,属于保守发布版本,已剔除所有涉及“RAG: Not Approved”来源URL的问题。
基本信息
- 语言:英语 (en)
- 许可证:其他 (other)
- 任务类别:问答 (question-answering)
- 标签:文档理解、长上下文、多模态文档AI、跨文档问答、基准测试
- 规模:1K < n < 10K
- 作者机构:武汉大学、微软
数据集构成
QA数据
| 类型 | 数量 |
|---|---|
| 单文档问答 | 1,191 |
| 跨文档问答 | 154 |
| 总计 | 1,345 |
配置与文件
- single_doc:
data/qa_single_doc.jsonl,包含1,191个单文档问题 - cross_doc:
data/qa_cross_doc.jsonl,包含154个跨文档问题 - documents:
data/documents.jsonl,保留文档元数据和来源URL - scores:
results/scores.jsonl,包含13个可复现系统逐题得分
另包含 manifest.json(发布统计)、results/summary.json(聚合分数)、code/ 目录(快速测试与评估器代码)。
数据核心特性
- 证据页数:1,280条可解析历史人工页码标注中,975条(76.2%)使用多个证据页
- 多模态证据:429个问题(31.9%)的发布支持证据为多模态
- 跨文档情境:154个问题(11.4%)使用跨文档上下文
- 不可回答:188个问题要求输出
None答案 - 上下文长度:完整系列上下文最长可达2,935页
- 专业领域:覆盖六个专业领域
评估与基准表现
评估器输出基于规则的准确性(Accuracy)、Token级F1 和 ANLS,缺失、失败和无法解析的预测均计为不正确。官方榜单中表现最好的系统为 GPT-5.4(OCR输入),准确率达 38.36%,Token F1 为 39.70%。前五名表现如下:
| 排名 | 系统 | 输入类型 | Accuracy | Token F1 | ANLS |
|---|---|---|---|---|---|
| 1 | GPT-5.4 | OCR | 38.36 | 39.70 | 34.17 |
| 2 | SimpleDoc + GPT-5.4 | Agent | 36.21 | 33.62 | 24.30 |
| 3 | Kimi-K2.5 | OCR | 36.06 | 38.24 | 32.64 |
| 4 | MDocAgent + GPT-5.4 | Agent | 31.82 | 30.58 | 22.64 |
| 5 | GPT-5.2 | OCR | 31.15 | 33.69 | 28.51 |
记录结构
每条问答记录包含:
- answer: 答案值、格式与验证规则
- document / documents: document_id + 公共URL、evidence_pages(PDF页索引)、evidence_items(注释定位器+页码+摘录类型)
- metadata: 领域、难度、推理类型、可回答性
源文档通过公共URL引用而非重新分发,PDF二进制文件和本地文件名不包含在发布中。




