遇见数据集

XL-DocBench

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

XL-DocBench 是一个用于评估多文档和超长文档理解的证据推理基准。数据集包含 1,345 个由 194 位人类专家验证的问答对,覆盖 292 个文档,涵盖六个专业领域。其中,单文档问答有 1,191 个,跨文档问答有 154 个。数据集旨在测试系统在超长文档(上下文可达 2,935 页)中寻找证据、组合支持、应用规则并判断何时应放弃回答的能力。数据集中包含 975 个(76.2%)需要多页证据的问题,429 个(31.9%)问题涉及多模态证据,188 个问题要求答案为 None。数据集提供了四个配置:single_doc(单文档问答)、cross_doc(跨文档问答)、documents(文档元数据)、scores(评估结果)。评估指标包括基于规则的 Accuracy、Token-level F1 和 ANLS。数据集包含详细的记录结构,包括问题、答案、文档、证据页面和元数据。

XL-DocBench is a benchmark for evaluating evidence reasoning in multi-document and ultra-long document understanding. The dataset contains 1,345 question-answer pairs verified by 194 human experts, covering 292 documents across six professional domains. Among them, there are 1,191 single-document QA pairs and 154 cross-document QA pairs. The dataset aims to test the systems ability to find evidence, combine support, apply rules, and decide when to abstain from answering in ultra-long documents (context up to 2,935 pages). The dataset includes 975 (76.2%) questions requiring multi-page evidence, 429 (31.9%) questions involving multimodal evidence, and 188 questions requiring the answer to be None. The dataset provides four configurations: single_doc (single-document QA), cross_doc (cross-document QA), documents (document metadata), and scores (evaluation results). Evaluation metrics include rule-based Accuracy, Token-level F1, and ANLS. The dataset contains detailed record structures, including questions, answers, documents, evidence pages, and metadata.

提供机构:
Microsoft
创建时间:
2026-09-02
原始信息汇总

数据集概述

XL-DocBench 是一个用于评估模型在超长文档上基于证据进行推理能力的基准测试,问题需在数百上千页文档中寻找证据、整合支持信息并正确应用规则。该数据集包含 1,345 条问答记录,覆盖 292 份文档,全部由 194 位人类专家验证,属于保守发布版本,已剔除所有涉及“RAG: Not Approved”来源URL的问题。

基本信息

  • 语言:英语 (en)
  • 许可证:其他 (other)
  • 任务类别:问答 (question-answering)
  • 标签:文档理解、长上下文、多模态文档AI、跨文档问答、基准测试
  • 规模:1K < n < 10K
  • 作者机构:武汉大学、微软

数据集构成

QA数据

类型 数量
单文档问答 1,191
跨文档问答 154
总计 1,345

配置与文件

  • single_docdata/qa_single_doc.jsonl,包含1,191个单文档问题
  • cross_docdata/qa_cross_doc.jsonl,包含154个跨文档问题
  • documentsdata/documents.jsonl,保留文档元数据和来源URL
  • scoresresults/scores.jsonl,包含13个可复现系统逐题得分

另包含 manifest.json(发布统计)、results/summary.json(聚合分数)、code/ 目录(快速测试与评估器代码)。

数据核心特性

  • 证据页数:1,280条可解析历史人工页码标注中,975条(76.2%)使用多个证据页
  • 多模态证据:429个问题(31.9%)的发布支持证据为多模态
  • 跨文档情境:154个问题(11.4%)使用跨文档上下文
  • 不可回答:188个问题要求输出 None 答案
  • 上下文长度:完整系列上下文最长可达2,935页
  • 专业领域:覆盖六个专业领域

评估与基准表现

评估器输出基于规则的准确性(Accuracy)Token级F1ANLS,缺失、失败和无法解析的预测均计为不正确。官方榜单中表现最好的系统为 GPT-5.4(OCR输入),准确率达 38.36%,Token F1 为 39.70%。前五名表现如下:

排名 系统 输入类型 Accuracy Token F1 ANLS
1 GPT-5.4 OCR 38.36 39.70 34.17
2 SimpleDoc + GPT-5.4 Agent 36.21 33.62 24.30
3 Kimi-K2.5 OCR 36.06 38.24 32.64
4 MDocAgent + GPT-5.4 Agent 31.82 30.58 22.64
5 GPT-5.2 OCR 31.15 33.69 28.51

记录结构

每条问答记录包含:

  • answer: 答案值、格式与验证规则
  • document / documents: document_id + 公共URL、evidence_pages(PDF页索引)、evidence_items(注释定位器+页码+摘录类型)
  • metadata: 领域、难度、推理类型、可回答性

源文档通过公共URL引用而非重新分发,PDF二进制文件和本地文件名不包含在发布中。

搜集汇总
数据集介绍
XL-DocBench 数据集图片
构建方式
XL-DocBench作为一个专注于证据引证与超长文档理解的严苛基准,其构建过程融合了精密的数据筛选与专家验证机制。该数据集汇集了来自六大专业领域的292份文档,共形成1,345个问答题对,其中1,191个为单文档问题,154个跨文档问题。为确保数据纯净性与可靠性,构建者对所有涉及未经批准的来源URL的问题进行了剔除,仅保留经过194位人类专家逐条核验的内容。每一问答题对均附带有结构化的记录,包含答案值、格式与验证规则,以及文档元数据(如公开URL、证据页码与证据条目),并细致区分了PDF页码与打印页码间的差异,未分配的证据条目亦作为溯源留存,为后续的可复现评估奠定了坚实的数据基础。
特点
XL-DocBench的鲜明特质在于其对超长上下文与证据链推理的深度探索。该基准中,76.2%的问题需要多页证据支撑,31.9%的问题涉及多模态证据,11.4%的问题横跨多文档,而完整系列的上下文可长达2,935页,在这一规模上对模型的长程依赖与信息整合能力提出了严苛挑战。此外,数据集严格区分了证据来源的授权状态,仅保留完全许可的内容,体现了其对版权与合规性的尊重。同时,所有问题均附带原因标注(如需要‘无答案’的情况),这使得评估不仅涵盖事实检索,更涉及对推理边界与拒答能力的检验,为超长文档理解研究提供了一份高难度、高质量且高度可信的评测资源。
使用方法
使用XL-DocBench进行模型评估时,采用其内置的确定性评估器,可通过命令行工具轻松运行。用户需准备包含每个问题ID及对应预测的JSONL文件,然后调用evaluate.py脚本,即可获得基于规则的准确性、词元级F1分数及ANLS等量化指标。这些评估指标严格处理缺失或不可解析的预测,并默认将其视为错误,确保了评分的一致性。为便于快速上手,数据集还提供了五问示例的冒烟测试脚本(quickstart.py)以及标准库的数据加载示例,使研究者能够迅速验证数据存储结构与评估流程。此外,由于源文档以公开URL形式引用而非直接提供,该基准同时发布了每个问题的详细得分,为那些因URL变更而无法获取原始文档的场景提供了稳定的比较基准点。
背景与挑战
背景概述
XL-DocBench由武汉大学与微软研究院的学者于2026年联合构建,旨在攻克证据支撑的超长文档理解这一前沿难题。该基准严格筛选了292篇专业文档,涵盖六大领域,包含1,345道经194位专家验证的问答对,其中76.2%需跨多页证据推理,31.9%涉及多模态信息,11.4%为跨文档问答,且存在需主动放弃回答的情形。其核心问题在于评估系统在百页乃至千页级上下文中定位证据、整合信息并应用规则的能力,填补了现有基准在超长文档与证据溯源方面的空白,为多模态文档人工智能研究提供了关键评测基准。
当前挑战
该数据集构建面临多重挑战。领域层面,突破了传统长文档理解局限于单文档或短上下文的瓶颈,要求模型具备跨页、跨文档的证据聚合与推理能力,同时处理多模态信息并准确判断何时应放弃回答,这对现有技术构成严峻考验。构建过程中,需确保每个问题的答案有明确证据支持,且覆盖多种推理类型和难度层级,需投入大量专家人工验证以保证质量;同时需处理文档版权与可获取性问题,仅提供公开URL而非PDF内容,并建立稳定的评分基准以应对文档链接可能失效的风险,这对数据集的长期可用性和可复现性提出了独特要求。
常用场景
经典使用场景
XL-DocBench作为一个专门针对超长文档理解与证据溯源能力的基准测试集,其在文档智能领域的核心应用在于系统性评测前沿模型对数百乃至数千页专业文献的深度解析与推理能力。该数据集通过精心构建的单文档及跨文档问答任务,要求模型能够精准定位分散于长篇文档中的关键证据,并整合多元信息以给出准确答案,以此检验模型在长上下文场景下的语义理解、信息检索及逻辑推理等综合性能。其典型的使用范式是,研究者利用该基准对诸如GPT-5.4、Kimi-K2.5等大型语言模型进行标准化评估,并依据其提供的精确量化指标(Accuracy、Token F1、ANLS)客观比较不同模型架构与输入模态(OCR文本或图像)的表现差异,从而推动该领域技术的迭代与进步。
衍生相关工作
作为一项资源丰富且任务设计颇具前瞻性的基准,XL-DocBench为后续诸多研究工作提供了坚实基础与拓展方向。其严格的证据标注体系和多维度评估指标,激励了研究者对现有文档理解模型的长上下文感知、证据整合及拒答机制进行深入剖析与改进。基于此基准,学术界衍生了诸多经典工作,例如发展新的面向超长多模态文档的分层检索与推理框架,探索将大型语言模型与外部工具或代理(Agent)结合的有效策略以提升证据利用效率,以及研究适用于长文档场景的无损或高效注意力机制。同时,其公开的评测方法与数据可复现性,为社区中不同模型间的横向对比提供了公允平台,促进了文档智能研究领域向更具挑战性的真实世界场景持续迈进。
数据集最近研究
最新研究方向
XL-DocBench作为一项聚焦于超长文档证据推理的严苛基准,正引领多模态文档理解领域向纵深迈进。其研究前沿集中于评估系统在数百乃至数千页文档中定位并整合分散证据的能力,尤其强调跨文档推理与适时弃答的决策智慧。该基准由194位专家全面验证,覆盖六个专业领域,其中31.9%的问题涉及多模态证据,11.4%需跨文档综合,且包含188个标准答案为“无”的棘手场景,凸显了真实世界文档分析的复杂性。当前,基于OCR输入的GPT-5.4以38.36%的准确率居首,而智能代理如SimpleDoc结合GPT-5.4亦展现潜力,但整体性能仍与人类专家认知存在鸿沟。该数据集的意义在于推动模型从表面文本匹配转向深层证据链条的构建,为金融、法律、医学等高 stakes 领域的可靠文档智能奠定评测基石,其发布恰逢大型语言模型竞争白热化之际,为验证长上下文处理能力的真实上限提供了试金石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务