遇见数据集

LongListBench

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

LongListBench是一个用于评估从复杂商业PDF中提取长列表实体的基准数据集,专注于保险和商业卡车运输领域。它旨在解决长列表提取中的常见失败模式,如遗漏、合并或虚构行导致文档级结果无效。数据集包含32个合成PDF文档和29,599条目标记录,不包含真实客户个人身份信息(PII)。数据分为三个配置:1)`core_operations`:包含26个类似生产环境的商业保险和卡车运输PDF,具有密集的重复操作、IFTA(国际燃料税协议)和损失运行记录,用于测试规模和输出完整性;2)`claim_multihop`:包含3个长索赔PDF,其中事件记录必须从文档远距离部分组装;3)`policy_packets`:包含3个长商业主保险、工人赔偿和商业一般责任保单包,其中记录必须从远距离部分组装。每个文档标注了14种复杂性压力因素(如跨页、分割记录、多行、重复项、大文档、多表格、多列、合并单元格、OCR条件、长距离证据等),以模拟现实世界的提取挑战。数据集提供PDF字节、OCR转录文本、JSON格式的地面真值以及包含生成细节的元数据。主要评估指标是严格的归一化记录完整性(精确记录召回率和完整文档率),字段重叠F1分数作为次要诊断指标。数据集附带了四个基于大语言模型的代理基线性能结果,并提供了详细的提取模式(JSON Schema)。所有文档均为合成生成,布局和内容参考了真实文档结构,但所有标识符和内容均为虚构。

LongListBench is a benchmark dataset for evaluating long-list entity extraction from complex commercial PDFs, focusing on the insurance and commercial trucking sectors. It aims to address common failure modes in long-list extraction, such as omission, merging, or fabricated rows that lead to invalid document-level results. The dataset contains 32 synthetic PDF documents and 29,599 target records, with no real customer personally identifiable information (PII) included. The data is divided into three configurations: 1. `core_operations`: 26 production-like commercial insurance and trucking PDFs featuring dense repeated operations, International Fuel Tax Agreement (IFTA) and loss run records, used to test scalability and output completeness; 2. `claim_multihop`: 3 long claim PDFs where event records must be assembled from distant sections of the document; 3. `policy_packets`: 3 long commercial package, workers' compensation, and commercial general liability policy packets, where records must be assembled from distant sections. Each document is annotated with 14 complexity stressors (e.g., cross-page breaks, split records, multi-line entries, duplicates, large documents, multiple tables, multiple columns, merged cells, OCR conditions, long-range evidence, etc.) to simulate real-world extraction challenges. The dataset provides PDF bytes, OCR transcribed text, ground truth in JSON format, and metadata including generation details. The primary evaluation metrics are strict normalized record integrity (exact record recall and complete document rate), with field-overlap F1 score as a secondary diagnostic metric. The dataset includes performance results of four LLM-based AI Agent baselines, as well as a detailed extraction schema ("JSON Schema"). All documents are synthetically generated, with layouts and content modeled after real document structures, but all identifiers and content are entirely fictitious.

创建时间:
2026-07-15
原始信息汇总

LongListBench 数据集概述

基本信息

  • 名称: LongListBench
  • 语言: 英语 (en)
  • 许可证: MIT
  • 开发者: Kay.ai
  • 作者: Anton Fedoruk, Serhii Shchoholiev, Akhil Mehta, Vishal Rohra
  • 数据集规模: 少于 1,000 条样本 (n<1K)
  • 数据集地址: https://huggingface.co/datasets/kaydotai/LongListBench
  • GitHub 仓库: https://github.com/kaydotai/longlistbench

数据集描述

LongListBench 专注于测量长列表提取任务中模型在完整度方面的失败模式,适用于保险和商业卡车运输领域的 PDF 文档。系统接收一个 PDF 或 OCR 转录文本以及一个目标合同,然后返回完整的目标列表。该数据集包含 32 个合成 PDF 和 29,599 条目标记录,不包含任何真实客户 PII 数据。

数据集配置与数据划分

配置名称 描述 目标字段 文档数 记录数/文档范围 目标记录总数 页码范围
core_operations 26 个类似生产环境的商业保险和卡车运输 PDF,包含密集重复操作、IFTA 和损失运行记录 records 26 260-2,571 28,178 17-84
claim_multihop 3 个长篇幅理赔 PDF,事故记录需从远距离章节中组装 incidents 3 12-40 77 61-148
policy_packets 3 个长篇幅商业业主、工人赔偿和商业一般责任险保单包,记录需从远距离章节中组装 records 3 344-562 1,344 99-133

核心功能与标签

数据集包含 14 种标准复杂性压力标签 (Stressors),用于标注每个 PDF 中的提取难度:

标签 含义
page_breaks 列表或支持证据跨页延续,包含重复表头或继承上下文
split_records 一条目标记录的字段分布在不同的视觉区块、章节或页面中,需组装
multi_row 记录包含换行注释、描述、条款或续行
duplicates 存在前期条款、归档、重复或近似重复的干扰材料
large_doc 文档长度足以考验截断和记录完整性行为
multiple_tables 目标行与摘要、分类账、时间表、支持表或空表混合
multi_column 页面使用双栏或表单式布局,考验阅读顺序
merged_cells 表格包含跨行或合并单元格结构
ocr_condition 发布的文本条件为从渲染页面图像进行的 OCR
ocr_layout_condition OCR 保留视觉间距和阅读顺序,而非将表格转换为干净的 CSV 格式行
long_range_evidence 字段需从同一 PDF 的远距离章节中连接
cross_section_join 目标记录需从单独标记的章节中组装,如返回摘要、距离/加仑表和责任表
repeated_keys 常见键(如州或司法管辖区)跨章节或返回重复出现,仅凭键不足以匹配
heterogeneous_record_list 目标列表包含多种记录模式,尤其在保单包中

数据列说明

列名 类型 描述
document_id string 稳定样本标识符
complexity_regime string 文档族,如 ifta_mileage_by_vehicleloss_run_external
evaluation_role string 预设评估角色:scale_controlstructural_challenge
num_pages int32 生成器记录的页面数
target_field string 顶层列表名称:incidentsrecords
target_record_type string 主要模式族
target_count int32 ground_truth 中的目标记录数
stressors list[string] 文档的压力标签
pdf Pdf 嵌入的源 PDF 字节
ground_truth string 包含预期记录的 JSON 字符串
metadata string 包含清单元数据、文件哈希、证据映射等的 JSON 字符串
ocr_transcript string 从渲染 PDF 页面图像生成的 OCR 转录文本

当前基线结果

数据集包含 4 个全语料库 OCR 条件下的 agentic 基线结果:

协议 文档数 目标记录 精确记录召回率 完全文档 字段微 F1 字段宏 F1
Codex CLI gpt-5.6-sol 32 29,599 97.9% 8/32 (25.0%) 99.4% 99.4%
Claude Code CLI claude-fable-5 32 29,599 95.1% 9/32 (28.1%) 96.8% 93.6%
Codex CLI gpt-5.5 32 29,599 94.5% 4/32 (12.5%) 98.8% 98.6%
Claude Code CLI claude-opus-4-8 32 29,599 97.7% 7/32 (21.9%) 99.4% 99.3%

数据生成与来源

文档均为合成生成,遵循以下工作流:

  1. 确定性固定装置创建符合模式的基本事实。
  2. 布局生成器将记录放置到文档特定的表格和叙述性章节中。
  3. HTML/CSS 渲染生成源 PDF。
  4. 在渲染页面上进行 OCR 生成发布的转录文本。

不包含任何客户文档或真实的被保险人、索赔人、保单或账户数据。真实文档仅用作布局和包组织的结构参考。

许可证

MIT 许可证。文档和基本事实均为合成数据,随仓库一起以该许可证发布。

搜集汇总
数据集介绍
LongListBench 数据集图片
构建方式
LongListBench 是一个专为评估长列表实体提取任务而设计的基准数据集,聚焦于保险与商业货运领域的复杂PDF文档。其构建过程采用全合成流程:首先通过确定性夹具生成符合既定模式的真实标注数据,随后由布局生成器将这些记录嵌入文档特定的表格与叙事段落,再经由HTML/CSS渲染生成源PDF文件,最终通过对渲染页面图像执行OCR来生成发布文本。整个流程保证了数据的高可控性与可复现性,且所有内容与标识符均为合成生成,不含任何真实的客户个人身份信息。
特点
该数据集包含32个合成PDF文档与29,599条目标记录,涵盖三个核心配置:core_operations聚焦于高密度操作记录与规模完整性测试,claim_multihop与policy_packets则引入跨页继承上下文、远距离证据与混合记录模式等结构复杂性挑战。数据集明确定义了14种规范复杂性压力标签,如跨页断页、重复记录、合并单元格与长程证据拼接等,精准刻画实际业务文档中的提取难题。此外,所有PDF均提供OCR转录版本,且经过严格的数值保真度审计,OCR字符级缺失率低于0.1%。
使用方法
用户可通过HuggingFace Datasets库加载指定配置,每行数据对应一个PDF文档,包含完整PDF字节、OCR转录文本、JSON格式的标注记录以及元数据。官方评估方法要求系统返回与ground_truth结构完全一致的对象,首选严格记录完整性指标(精确记录召回率与完全文档率),字段重叠F1作为辅助诊断。基准实验已在四种前沿智能体协议上完成,展示了当前技术在高密度长列表提取中的能力边界与瓶颈。推荐通过GitHub仓库克隆评估器使用规范评分管道,并遵循版本锁定以确保结果可比性。
背景与挑战
背景概述
在商业文档智能处理领域,从复杂PDF文档中精确提取结构化长列表信息是一项极具挑战性的任务,尤其是当文档包含跨页表格、异构记录模式和嵌套上下文时。由Kay.ai团队(Anton Fedoruk、Serhii Shchoholiev、Akhil Mehta及Vishal Rohra)于2026年创建的LongListBench基准数据集,旨在系统性评估模型在保险与商业货运PDF中执行长列表实体抽取的完整性与准确性。该数据集包含32份合成PDF文档及29,599条目标记录,覆盖核心操作、声明多跳与保单包三种配置,聚焦于字段级微F1值虽高但文档级完整率低下的典型失败模式,为文档智能领域提供了首个专门衡量长列表抽取完整性的标准化测试平台。
当前挑战
LongListBench所应对的核心挑战在于:传统评估指标(如字段级F1)无法真实反映长列表抽取的完整性,一个遗漏或合并的行即可能导致整个文档级结果无效。数据集构建过程中面临多重技术挑战,包括跨页继承上下文、分割记录跨视觉区块拼接、重复与近重复干扰项的存在、异构记录模式混合、以及OCR转录中的布局保留与数值保真度限制。具体而言,超过三分之二的配置属于结构性挑战——如远距证据连接、多节报表合并及混合行/明细损失记录——在顶级模型的测试中,文档完整率仅介于12.5%至28.1%之间,远低于字段级F1值所暗示的性能,揭示了当前模型在复杂商业文档环境下的根本性局限。
常用场景
经典使用场景
在保险与商业货运领域中,从冗长的PDF文档中精确提取结构化列表是一项极具挑战性的任务。LongListBench专为此类场景设计,其核心用途在于评测人工智能系统从多页、多表格、多区域的复杂PDF中,还原完整目标记录列表的能力。该基准数据集包含32份合成PDF,涵盖运营记录、跨段落索赔联动以及综合保单包三种配置,每一份文档均精心设置了跨页断行、合并单元格、噪声重复项、长距离证据关联等十四类提取困难标签,旨在模拟现实中高密度、非规整、需跨区拼接的商业文档,从而严格衡量模型在处理大规模列表提取时的输出完整性与结构化还原精度。
实际应用
在实际产业应用中,LongListBench所模拟的场景直接对应保险理赔处理、货运税费核算、商业保单审核等高频业务需求。例如,在IFTA(国际燃油税协议)申报中,系统需要从跨越数十页的里程、燃油和税费明细表中,准确拼接出每条司法管辖区的完整记录;在损失运行报告中,理赔条目常与摘要、备注和空白表格交错出现,要求抽取器具备辨别主干信息与干扰项的能力。LongListBench通过对这些真实业务流程的复现,为保险公司、物流企业和金融科技公司验证其文档自动化处理系统的可靠性提供了标准化压力测试工具,帮助识别现有OCR与信息抽取方案在实际部署中的瓶颈,降低因数据遗漏导致的法律合规风险与运营错误。
衍生相关工作
自LongListBench发布以来,其严谨的评测体系和丰富的压力标签已衍生出一系列聚焦长列表完整性抽取的基准工作。研究者基于其提供的四种OCR条件下的代理基线结果,系统分析了大语言模型在跨页证据拼接、异构记录模式适应以及高密度列表归一化方面的表现差异。该数据集的参考评估器与规范化评分协议被多个后续研究采纳为标准化评价框架,用以对比不同模型在结构挑战性与规模控制性文档上的表现。此外,LongListBench公开的JSON Schema文件与地面真值记录已成为开发新型文档抽取策略的重要参考资源,催生了针对长距离证据关联、混合表结构解析以及多模式记录对齐等子问题的专项评估与算法改进研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务