遇见数据集

LongDA

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

LongDA是一个用于评估大语言模型在文档密集型数据分析工作流程中性能的基准数据集。它基于真实的美国政府部门调查数据构建,并配备了完整且冗长的官方文档,旨在测试大语言模型在分析前理解和导航复杂现实世界数据集的能力。数据集包含从30份专家撰写的出版物中提取的505个自然语言分析查询,覆盖了来自美国6个联邦机构的17项国家调查,涉及健康、劳动力与经济、社会科学、科学与工程以及政府运营等多个领域。每个查询的平均上下文长度约为263K token,显著长于现有基准,要求模型进行多步骤推理并执行代码以完成任务。核心特征包括:长文档(如代码手册、技术报告、用户指南)、专家编写的真实分析问题、大规模表格数据(包含数千个变量)以及模拟真实分析工作流程。数据集结构分为两部分:benchmark.csv文件(包含查询、来源、答案等信息)和完整的调查文件夹(包含原始数据文件和详细文档)。

LongDA is a benchmark dataset for evaluating the performance of large language models (LLMs) in document-intensive data analysis workflows. It is constructed based on real U.S. government department survey data and includes comprehensive and lengthy official documents, aiming to test the ability of LLMs to understand and navigate complex real-world datasets before analysis. The dataset contains 505 natural language analysis queries extracted from 30 expert-written publications, covering 17 national surveys from 6 U.S. federal agencies across various fields such as health, labor and economy, social sciences, science and engineering, and government operations. The average context length per query is approximately 263K tokens, significantly longer than existing benchmarks, requiring models to perform multi-step reasoning and execute code to complete tasks. Core features include: 1) Long documents (e.g., codebooks, technical reports, user guides); 2) Expert-written queries (all based on real analysis questions posed by domain experts in actual publications); 3) Complex data (large-scale tabular data with thousands of variables requiring careful navigation); 4) Real workflow simulation (mimicking scenarios where document navigation is a major bottleneck in practical analysis). The dataset structure consists of two parts: 1) The `benchmark.csv` file, containing queries, corresponding survey sources, answer structures, additional information, and verified ground-truth answers; 2) Complete survey folders, each containing raw data files (e.g., CSV, DAT, XPT formats) and detailed documents (e.g., PDF, TXT formats). The full dataset is necessary for effective evaluation.

创建时间:
2026-06-24
原始信息汇总

LongDA 数据集概述

LongDA 是一个用于评估基于大语言模型(LLM)的智能体在文档密集型分析工作流中表现的数据分析基准。它使用真实的美国政府调查数据及其完整的长文档,测试LLM在处理复杂真实数据集时的能力。

核心特性

  • 505 个查询:从30篇由专家撰写的出版物中提取。
  • 17 项美国全国性调查:涵盖健康、劳动、经济、教育和社会科学等领域。
  • 约 263K tokens 平均上下文:每个查询的上下文长度远超现有基准。
  • 真实分析任务:需要多步推理和代码执行。

主要功能

  1. 长文档:每项调查包含多份非结构化文档(如代码手册、技术报告、用户指南)。
  2. 专家验证的查询:所有查询均由领域专家从真实出版物中提取。
  3. 复杂数据:大规模的表格数据,包含数千列,需要仔细导航。
  4. 真实工作流:模拟真实分析实践,其中文档导航是主要瓶颈。

语言

  • 代码:Python
  • 文档:英语
  • 数据:美国调查的数值和分类数据

数据集结构

要使用本基准,必须下载包含所有调查数据文件和文档的完整数据集。仅包含查询和真实答案的 benchmark.csv 文件是不够的。

数据字段(benchmark.csv)

  • survey:调查缩写(如 NHANES, CPS-ASEC)。
  • source:来源出版物标题。
  • internal_id:出版物的内部问题编号。
  • query:自然语言分析查询。
  • answer_structure:预期的答案格式(single_number 或列表结构)。
  • additional_info:上下文、单位和特殊要求。
  • answer:真实答案(已验证与官方出版物一致)。

下载方法

  • 通过 Git LFS 克隆完整仓库:git clone https://huggingface.co/datasets/EvilBench/LongDA benchmark
  • 或使用 Python 库下载: python from huggingface_hub import snapshot_download snapshot_download( repo_id="EvilBench/LongDA", repo_type="dataset", local_dir="./LongDA_data" )

数据集创建

来源数据

所有数据来自公开的美国政府部门调查,涵盖以下领域:

  • 健康:人口健康、营养、医疗保健可及性。
  • 劳动与经济:就业、收入、时间使用。
  • 社会科学:人口统计、药物使用、家庭结构。
  • 科学与工程:劳动力、研究经费、设施。
  • 政府运作:州财政、就业、养老金。

整理流程

  1. 调查选择:从6个联邦机构中挑选了17项多样化且文档完善的全国性调查。
  2. 出版物收集:收集了30篇由专家撰写的报告和出版物。
  3. 查询提取:手动提取了505个基于真实分析实践的查询。
  4. 真实答案验证:对照官方统计数据验证了所有答案。
  5. 文档汇编:包含了所有相关的调查文档(代码手册、指南、技术报告)。

使用注意事项

社会影响

基准使用包含健康、收入、药物使用和人口统计等敏感话题的真实政府数据。用户应尊重数据隐私与使用政策,注意调查数据和抽样方法中的潜在偏差,并负责任地使用结果。

局限性

  • 查询聚焦于美国数据,可能不适用于其他背景。
  • 需要大量计算资源(约263K tokens的长上下文窗口)。
  • 部分调查包含复杂的抽样权重和方法。
  • 即使对于人类,文档导航也具有一定挑战性。

附加信息

许可信息

  • 代码与基准:MIT 许可证
  • 调查数据:公共领域(美国政府部门数据)
  • 文档:公共领域(美国政府出版物)

引用

bibtex @article{li2026longda, title={LongDA: Benchmarking LLM Agents for Long-Document Data Analysis}, author={Li, Yiyang and Zhang, Zheyuan and Ma, Tianyi and Wang, Zehong and Murugesan, Keerthiram and Zhang, Chuxu and Ye, Yanfang}, journal={arXiv preprint arXiv:2601.02598}, year={2026} }

搜集汇总
数据集介绍
LongDA 数据集图片
构建方式
LongDA数据集是基于美国17项国家调查数据构建的基准测试,涵盖健康、劳动、经济、教育和社会科学等领域。构建过程首先从6个联邦机构中选取多样化的调查数据集,随后收集30份专家撰写的报告与出版物,从中手动提取505个真实分析查询,并通过官方统计验证所有答案。最后,整合每项调查的完整文档(包括代码手册、技术报告和用户指南),形成文档密集型分析工作流评估环境。
特点
该数据集的显著特点在于其长文档上下文,平均每个查询包含约263K tokens,远超现有基准。每项调查配套多份非结构化文档,模拟真实分析场景中导航文档的瓶颈。查询基于真实出版物的专家经验提取,涵盖多步推理与代码执行,具有高度真实性和复杂性。数据规模庞大,包含数千列的表格式数据,要求模型具备精细导航能力。
使用方法
使用LongDA时,需通过Git LFS完整下载数据集,包括benchmark.csv及17个调查文件夹中的原始数据文件和文档。benchmark.csv提供505个查询及其标准答案,而评估需结合原始数据与文档进行。用户可通过Hugging Face的snapshot_download函数编程下载,或使用git clone命令获取完整目录结构,随后基于Python环境运行模型进行多步推理分析。
背景与挑战
背景概述
LongDA是由圣母大学、IBM研究院及康涅狄格大学的研究人员于2026年创建的一个数据分分析基准,旨在评估基于大语言模型(LLM)的智能体在文档密集型分析工作流中的表现。该基准的核心研究问题聚焦于当前LLM在缺乏结构化上下文时处理复杂、长文档的真实世界数据能力,特别是其导航和理解大规模、多维政府调查数据的程度。LongDA通过整合17项覆盖健康、劳动、经济、教育和社会科学等领域的美国国家级调查,提取了505个由专家撰写的真实分析查询,显著填补了现有数据集在文档长度和理解复杂性方面的空缺,对推动LLM在数据科学和自动化分析工具的发展具有重要影响力。
当前挑战
LongDA旨在解决的核心领域挑战是LLM在处理包含约263K令牌平均上下文长度的长文档数据集时的导航、推理和代码执行能力不足。具体挑战包括:1)大规模、非结构化的调查文档(如代码簿、技术报告)需要LLM具备精准的信息检索与整合能力;2)数据集涵盖数千列的复杂表格数据,对LLM的列选择和变量理解构成考验;3)构建过程中面临从30篇专家出版物中人工提取与验证505个查询的严格质量控制,以及确保跨多机构、多格式调查数据的一致性;4)基准需要模拟真实分析工作流,其中文档导航成为主要瓶颈,而非单纯的模型推理,这要求设计合理的评估协议以反映实际应用中的复杂性与效率。
常用场景
经典使用场景
LongDA数据集专为评估大语言模型(LLM)在长篇文档密集型数据分析任务中的表现而设计。其经典使用场景在于模拟真实的数据分析工作流:研究人员或分析师首先需从冗长、非结构化的调查文档(如代码手册、技术报告和用户指南)中提取关键信息,然后基于对数据结构和变量含义的理解,进行多步推理并编写代码完成查询。该基准包含505条来自30篇专家发表文章的真实查询,平均上下文长度达约263K tokens,远超市面上现有基准,从而为衡量LLM在复杂文档导航与数据操作中的能力提供了严苛的测试场。
实际应用
在现实世界中,LongDA数据集所模拟的场景广泛存在于社会科学、公共卫生、政策制定和经济学研究领域。例如,联邦机构研究人员需快速熟悉诸如NHANES(全国健康与营养检查调查)或CPS-ASEC(当前人口调查年度社会与经济补充)等大型调查的数据结构,才能准确提取特定指标。企业分析师则可能面临跨行业数据集成与合规性分析的需求。LongDA为开发自动化数据分析助手提供了理想的测试平台,能够帮助筛选出在真实工作环境中高效可靠的LLM代理,从而加速从原始数据到可操作洞察的转化流程。
衍生相关工作
基于LongDA数据集的提出,已催生出一系列开创性工作。研究者利用该基准开发了面向长文档数据分析的检索增强型LLM代理,如通过分层文档摘要和动态查询分解技术来提升推理准确性。此外,针对文档导航瓶颈,有工作提出了结构化代码簿预索引方法,将静态文档转化为可搜索的知识库。在模型训练层面,LongDA也激发了对长序列微调策略的研究,探索如何通过课程学习或注意力机制改进来使LLM适应超长上下文。这些衍生工作共同推动了数据分析自动化领域的边界,并持续以LongDA作为核心评估标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务