遇见数据集

DataGovBench

收藏
arXiv2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

DataGovBench是由富士通研究·美国团队构建的综合性基准数据集,旨在评估大语言模型在真实世界数据分析场景中的性能。该数据集包含178个源自政府开放数据门户(如Data.gov)的大规模多表数据集,平均每个表约21万行、18.4列,最大表达1190万行,并辅以丰富的元数据和外部知识文档。数据集的构建采用三阶段流程:通过系统性筛选从53个开放平台采集数据,利用大语言模型结合人工验证生成211个高质量问答对,并基于专家撰写的官方报告提取洞察作为基准真值。该数据集主要应用于推动大语言模型在复杂表格推理、可分解问题解答以及探索性洞察发现等领域的研究,旨在解决现有基准在数据规模、多表关联和主动分析能力方面的局限性。

DataGovBench is a comprehensive benchmark dataset developed by the Fujitsu Research America team, designed to evaluate the performance of large language models (LLMs) in real-world data analysis scenarios. It consists of 178 large-scale multi-table datasets sourced from government open data portals such as Data.gov. Each table averages approximately 210,000 rows and 18.4 columns, with the largest table containing up to 11.9 million rows. The dataset is supplemented with rich metadata and external knowledge documents. The construction of this dataset follows a three-stage pipeline: first, data is collected from 53 open platforms via systematic screening; second, 211 high-quality question-answer pairs are generated using LLMs combined with manual verification; third, insights extracted from expert-written official reports are adopted as the ground truth for evaluation. This benchmark is primarily used to advance research on LLMs in fields such as complex table reasoning, decomposable question answering, and exploratory insight discovery, and it aims to address the limitations of existing benchmarks in terms of data scale, multi-table association, and active analysis capabilities.

创建时间:
2026-07-08
原始信息汇总

数据集名称

DataGovBench

数据集简介

DataGovBench 是一个针对政府开放数据表格的问答与洞察提取基准测试数据集。

数据集获取

  • 快速测试样本:可解压仓库内 datagovbench_sample.zip 文件获取。

  • 完整基准数据集(约 2 GB):托管在 Zenodo 平台,DOI 为 10.5281/zenodo.21225447。可通过以下命令下载并校验: bash wget https://zenodo.org/records/21225447/files/datagovbench.tar.xz wget https://zenodo.org/records/21225447/files/datagovbench.tar.xz.sha256 sha256sum -c datagovbench.tar.xz.sha256 tar -xJf datagovbench.tar.xz

    解压后目录名为 opendatabench/

使用限制

  • 基准数据集包含一个采用 CC-BY-NC-SA-4.0 许可的数据集,因此 仅限非商业用途
  • 数据集中各子数据集的许可信息详见压缩包内的 LICENSES_THIRD_PARTY.md 文件。

基准任务

数据集支持以下两类任务:

1. 表格问答 (Table QA)

  • 运行命令: bash python -m benchmark.benchmark --dataset DATASET_PATH --type qa_evaluate --output qa --model MODEL_NAME

  • 参数说明

    • DATASET_PATH:解压后数据集的路径。
    • MODEL_NAME:LLM 模型名称(支持 gpt4, gpt4-mini, gpt5, gpt5-mini, gemini, gemini-pro, claude, claude-sonnet,或 Huggingface 模型文件名,如 mistralai/Devstral-Small-2507 DocTron/Chart-R1)。

2. 表格洞察 (Table Insight)

  • 运行命令: bash python -m benchmark.benchmark --dataset DATASET_PATH --type report_evaluate --output report --model MODEL_NAME

  • 参数说明:同上。

搜集汇总
数据集介绍
构建方式
DataGovBench的构建过程分为三个阶段。首先,从53个以英语为主的政府开放数据平台(如Data.gov)系统性收集数据集,经过严格筛选,确保每个数据集至少包含一个超过5000行的表格文件并附有描述性元数据。其次,针对表格问答任务,采用大语言模型与人工验证相结合的方式:利用特征类型特定的表格序列化技术生成多样化问题,经自动评分与答案共识过滤后,由领域专家进行人工校验与完善,最终获得211个高质量问答对。最后,为表格洞察任务,从六份附带专家报告的数据集中提取关键发现,通过自动化与人工结合的方式汇总为标准化的洞察集合与摘要。
使用方法
使用DataGovBench时,研究者可针对两个核心任务分别评估模型。对于表格问答任务,模型需根据用户问题生成精确的文本答案或可视化图表,可分解问题需处理包含多个子问题的复杂查询。评估采用精确匹配与多模态大语言模型判断相结合的准确性指标。对于表格洞察任务,模型需直接从给定表格数据中自主生成一组发现与总结,无需用户显式查询,评估则通过比较生成洞察与专家标注的参考洞察之间的语义对齐程度。代码与样本数据已开源,研究者可直接下载使用,并通过提供的基线系统(如Answer Agent与Insight Agent)进行对比实验。
背景与挑战
背景概述
DataGovBench由Fujitsu Research of America的So Hasegawa、Shailaja Keyur Sampat、Lei Liu和Wei-Peng Chen于2025年提出,旨在填补现有大语言模型(LLM)在数据分析基准测试中的现实性缺失。该数据集源自政府开放数据门户(如Data.gov),聚焦于评估LLM在多表结构、大规模数据表格、元数据及外部知识整合条件下的推理能力。其核心任务包括复杂表格问答(Table QA)与探索性洞察生成(Table Insight),打破了传统基准仅关注简单事实检索的局限。DataGovBench的发布为LLM驱动的数据分析研究提供了更具挑战性的测试平台,推动了领域朝着更贴近现实应用的方向发展。
当前挑战
DataGovBench所解决的领域问题在于,现有基准如WikiTableQuestions与Spider多局限于小规模单表查询,忽视了大表格、多表融合、元数据解析及主动洞察发现等现实数据分析场景。其构建过程面临多重挑战:首先,从53个开放数据平台获取超大规模数据集后,需经系统过滤以筛选出含5000行以上记录、多表结构与丰富元数据的样本;其次,高质量问答对(QA)的标注需采用LLM生成与人工验证相结合的方法,克服表格序列化与答案一致性难题,最终从1840个候选问题中仅保留211个高质条目;此外,洞察生成任务的标注依赖专家报告,需解决主观性差异,通过提炼结构化要点与摘要来确保客观性。
常用场景
经典使用场景
在现实世界的数据分析场景中,DataGovBench被设计用于评估大语言模型在处理大规模、多表格、附带元数据与外部知识的复杂表格推理任务上的表现。其典型使用场景包括两种核心任务:一是Table QA任务,要求模型回答可分解为多个子问题的复杂查询,并以文本或可视化形式输出精确答案;二是Table Insight任务,挑战模型在没有明确用户查询的情况下,自主进行探索性数据分析,生成专家级别的洞见与总结。这些任务模拟了数据科学家在实际工作中面临的数据整合、条件筛选、数值转换和多表关联等真实挑战。
解决学术问题
现有基准如WikiTableQuestions和Spider局限于小规模单表格和简单事实检索,忽略了真实数据分析中的多表格联合推理、外部知识整合以及主动发现洞见的能力评估。DataGovBench填补了这一空白,通过引入大规模多表数据集、丰富的元数据和外部知识,系统性地评估LLM在复杂表格问答和洞见生成方面的能力。实验表明,即便是最先进的模型在agentic框架支持下,其准确率依然偏低,揭示当前LLM在叙事级推理和精确事实检索上的严重不足,为推动更鲁棒的表格推理研究提供了明确方向。
实际应用
DataGovBench的实际应用价值体现在其作为高效评测工具,可用于检验和优化面向政府开放数据、企业报表、医疗健康记录、环境监测等领域的智能数据分析系统。例如,城市管理者可利用基于该基准训练的模型自动回答关于建筑库存的演变趋势;公共卫生专家可借助洞见生成能力从大规模调查数据中自动提取关键发现,如辐射浓度区域差异或化学污染物随年龄的累积模式。通过揭示模型的典型失败模式,DataGovBench也为开发更精准的数据清洗、条件过滤和跨表关联算法提供了实践指导。
数据集最近研究
最新研究方向
DataGovBench聚焦于评估大语言模型在真实世界数据分析中的表现,前沿研究方向涵盖两大核心任务:一是处理复杂且可分解的表格问答,要求模型不仅具备多步推理能力,还需生成文本或可视化答案;二是探索式表格洞察生成,挑战模型在没有显式用户查询的情况下自主发现并归纳专家级别的数据趋势与结论。该基准源于政府开放数据,包含大规模多表格数据集及丰富的外部知识,揭示了当前最先进模型在条件过滤、数据转换、数值精确检索及叙述级推理等方面的显著短板,为构建能够应对现实数据复杂性的稳健智能体提供了关键评估框架与改进方向。
相关研究论文
  • 1
    Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities富士通研究·美国 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务