遇见数据集

DataSpace

收藏
github2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

DataSpace是一个用于评估数据代理在异构工作空间中进行可验证分析的数据集。它包含410个任务,覆盖CSV、JSON、SQLite、Markdown、PDF和视频六种模态,支持中文和英文跨语言工作空间。数据集提供任务问题、工作空间、参考答案和评估配置,用于测试数据代理在证据发现、结构化提取、跨表示连接、过滤、聚合、排序、时间推理和文档/视频理解等方面的能力。

DataSpace is a dataset designed to evaluate data agents' capabilities of conducting verifiable analysis in heterogeneous workspaces. It includes 410 tasks covering six modalities: CSV, JSON, SQLite, Markdown, PDF, and video, and supports cross-lingual workspaces in both Chinese and English. The dataset provides task questions, workspaces, reference answers and evaluation configurations, which are used to test data agents' abilities in multiple aspects including evidence discovery, structured extraction, cross-representation connection, filtering, aggregation, sorting, temporal reasoning, and document/video understanding.

创建时间:
2026-07-21
原始信息汇总

数据集概述

DataSpace 是一个用于评估数据智能体(Data Agents)在异构工作空间中进行可验证分析能力的基准测试数据集。它被选为 KDD Cup 2026 数据智能体赛道的官方基准。

核心特性

  • 任务规模: 包含 410 个任务,所有任务的问题和工作空间均公开可用。
  • 多模态数据: 覆盖 6 种数据模态:CSV、JSON、SQLite、Markdown、PDF 和视频。
  • 跨语言工作空间: 问题和数据工件可能同时包含中文和英文。
  • 评估方式: 采用精确的语义评估,对表头进行列对齐,并对值和行顺序进行类型感知比较。
  • 公共参考: 提供 60 个公开任务 的黄金结果和冻结配置,用于本地端到端评估。
  • 数据规模: 总上下文 15.0 GB,包含 7,439 个文件,涵盖结构化数据、长文档和多媒体。

任务类型

任务涵盖了证据发现、结构化提取、跨表示形式的连接、过滤、聚合、排序、时间推理以及文档或视频理解。

数据集结构

数据通过 Hugging Face 分发。解压后的目录结构如下:

DataSpace-Benchmark/ ├── input/ │ └── task_N/ │ ├── task.json # 任务问题和异构工作空间 │ └── context/ ├── output/ # 60 个公开任务的 gold.csv │ └── task_N/gold.csv └── evaluation/ └── configs/task_N.json # 60 个公开任务的冻结配置

  • input/: 包含所有 410 个任务的输入。
  • output/: 包含 60 个代表性任务的参考答案。
  • evaluation/: 包含对应 60 个任务的评估配置。
  • 其余 350 个任务的参考答案将被保留用于官方完整基准评估。

评估指标与方法

  • 主要指标: 任务准确率 (Task Accuracy)
  • 正确性条件: 只有当预测表在冻结配置下与完整的黄金结果完全匹配时,该任务才算正确。
  • 评分细节: 不评估预测的表头和列顺序;使用任务特定的类型、数值精度、单位和行顺序语义来比较值。
  • 评估器: 使用官方评估器,仅依赖 Python 标准库。

基线方法

仓库的 baseline/ 目录包含:

  • DataSpace-Agent: 一个受控的 ReAct 风格智能体,配备三个通用工具。
  • 六种主干模型 在相同智能体实现下的对比。
  • 统一框架对比: 涵盖 DataSpace-Agent、Smolagents、Codex、Claude Code 和 Grok Build。
  • 数据工作台运行时: 用于公平本地执行的共享离线环境。

开源与许可

  • 代码和数据集 采用 MIT 许可证 发布。
  • 数据下载: 可通过 Hugging Face 数据集页面获取。

引用

bibtex @misc{dataspace2027, title = {DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces}, author = {Boyan Li and Zhuowen Liang and Yupeng Xie and Xiaotian Lin and Tianqi Luo and Xinyu Liu and Yizhang Zhu and Zhangyang Peng and Yuan Li and Zhengxuan Zhang and Jiayi Zhang and Nan Tang and Guoliang Li and Yuyu Luo}, year = {2027}, howpublished = {Hugging Face dataset}, url = {https://huggingface.co/datasets/HKUSTDial/DataSpace} }

搜集汇总
数据集介绍
DataSpace 数据集图片
构建方式
DataSpace数据集旨在评估数据代理在异构工作空间中进行可验证分析的能力。其构建围绕自包含、任务本地的分析单位展开,每个任务包含一个问题以及一个融合多种数据模态的工作空间。该工作空间可能整合CSV、JSON、SQLite、Markdown、PDF及视频等六种类型的数据制品。数据集共包含410个任务,所有任务的问题与工作空间均公开可访问。其中,60个代表性任务提供了参考答案与冻结评估配置,用于本地端到端评估,其余350个任务的参考答案则被保留用于官方完整基准评估。数据集的发布依托Hugging Face平台,以版本化压缩包的形式提供,并附带SHA256校验文件以确保数据完整性。
特点
DataSpace数据集的核心特点在于其高度异构与跨语言的工作空间设计。数据集覆盖结构化数据、长文档与多媒体等共计7,439个文件,上下文总量达15.0 GB,体现了数据规模与模态的多样性。工作空间支持中文与英文双语环境,问题与数据制品可能混合出现,考验代理的多语言理解与推理能力。评估体系采用精确与语义相结合的方式,包含头部不变的列对齐、类型感知的值比较与行排序语义分析,确保评估的鲁棒性与公平性。任务类型涵盖证据发现、结构化抽取、跨表示连接、过滤、聚合、排序、时序推理以及文档与视频理解等广泛的分析场景。
使用方法
使用DataSpace数据集需首先通过Hugging Face Hub客户端下载并校验压缩包,解压后即可获得包含任务输入、输出及评估配置的目录结构。每个任务对应一个工作空间及问题文件,代理需为每个任务生成预测结果,并以CSV格式存放于指定目录。官方评估器基于Python标准库实现,通过命令行参数指定预测目录、参考答案根目录与配置文件根目录,生成详细的评估摘要。评估的主要指标为任务准确率,要求预测表格在冻结配置下与完整参考结果完全一致,但表头与列顺序不参与评分。此外,数据集提供了完整的基线代码,包括受控的ReAct风格代理、多骨干网络对比以及统一运行环境,支持本地可重复实验与沙箱执行。
背景与挑战
背景概述
DataSpace是由香港科技大学(HKUST)数据交互与语言实验室(Dial)主导创建的大规模异构工作空间数据分析基准数据集,于2027年正式发布。该数据集聚焦于评估数据代理(Data Agent)在跨模态、跨语言的工作空间中完成可验证分析任务的能力,其核心研究问题在于如何使智能体自主发现、整合并推理由CSV、JSON、SQLite、Markdown、PDF及视频等六种模态构成的异构证据,最终以标准化表格形式输出完整结果。DataSpace已被选为KDD Cup 2026数据代理赛道的官方基准测试,涵盖410个精心设计的任务,包含超过15GB的上下文数据,对推动可验证的异构数据分析研究具有里程碑式的影响力。
当前挑战
DataSpace所解决的领域挑战在于,现有数据分析基准多局限于单一模态或结构化数据,无法评估智能体在真实世界中面临的异构、跨模态信息融合问题。构建过程中面临的核心挑战包括:1)设计统一的任务评估框架,确保不同模态的证据能被公平且精确地比较,最终采用头部不变的列对齐与类型感知的行值语义匹配方法;2)构建跨语言(中英文混合)的工作空间,要求数据代理能理解并处理不同语言的问题与数据工件;3)在410个任务中仅公开60个任务的参考答案与评估配置,其余350个任务的结果被保留用于官方评测,这要求设计不可逆的评测机制以防止数据泄漏,同时保证本地可复现的端到端评估流程。
常用场景
经典使用场景
在数据密集型科学与工业分析领域,DataSpace作为首个面向异构工作区的可验证分析基准,其最经典的使用场景在于评估数据智能体在自包含任务空间中对多模态数据的综合处理能力。每个任务均融合CSV、JSON、SQLite、Markdown、PDF乃至视频等六种模态的工件,智能体需自主发现并整合相关证据,最终以可验证表格形式返回完整结果。这一设定精准模拟了真实世界中跨格式、跨语言的数据分析挑战,尤其适合检验智能体在证据发现、结构化提取、跨表征联接、过滤、聚合、排序、时序推理以及文档或视频理解等核心环节的鲁棒性。通过任务精度这一严格指标,DataSpace为衡量数据智能体系统级性能提供了可靠且可复现的测试环境。
实际应用
DataSpace所倡导的智能体范式在实际产业环境中具有广阔的应用前景。在金融领域,分析报告常包含结构化表格、PDF说明文档及视频会议记录,DataSpace的跨模态整合能力可辅助分析师自动化合成跨来源的财务指标与风险信号。在医疗健康场景中,患者数据可能散见于电子病历的JSON导出、检验报告的CSV汇总以及影像诊断的PDF附件,数据智能体能够无缝关联这些异构信息,辅助临床决策支持。此外,在跨国企业的商务智能分析中,中英文混排的数据源极为常见,DataSpace所具备的跨语言理解与对齐能力,能够显著降低人工协调成本,提升数据洞见的提取效率与可靠性。
衍生相关工作
DataSpace衍生出一系列推动数据智能体发展的关键技术工作。其核心基线模型DataSpace-Agent采用受控的ReAct风格架构,集成了三种通用工具,为后续智能体设计提供了可复现的基准方案。围绕该平台,研究者已开展六种不同骨干模型在同一智能体实现下的对比分析,揭示了模型规模与多模态推理能力之间的内在关联。此外,统一的Data Workbench Runtime为不同智能体框架(如Smolagents、Codex、Claude Code及Grok Build)提供了公平的本地执行环境,促进了智能体系统间横向比较的方法论创新。这些衍生工作共同深化了学术界对于异构工作区中可验证分析任务的理解,推动了从单模态推理向多源证据协同判定的范式迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务