DataSpace
收藏资源简介:
DataSpace是一个用于评估数据代理在异构工作空间中进行可验证分析的数据集。它包含410个任务,覆盖CSV、JSON、SQLite、Markdown、PDF和视频六种模态,支持中文和英文跨语言工作空间。数据集提供任务问题、工作空间、参考答案和评估配置,用于测试数据代理在证据发现、结构化提取、跨表示连接、过滤、聚合、排序、时间推理和文档/视频理解等方面的能力。
DataSpace is a dataset designed to evaluate data agents' capabilities of conducting verifiable analysis in heterogeneous workspaces. It includes 410 tasks covering six modalities: CSV, JSON, SQLite, Markdown, PDF, and video, and supports cross-lingual workspaces in both Chinese and English. The dataset provides task questions, workspaces, reference answers and evaluation configurations, which are used to test data agents' abilities in multiple aspects including evidence discovery, structured extraction, cross-representation connection, filtering, aggregation, sorting, temporal reasoning, and document/video understanding.
数据集概述
DataSpace 是一个用于评估数据智能体(Data Agents)在异构工作空间中进行可验证分析能力的基准测试数据集。它被选为 KDD Cup 2026 数据智能体赛道的官方基准。
核心特性
- 任务规模: 包含 410 个任务,所有任务的问题和工作空间均公开可用。
- 多模态数据: 覆盖 6 种数据模态:CSV、JSON、SQLite、Markdown、PDF 和视频。
- 跨语言工作空间: 问题和数据工件可能同时包含中文和英文。
- 评估方式: 采用精确的语义评估,对表头进行列对齐,并对值和行顺序进行类型感知比较。
- 公共参考: 提供 60 个公开任务 的黄金结果和冻结配置,用于本地端到端评估。
- 数据规模: 总上下文 15.0 GB,包含 7,439 个文件,涵盖结构化数据、长文档和多媒体。
任务类型
任务涵盖了证据发现、结构化提取、跨表示形式的连接、过滤、聚合、排序、时间推理以及文档或视频理解。
数据集结构
数据通过 Hugging Face 分发。解压后的目录结构如下:
DataSpace-Benchmark/ ├── input/ │ └── task_N/ │ ├── task.json # 任务问题和异构工作空间 │ └── context/ ├── output/ # 60 个公开任务的 gold.csv │ └── task_N/gold.csv └── evaluation/ └── configs/task_N.json # 60 个公开任务的冻结配置
- input/: 包含所有 410 个任务的输入。
- output/: 包含 60 个代表性任务的参考答案。
- evaluation/: 包含对应 60 个任务的评估配置。
- 其余 350 个任务的参考答案将被保留用于官方完整基准评估。
评估指标与方法
- 主要指标: 任务准确率 (Task Accuracy)。
- 正确性条件: 只有当预测表在冻结配置下与完整的黄金结果完全匹配时,该任务才算正确。
- 评分细节: 不评估预测的表头和列顺序;使用任务特定的类型、数值精度、单位和行顺序语义来比较值。
- 评估器: 使用官方评估器,仅依赖 Python 标准库。
基线方法
仓库的 baseline/ 目录包含:
- DataSpace-Agent: 一个受控的 ReAct 风格智能体,配备三个通用工具。
- 六种主干模型 在相同智能体实现下的对比。
- 统一框架对比: 涵盖 DataSpace-Agent、Smolagents、Codex、Claude Code 和 Grok Build。
- 数据工作台运行时: 用于公平本地执行的共享离线环境。
开源与许可
- 代码和数据集 采用 MIT 许可证 发布。
- 数据下载: 可通过 Hugging Face 数据集页面获取。
引用
bibtex @misc{dataspace2027, title = {DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces}, author = {Boyan Li and Zhuowen Liang and Yupeng Xie and Xiaotian Lin and Tianqi Luo and Xinyu Liu and Yizhang Zhu and Zhangyang Peng and Yuan Li and Zhengxuan Zhang and Jiayi Zhang and Nan Tang and Guoliang Li and Yuyu Luo}, year = {2027}, howpublished = {Hugging Face dataset}, url = {https://huggingface.co/datasets/HKUSTDial/DataSpace} }




