DSEvaluation-Data
收藏资源简介:
DSEvaluation Data 是一个为 DSEvaluation 项目提供数据镜像和访问目录的数据集,涵盖了 9 个注册的基准测试。这些基准测试包括 AgenticDataBench(246 个任务)、CoDA-Bench(1009 个任务)、DABench(257 个任务)、DABstep(450 个任务)、DA-Code(500 个任务)、LongDS(68 个任务)、MLE-Dojo(10 个任务)、MoSciBench(88 个任务)和 ScienceAgentBench(102 个任务)。每个基准测试的目录中包含了任务元数据、数据集、标注数据、评估器、许可证信息等,但部分原始数据由于上游分发限制未直接镜像,而是保留了官方来源的访问方式。该数据集支持通过统一的命令行界面(dseval prepare BENCHMARK)准备任意基准测试,并提供了机器可读的 availability 和 source 信息(catalog.json)以及文件大小和 SHA-256 校验和(manifest.json)。
DSEvaluation Data is a dataset that provides data mirrors and access catalogs for the DSEvaluation project, covering 9 registered benchmark datasets. The included benchmarks are AgenticDataBench (246 tasks), CoDA-Bench (1009 tasks), DABench (257 tasks), DABstep (450 tasks), DA-Code (500 tasks), LongDS (68 tasks), MLE-Dojo (10 tasks), MoSciBench (88 tasks), and ScienceAgentBench (102 tasks). Each benchmark directory contains task metadata, datasets, annotated data, evaluators, license information, and other related materials. However, due to upstream distribution restrictions, some original data are not directly mirrored, and only the access methods from official sources are retained. This dataset supports preparing any benchmark via the unified command-line interface (dseval prepare BENCHMARK), and provides machine-readable availability and source information (catalog.json) alongside file sizes and SHA-256 checksums (manifest.json).
数据集概述
DSEvaluation Data 是一个用于数据科学评估的数据集镜像与访问目录,整合了 9 个已注册于 DSEvaluation 的基准测试(Benchmark)。该数据集提供了统一的接口,便于用户通过同一个命令行工具准备和访问所有基准测试。
包含的基准测试列表
该数据集包含以下 9 个基准测试,具体信息如下:
| 目录名称 | 基准测试名称 | 任务数量 | 公共内容 | 原始数据 |
|---|---|---|---|---|
agenticdatabench/ |
AgenticDataBench | 246 | 任务、数据集、金标准、评估器 | 已镜像(Mirrored) |
codabench/ |
CoDA-Bench | 1,009 | 任务元数据、许可证、归档校验和 | 官方 Kaggle 衍生归档 |
dabench/ |
DABench | 257 | 问题、表格、标签 | 已镜像(Mirrored) |
dabstep/ |
DABstep | 450 | 上下文、任务、许可证 | 已镜像(Mirrored,不包括历史提交) |
dacode/ |
DA-Code | 500 | 源代码、金标准、评估配置 | 已镜像(Mirrored) |
longds/ |
LongDS | 68 | 固定的源清单 | 官方数据集 |
mledojo/ |
MLE-Dojo | 10 | 精选任务目录和访问说明 | 官方 Kaggle 竞赛 |
moscibench/ |
MoSciBench | 88 | 官方归档、清单、许可证 | 已镜像(Mirrored,含上游溯源) |
sab/ |
ScienceAgentBench | 102 | 已验证的任务元数据和访问说明 | 官方密码保护归档 |
数据使用说明
- 顶层目录结构与 9 个基准插件一一对应。
metadata-mirrored条目:这些条目可通过 DSEvaluation 运行,但其原始数据资产仍保留在官方提供方,因为上游再分发条款不允许在此处公开复制。例如:- ScienceAgentBench 要求用户不要重新分发未压缩的数据。
- MLE-Dojo 要求用户接受每个 Kaggle 竞赛的条款。
- 准备基准测试:所有基准测试均可通过同一条命令行工具准备,命令如下:
bash uv run dseval prepare BENCHMARK
- 机器可读信息:
catalog.json文件提供了数据可用性和来源的机器可读信息;manifest.json文件提供了文件大小和 SHA-256 校验和。




