bamboo-papers
收藏资源简介:
BAMBOO 是一个大规模基准数据集,旨在评估 AI 代理使用作者原始代码复现机器学习研究论文的能力。数据集包含 6,148 篇论文的元数据,其中 5,495 篇(89%)包含原始 PDF,3,983 篇(64%)包含结构化 Markdown 文件。所有论文均来自顶级学术会议(如 ICML、ICLR、NeurIPS、CVPR、ICCV、ACL、EMNLP、AAAI、ICRA),且均包含已验证的代码链接和提交记录。数据集还包含 100% 的论文摘要和难度评分。PDF 文件使用 MinerU v2.7.6 的 hybrid-auto-engine 后端提取,保留了段落顺序、表格结构、数学公式和图表引用。数据集文件包括完整的论文元数据 JSON 文件、原始 PDF 文件夹和提取的 Markdown 文件夹。
BAMBOO is a large-scale benchmark dataset designed to evaluate the ability of AI Agents to reproduce machine learning research papers using the authors' original code. The dataset contains metadata for 6,148 papers, among which 5,495 (89%) include the original PDF files, and 3,983 (64%) include structured Markdown files. All papers are sourced from top-tier academic conferences including ICML, ICLR, NeurIPS, CVPR, ICCV, ACL, EMNLP, AAAI, and ICRA, and all include verified code links and submission records. The dataset also covers 100% of the paper abstracts and difficulty ratings. PDF files were extracted using the hybrid-auto-engine backend of MinerU v2.7.6, preserving paragraph order, table structures, mathematical formulas, and figure references. The dataset files include complete paper metadata JSON files, the original PDF folder, and the extracted Markdown folder.
BAMBOO: Benchmark for Autonomous ML Build-and-Output Observation 数据集概述
数据集简介
BAMBOO是一个用于评估AI智能体利用作者原始代码复现机器学习研究论文能力的大规模基准数据集。
关键统计信息
- 总论文数:6,148
- 包含PDF的论文数:5,495 (89%)
- 包含结构化Markdown的论文数:3,983 (64%)
- 覆盖年份:2025
- 代码覆盖率:100%(所有论文均包含已验证的代码链接和代码提交记录)
- 摘要覆盖率:100%
- 难度分数覆盖率:100%
数据来源与构成
- 来源会议:ICML, ICLR, NeurIPS, CVPR, ICCV, ACL, EMNLP, AAAI, ICRA
- 包含结构化Markdown的论文会议分布:
- ICML:1,109
- ICLR:669
- ICCV:501
- CVPR:408
- NeurIPS:359
- ACL:327
- EMNLP:294
- AAAI:275
- ICRA:41
文件内容
bamboo_dataset.json:完整的论文元数据文件,包含6,148条记录。paper_pdfs/:原始论文PDF文件目录,包含5,495个文件,大小约32GB。paper_markdowns/:由MinerU混合自动引擎提取的Markdown文件目录,包含3,983个文件。
数据处理
- PDF提取工具:使用MinerU v2.7.6(https://github.com/opendatalab/MinerU)的
hybrid-auto-engine后端(基于VLM的最高质量提取)。 - 提取内容保留:
- 正确的段落顺序
- 表格结构(以Markdown格式)
- 数学公式
- 图表引用
使用方式
可通过Hugging Face Hub下载元数据及特定论文的Markdown文件。示例如下: python from huggingface_hub import hf_hub_download import json
下载元数据
path = hf_hub_download("xln3/bamboo-papers", "bamboo_dataset.json", repo_type="dataset") papers = json.load(open(path))
筛选包含Markdown的论文
papers_with_md = [p for p in papers if p["has_md"]] print(f"{len(papers_with_md)} papers with structured markdown")
下载特定论文的Markdown文件
md_path = hf_hub_download("xln3/bamboo-papers", "paper_markdowns/bamboo-00001.md", repo_type="dataset")
许可信息
本数据集采用MIT许可证。




