遇见数据集

NatureBench

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

NatureBench是一个跨学科基准测试数据集,旨在评估AI编码代理是否能够匹配Nature系列期刊论文中已发表的最先进成果。该数据集从2022年至2025年间经过同行评审的Nature系列期刊论文中提取了90个任务(共333个评估实例),涵盖六个科学领域:细胞组学、蛋白质生物学、生物医学建模、物理建模、分子设计和关系推理。每个任务要求代理解决一个真实的科学机器学习问题,并通过与源论文报告的最先进成果进行标准化相对差距评分来评估性能,确保不同指标之间的结果可比性。数据集基于NatureGym自动化流程构建,将已发表的论文转换为容器化的任务包,包含任务简介、论文数据集、带有隐藏真实值的保留测试集以及自动化评估器。评估在隔离容器中进行,网络搜索被禁用,要求代理仅通过任务简介和数据解决问题,而非检索原始论文结果。数据集结构包括任务目录,每个任务包含问题描述、评估数据、环境配置、许可证文件和元数据。

NatureBench is an interdisciplinary benchmark dataset designed to evaluate whether AI coding agents can match the state-of-the-art results published in Nature family journals. This dataset extracts 90 tasks (totaling 333 evaluation instances) from peer-reviewed Nature family journal papers published between 2022 and 2025, covering six scientific domains: cytomics, protein biology, biomedical modeling, physical modeling, molecular design, and relational reasoning. Each task requires the agent to solve a real-world scientific machine learning problem, and performance is evaluated via a standardized relative gap score against the state-of-the-art results reported in the source paper, ensuring result comparability across different metrics. Built on the NatureGym automated pipeline, the dataset converts published papers into containerized task packages, which include task descriptions, paper-provided datasets, held-out test sets with hidden ground truth values, and automated evaluators. Evaluations are conducted in isolated containers, with web searches disabled, requiring the agent to solve the problem solely using the task description and provided data, rather than retrieving results from the original paper. The dataset structure consists of task directories, with each task containing a problem description, evaluation data, environment configuration, license files, and metadata.

创建时间:
2026-06-22
原始信息汇总

NatureBench 数据集概述

NatureBench 是一个跨学科基准测试,包含 90 个任务(333 个评估实例),源自 2022 至 2025 年间发表的同行评审 Nature 系列论文,覆盖 6 个科学领域。旨在评估 AI 编程代理能否超越单纯的复现,实现科学发现:每个任务要求代理解决一个真实的科学机器学习问题,并根据原始论文报告的当前最佳水平(SOTA)进行评分。

  • 编程语言:英语
  • 许可证:其他(MIT 及第三方数据许可证)
  • 数据集大小:< 1K
  • 标签:编程代理、基准测试、科学机器学习、自然

数据集结构

数据集按 tasks/<case_id>/ 目录组织,每个任务包含以下组件:

路径 描述
tasks/<case_id>/problem/ 代理可见的任务描述和可见输入数据
tasks/<case_id>/evaluation/ 评估器和隐藏真实标签,运行期间不向代理暴露
tasks/<case_id>/environment/ 任务特定的容器化环境
tasks/<case_id>/licenses/ 该任务数据的第三方许可声明
tasks/<case_id>/metadata.json 任务名称、领域、计算资源需求及每个实例的 SOTA 分数

覆盖领域

六个科学领域:细胞组学、蛋白质生物学、生物医学建模、物理建模、分子设计、关系推理。

评估方式

每个任务的评分基于 SOTA 归一化相对差距,确保不同指标的得分具有可比性。代理在隔离容器中评估,禁用网络搜索,必须仅通过任务简介和数据解决问题。后验有效性裁判会筛选出取巧的解决方案。

如何使用

使用配套代码运行 NatureBench,仅下载数据可通过以下命令:

bash python run_naturebench.py --dataset-id FrontisAI/NatureBench --tasks all --download-only

详细安装、代理配置和评估说明参见 GitHub 代码仓库:https://github.com/FrontisAI/NatureBench

排行榜

项目排行榜位于:https://frontisai.github.io/NatureBench/

许可证

顶层 LICENSE 仅适用于 NatureBench 原创贡献,第三方数据受各任务 tasks/<case_id>/licenses/ 目录下声明的条款约束。

引用

bibtex @misc{naturebench2026, title = {NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?}, howpublished = {url{https://github.com/FrontisAI/NatureBench}}, year = {2026} }

搜集汇总
数据集介绍
NatureBench 数据集图片
构建方式
NatureBench的构建依托于NatureGym自动化管道,该管道能够将已发表的学术论文转化为容器化的任务包。每个任务包包含任务说明、论文中的数据集、带有隐藏真实标签的留出测试集以及自动化评估器。该基准测试从2022至2025年间经同行评审的Nature系列论文中精选出90个任务,涵盖细胞组学、蛋白质生物学、生物医学建模、物理建模、分子设计与关系推理六大科学领域。针对每个任务,采用SOTA归一化相对差距来衡量AI编码智能体与论文中报告的最先进水平之间的差异,从而保证跨异构指标的可比性。评估过程在禁用了网络搜索的隔离容器中进行,智能体须仅凭任务说明和数据解决问题,并由事后的有效性审查器筛查是否存在捷径式的取巧方案。
特点
NatureBench具备鲜明的跨学科与高挑战性特质。其任务规模虽仅为90项,却覆盖了六大科研领域,每个任务均对应Nature系列论文中明确报告的最先进结果,具备权威的评分基准。该基准采用了SOTA归一化相对差距这一新型评价指标,使得不同度量尺度下的任务结果能够被公平比较。评估环境为完全隔离的容器,且禁止访问外部网络,从而杜绝了智能体通过检索原文或外部资源获取答案的可能。此外,引入事后有效性审查机制,可有效识别并排除利用任务设计漏洞的捷径解法,确保评估结果真实反映智能体在科学发现层面的能力。
使用方法
使用NatureBench需配合其官方GitHub仓库中提供的代码。用户可通过运行`python run_naturebench.py --dataset-id FrontisAI/NatureBench --tasks all --download-only`命令下载全部数据,该命令将仅获取数据集而无需执行完整评测。每个任务在数据集中的组织方式为以任务ID命名的文件夹,结构清晰:`problem`目录存放智能体可见的任务描述与输入数据;`evaluation`目录包含评估器与隐藏真实标签,在运行期间不对智能体暴露;`environment`目录提供任务特定的容器化环境;`licenses`目录管理第三方数据的许可声明;`metadata.json`则记录任务名称、所属领域、计算资源需求及各实例的SOTA分数。更多关于安装、智能体配置与完整评测流程的说明,请参见GitHub仓库中的文档。
背景与挑战
背景概述
NatureBench是由FrontisAI团队于2026年发布的一项跨学科基准测试,旨在评估AI编程代理在科学机器学习任务中的表现,特别是能否复现乃至超越Nature系列论文中报告的当前最优结果。该基准从2022至2025年间发表的同行评审Nature家族论文中提炼出90项任务,覆盖细胞组学、蛋白质生物学、生物医学建模、物理建模、分子设计与关系推理六大科学领域。每项任务均基于原始论文的数据集与自动化评估流程,通过SOTA归一化相对差距评分,确保跨异构指标的可比性。NatureBench的发布为验证AI代理在科学发现中的能力提供了标准化平台,对推动AI辅助科研的可靠性评估具有重要影响力。
当前挑战
NatureBench面临的首要挑战是解决科学发现中的复现与创新问题:AI代理需在无法联网搜索的环境下,仅凭任务简介与给定数据自主求解,并达到甚至超越原始论文的SOTA水平,这要求代理具备深度的科学推理与代码执行能力。此外,构建过程中亦挑战重重:从不同领域论文中提取标准化任务需处理异构数据格式与评估指标,设计容器化环境以隔离外部干扰,并确保第三方数据的合规使用。90项任务仅涵盖有限领域,未来扩展至更多学科及动态更新SOTA仍需持续投入,以维持基准的时效性与代表性。
常用场景
经典使用场景
NatureBench是一个跨学科基准,由90项从2022至2025年Nature系列同行评审论文中提炼的任务构成,覆盖细胞组学、蛋白质生物学、生物医学建模、物理建模、分子设计和关系推理六大科学领域。其经典使用场景在于评测AI编程代理能否在缺乏外部信息检索的条件下,仅凭任务简介和给定数据,复现乃至超越原始文献中报告的最先进性能(SOTA)。每个任务均配备标准化评估器与隐藏真值,通过SOTA归一化相对差距得分实现跨异构指标的横向比较,从而揭示当前编码智能体在真实科研问题上的推理极限。
衍生相关工作
NatureBench的提出催生了一系列后续研究方向,包括利用NatureGym管道自动化构建更多学科任务包以扩展基准覆盖面,以及针对特定领域如分子设计或单细胞组学进行细粒度性能分析。此外,部分研究开始探索如何将SOTA归一化相对差距得分作为奖励信号,通过强化学习微调代码大语言模型以提升其在科学发现场景中的表现。该基准还启发了关于后验有效性判别器设计的方法论讨论,推动了科研任务中对抗捷径学习与保障评测公平性的技术发展。
数据集最近研究
最新研究方向
NatureBench作为前沿跨学科基准,聚焦于评估AI编码智能体在真实科学机器学习任务中复现乃至超越Nature系列论文所报道的顶尖性能。该数据集从2022至2025年间发表的六大科学领域(包括细胞组学、蛋白质生物学、生物医学建模、物理建模、分子设计与关系推理)的同行评议文献中提炼出90项精细化任务,通过量化智能体与原文SOTA指标之间的归一化相对差距,构建了一个公平且可比较的评估框架。其研究导向已从单纯的成果复现转向探索AI在科学发现中的自主性,通过隔离执行环境和后验有效性审查机制,杜绝捷径解法,确保评估结果真实反映智能体在未见数据上的推理与泛化能力。这一方向紧密呼应了科学界对AI驱动加速发现的迫切需求,尤其在自动化实验设计和知识挖掘领域,NatureBench为衡量智能体是否具备独立推进科学前沿的潜力提供了关键工具与标准化标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务