遇见数据集

FrontierChallenge

收藏
Hugging Face2026-09-01 更新2026-09-02 收录
官方服务:

资源简介:

FrontierChallenge 是一个用于评估科学工作流完成能力的基准数据集。它包含 97 个科学工作流任务,每个任务提供英文指令、输入、Harbor 定义、领域标签以及可重新分发的开放运行时镜像。数据集包含一个 manifest.jsonl 文件,记录任务 ID、分类、难度、运行时间和指令;每个任务在 tasks/<task-id>/ 目录下包含 instruction.md、任务元数据、环境定义和 agent 可见输入;images/ 目录存储了 81 个开放镜像任务的已验证 linux/amd64 Docker 归档。另有 16 个 ORCA 任务定义和输入,但 ORCA 本身及其镜像需从官方提供方获取。该数据集不含评分器、规则、固定装置或参考输出,这些信息存储在单独的加密数据集中。数据集适用于评估科学工作流中 agent 的任务完成能力,典型使用方式是通过 FrontierChallenge 运行时工具下载、验证、加载镜像并运行评分。

FrontierChallenge is a benchmark dataset for evaluating scientific workflow completion capabilities. It contains 97 scientific workflow tasks, each providing English instructions, inputs, Harbor definitions, domain labels, and redistributable open runtime images. The dataset includes a manifest.jsonl file recording task IDs, categories, difficulty, runtime, and instructions; each task under tasks/<task-id>/ contains instruction.md, task metadata, environment definitions, and agent-visible inputs; the images/ directory stores verified linux/amd64 Docker archives for 81 open image tasks. There are also 16 ORCA task definitions and inputs, but ORCA itself and its images must be obtained from the official provider. The dataset does not include scorers, rules, fixtures, or reference outputs, which are stored in a separate encrypted dataset. It is suitable for evaluating agent task completion abilities in scientific workflows, typically used via the FrontierChallenge runtime tool to download, verify, load images, and run scoring.

创建时间:
2026-08-23
原始信息汇总

FrontierChallenge 数据集概述

基本信息

  • 数据集名称:FrontierChallenge
  • 许可证:CC-BY-4.0
  • 语言:英语
  • 任务类别:其他(other)
  • 标签:科学智能体(scientific-agents)、基准测试(benchmark)、评估(evaluation)
  • 数据集大小:包含 97个科学工作流任务
  • 数据集配置:默认配置(default),包含训练集(train)文件 manifest.jsonl

内容与结构

路径 内容
manifest.jsonl 包含任务ID、分类、难度、运行时和指令等行的数据集查看内容
tasks/<task-id>/ 每个任务的指令(instruction.md)、任务元数据、环境定义和智能体可见输入
images/ 已验证的 linux/amd64 Docker归档,覆盖81个开放镜像任务

核心特点

  1. 任务类型:提供97个科学工作流任务,附带纯文本英文指令、输入、Harbor定义、领域标签和可再分发的开放运行时镜像。
  2. ORCA任务:包含16个ORCA任务的定义和输入,但ORCA本身及相关镜像不随数据集分发,需由评估者从官方提供商获取,并遵循运行时仓库的本地镜像教程。
  3. 无评分内容:数据集中不含评分器、评分标准、固定环境或参考输出,这些内容以加密归档形式存储于单独的 apodex/FrontierChallenge-reference 数据集中。

使用方式

  1. 运行时:使用 FrontierChallenge 运行时(来自 ApodexAI/FrontierAgent 仓库)下载两个数据集、验证共享注册表、加载镜像归档、运行Harbor并对任务进行评分。
  2. 设置与评估示例:通过 setup.sh 脚本设置跟踪(track)为开放(open),并利用 run_eval.sh 脚本指定智能体(如 claude-code)和模型执行评估。
  3. 验证:可使用 python tools/verify_dataset.py 验证下载的解决包。

引用信息

  • Apodex 1.1:e-print arXiv:2608.23283(cs.AI)
  • FrontierChallenge:e-print arXiv:2608.24979(cs.AI),作者包括 Liangcai Su、Zhaopeng Feng、Zhuo Chen 等。
搜集汇总
数据集介绍
FrontierChallenge 数据集图片
构建方式
FrontierChallenge数据集由Apodex团队精心构建,旨在评估科学智能体在复杂工作流中的完成能力。其构建遵循严谨的科学研究范式,汇聚了97项科学工作流任务,每项任务均配备自然语言英文指令、输入数据、Harbor环境定义、领域标签及可再分发的开放运行时镜像。数据集以manifest.jsonl文件为核心索引,详细记录了任务标识、分类、难度、运行时及指令等元数据,并将任务定义与输入存放于tasks目录,镜像归档于images目录。同时,为了确保评估的公正性与安全性,评分器、评分标准及参考输出等关键要素被加密存储于独立的私有数据集中,仅通过配套的FrontierChallenge运行时工具方可访问,从而将数据集、参考信息与运行环境三者有机整合,构建出一个完整、可复现的科学智能体基准测试体系。
特点
FrontierChallenge数据集拥有鲜明且多维度的特征。在任务构成上,其涵盖了81项开放镜像任务与16项ORCA特定任务,后者虽定义了任务与输入,但并未包含ORCA本体及其镜像,要求评估者依据官方指南自行配置,这赋予了数据集高度的灵活性与真实性。数据集注入了科学领域标签与难度分级,为研究不同智能体在多样化场景下的表现提供了丰富维度。值得一提的是,FrontierChallenge严格遵循开放科学原则,采用cc-by-4.0许可,所有任务指令与输入均以明文形式呈现,与此同时,评分体系与参考输出的加密隔离设计,有效规避了测试集潜在的数据污染风险,确保了评估指标的真实可靠,为科学智能体的研发提供了坚实的数据基石。
使用方法
FrontierChallenge数据集的部署与使用路径清晰,旨在最大化其效用。使用者首先需克隆FrontierAgent代码库,并通过pip安装依赖,随后在benchmarks/frontierchallenge目录下执行setup.sh脚本以载入数据集与镜像。通过配置.env文件,可设置HF_TOKEN等必要参数,进而运行run_eval.sh脚本来启动自动化评估流程,该脚本支持指定智能体类型(如claude-code)及模型,并可针对特定任务(如task_011_cell_migration_wound_healing)进行定向测试。在评估前,使用者还需通过verify_dataset.py工具校验下载的solve包完整性。对于ORCA任务,则需遵循官方教程获取ORCA及其镜像,该过程显著增加了数据集的部署深度与挑战性。总体而言,该数据集提供了一套标准化的科学智能体评估协议,可复现性强,适合作为各类前沿智能体模型性能比对的基准平台。
背景与挑战
背景概述
FrontierChallenge数据集由Apodex团队于2026年创建,旨在评估科学工作流完成能力,是Apodex 1.1项目的一部分。该数据集包含97个科学工作流任务,每个任务均提供英文指令、输入、Harbor定义、领域标签及可再分发的开放运行时镜像。核心研究问题在于如何量化智能体在复杂科学工作流中的自主执行能力,涵盖计算生物学、材料科学等前沿领域。其影响力体现在为科学智能体提供统一基准,推动了自动化实验设计与执行的研究进展,并为后续如ORCA等专用工具集成提供了标准化接口。
当前挑战
该数据集面临的挑战包括:首先,在领域层面,科学工作流任务复杂度高,涉及多步骤动态决策与领域知识融合,对智能体的泛化能力与鲁棒性提出严苛要求。其次,在构建过程中,需确保任务的清晰指令与可重复执行性,同时解决开放图像与专有工具(如ORCA)的集成难题,防止数据泄露。部分任务依赖外部运行时环境,增加了基准评估的复现门槛。此外,加密引用集的设计虽保护了评分标准,但也考验评估流程的安全性与公平性。综上所述,FrontierChallenge推动了基准测试从静态问答向动态执行范式的转型。
常用场景
经典使用场景
FrontierChallenge数据集在科学智能体(scientific agents)领域扮演着关键角色,它提供了97个涵盖广泛科学领域的复杂工作流任务。这些任务以纯文本指令形式呈现,并伴随完整的输入数据、环境定义及可复现的运行时镜像,使得研究人员能够系统地评估智能体在端到端科学实验执行中的表现。该数据集特别适用于测试自主智能体在真实科研场景下的规划、工具调用、代码执行和结果解读等综合能力,成为衡量前沿科学智能体性能的标准化基准。
衍生相关工作
FrontierChallenge的出现激发了大量后续研究,并催生了多个相关领域的经典工作。一方面,它拓展了科学工作流自动化的研究生态,例如基于其任务结构发展出的更高效的智能体规划算法和工具组合策略。另一方面,数据集的设计哲学也影响了后续基准的构建,推动了像ORCA这类高保真科学环境的集成。此外,围绕评价指标、可重复性和安全性,研究者也提出了多种改进方案,形成了一个以FrontierChallenge为核心的科学智能体评估与优化研究前沿。
数据集最近研究
最新研究方向
FrontierChallenge数据集聚焦于评估前沿AI智能体在复杂科学工作流中的自主完成能力,其最新研究方向在于构建高难度、真实场景的基准测试,涵盖细胞迁移、伤口愈合等生物学任务,并通过Harbor定义标准化环境,推动智能体从简单对话向科学发现与实验操作协同的跨越。该基准强调开放运行时镜像与严格验证流程,与当前AI for Science的热点紧密结合,旨在量化大模型智能体在端到端科研流程中的实际效用,其影响力体现在为科学智能体的可复现评估设立新标杆,进而引导该领域向实用化、可信赖方向发展,对加速科学发现自动化进程具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务