遇见数据集

researchclaweval

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

AI Scientist Benchmark Artifacts 是一个用于评估和比较 AI 科学家系统的基准数据集。该数据集包含七个 AI 科学家系统(包括 EvoScientist、Auto Research Claw、Deep Scientist、AI Researcher、ARIS、The AI Scientist v2 和 Dr. Claw)在同一个研究主题上生成的产物。每个主题包由输入数据、输出产物(如生成的研究报告、代码或脚本、实验日志、提交文件以及可用的评估结果)和元数据文件(metadata.json)组成,其中元数据记录了主题 ID、名称、任务名称、参与系统列表和发布状态。数据集当前版本包含一个主题,未来计划扩展更多主题。其目录结构清晰,分为 inputs/ 和 outputs/ 子目录,分别对应七个系统的输入和输出文件。该数据集旨在支持对 AI 科学家系统的性能评估,可用于研究系统是否能够完成研究任务、产生何种产物、在何处失败以及不同系统在同一主题上的行为差异。基准元数据和打包文件遵循 Apache 2.0 许可证,而第三方基准数据和原始挑战材料则遵循各自的许可证。

AI Scientist Benchmark Artifacts is a benchmark dataset for evaluating and comparing AI scientist systems. The dataset contains artifacts generated by seven AI scientist systems (including EvoScientist, Auto Research Claw, Deep Scientist, AI Researcher, ARIS, The AI Scientist v2, and Dr. Claw) on the same research topic. Each topic package consists of input data, output artifacts (such as generated research reports, code or scripts, experiment logs, submission files, and available evaluation results), and a metadata file (metadata.json), where the metadata records the topic ID, name, task name, list of participating systems, and release status. The current version of the dataset includes one topic, with plans to expand to more topics in the future. Its directory structure is clear, divided into inputs/ and outputs/ subdirectories, corresponding to the input and output files of the seven systems, respectively. The dataset aims to support performance evaluation of AI scientist systems and can be used to study whether systems can complete research tasks, what artifacts they produce, where they fail, and the behavioral differences between different systems on the same topic. The benchmark metadata and packaged files follow the Apache 2.0 license, while third-party benchmark data and original challenge materials follow their respective licenses.

创建时间:
2026-06-03
原始信息汇总

数据集概述

数据集名称:AI Scientist Benchmark Artifacts

许可协议:Apache 2.0(基准元数据和打包文件),第三方数据遵循各自许可。

语言:英语(en)

标签:ai-scientist, research-agent, benchmark, agent-evaluation

发布状态:部分发布(当前仅包含一个研究主题,后续将增加更多主题)


数据集描述

该数据集包含七个AI科学家系统在一个研究主题上生成的工件。每个主题包对应一个研究主题,并包含七个AI科学家系统在相同任务设置下的输出结果。


包含的AI科学家系统

  • EvoScientist
  • Auto Research Claw
  • Deep Scientist
  • AI Researcher
  • ARIS
  • The AI Scientist v2
  • Dr. Claw

数据集结构

每个主题包(topic_name)的目录结构如下:

topic_name/ ├── inputs/ │ ├── evoscientist/ │ ├── auto_research_claw/ │ ├── deep_scientist/ │ ├── ai_researcher/ │ ├── aris/ │ ├── the_ai_scientist_v2/ │ └── dr_claw/ ├── outputs/ │ ├── evoscientist/ │ ├── auto_research_claw/ │ ├── deep_scientist/ │ ├── ai_researcher/ │ ├── aris/ │ ├── the_ai_scientist_v2/ │ └── dr_claw/ └── metadata.json


数据内容

每个主题包包含以下内容:

  • 每个AI科学家系统的任务输入
  • 生成的研究报告
  • 生成的代码或脚本
  • 实验日志
  • 提交文件(如有)
  • 评估结果(如有)

元数据

每个主题包包含一个 metadata.json 文件,示例如下:

json { "topic_id": "1", "topic_name": "NLP-TASK", "task_name": "BABYLM", "agents": [ "EvoScientist", "Auto Research Claw", "Deep Scientist", "AI Researcher", "ARIS", "The AI Scientist v2", "Dr. Claw" ], "release_status": "partial" }


预期用途

该数据集旨在用于评估和比较AI科学家系统,可用于研究:

  • AI科学家是否能完成研究任务
  • 其产生的工件是什么
  • 在何处失败
  • 不同AI科学家系统在同一主题上的行为差异

引用

bibtex @dataset{ai_scientist_benchmark_artifacts, title = {AI Scientist Benchmark Artifacts}, author = {TBD}, year = {2026}, publisher = {Hugging Face} }

搜集汇总
数据集介绍
researchclaweval 数据集图片
构建方式
在人工智能科研自动化领域,评估不同AI科学家系统的能力与行为差异已成为关键挑战。researchclaweval数据集应运而生,它汇集了七种前沿AI科学家系统在统一研究主题下生成的完整工件。每个主题包均包含任务输入、生成的研究报告、代码或脚本、实验日志、提交文件及评估结果,并以标准化目录结构组织,形成可重复使用的评估基线。目前发布的首个主题对应NLP-TASK下的BABYLM任务,未来将持续扩展主题覆盖面。
特点
该数据集的核心特点在于其多系统并行比较的独特设计,囊括了EvoScientist、Auto Research Claw、Deep Scientist等七种代表性AI科学家系统在同一任务下的输出,实现了横向评估的公平性。每个主题包内均包含任务输入与输出两大部分,覆盖从原始指令到最终报告的完整科研链条,并通过元数据文件记录主题标识、任务名称、参与系统及发布状态,为分析不同系统在任务完成度、产物多样性及失败模式方面的差异提供了结构化视角。
使用方法
用户可通过Hugging Face数据集库直接加载该数据集,解析主题目录下的输入与输出子文件夹,获取各系统的研究产物及实验日志。建议研究者重点关注每个系统生成的代码与报告,结合metadata.json中的元信息进行跨系统对比分析。数据集支持对AI科学家系统的能力边界进行研究,包括任务完成评估、工件质量考察、失败原因追溯以及行为模式刻画,从而推动自主科研系统的迭代优化。
背景与挑战
背景概述
随着人工智能在科研自动化领域的迅猛发展,全自主科研智能体(AI Scientist)已成为推动科学发现的重要前沿方向。此类系统旨在模拟人类研究流程,从问题提出、实验设计到代码实现与报告生成,实现科研任务的端到端执行。为系统评估该类智能体的综合能力,研究机构于近年推出了ResearchClawEval这一基准数据集。该数据集由多个主题包构成,每个包内汇集了包括EvoScientist、Auto Research Claw、Deep Scientist、The AI Scientist v2等七种代表性AI科学家系统在同一课题下的输入、生成报告、代码、实验日志及评估结果,为研究不同系统在相同研究任务上的表现提供了标准化比较平台。该数据集的发布填补了自主科研智能体评测领域标准化资源的空白,对探索AI驱动的科研范式具有重要影响。
当前挑战
ResearchClawEval数据集旨在解决的核心领域挑战是:如何客观、全面地评估AI科学家系统在真实科研任务中的自主完成能力。现有AI Agent评估多聚焦于单一子任务,缺乏对端到端科研流程的整体衡量,导致不同系统之间难以公平对比。在构建过程中,数据集面临众多技术挑战:一是科研任务的复杂性与开放性,使得标准化输入输出格式难以统一;二是不同系统生成的产物(如代码、日志、报告)类型差异巨大,难以设计通用的评估指标;三是确保数据合法性,需处理第三方基准数据、外部仓库及原始材料的多重许可证兼容问题;四是持续扩展数据集主题时,需保证新任务与现有评价体系的无缝衔接。这些挑战共同决定了该数据集在推动AI科研自动化评估方面的重要价值与难度。
常用场景
经典使用场景
在人工智能科研自动化蓬勃发展的时代,ResearchClawEval数据集为评估和比较不同AI科学家系统提供了标准化的基准平台。该数据集的经典使用场景在于,研究者可针对同一研究主题,系统性地收集EvoScientist、Auto Research Claw、Deep Scientist等七种前沿AI科学家系统的任务输入、生成报告、代码脚本、实验日志及评测结果。通过这一结构化的多系统输出档案,能够深入剖析各AI科学家在完成研究任务中的行为模式与产出质量,从而为AI科研代理的性能评估与横向对比奠定坚实基础。
实际应用
在实际应用中,ResearchClawEval扮演着AI科学家系统研发与迭代的“试金石”角色。科研机构和企业可借助该数据集对自家开发的AI科研代理进行系统化的能力诊断,识别其在实验设计、代码生成、报告撰写或结果分析等环节的短板。例如,通过对比Auto Research Claw与Deep Scientist在同一任务中的产出日志,研发团队能够精确定位算法瓶颈并实施针对性优化。此外,该数据集还能辅助开展AI科学家系统的选型评估,为科研自动化平台的搭建者提供客观的数据支撑,使其能够选择最适合特定研究场景的AI科学家方案。
衍生相关工作
ResearchClawEval的问世催生了多个方向的衍生研究工作。基于其提供的多系统标准化产出,研究者得以深入开展AI科研代理的失败分析与归因研究,系统梳理各系统在不同研究阶段的高频错误模式。该数据集还可作为训练资源,用于开发评测AI科学家生成内容质量的自动化评估模型,例如通过对比Dr. Claw与The AI Scientist v2的实验日志,训练能够判别实验设计合理性的判别器。此外,围绕该数据集的元分析工作亦蓬勃开展,通过跨系统的性能图谱构建,揭示不同算法范式在科研任务中的适配边界,从而为下一代AI科学家系统的设计提供实证指引。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务