AstaBench
收藏资源简介:
AstaBench是一个用于全面评估AI代理进行科学研究的基准测试套件。它包含2400多个问题,涵盖了整个科学发现过程和多个科学领域,包括许多基于实际用户请求的问题。该套件还提供了首个具有生产级搜索工具的科学研究环境,这些工具可以用于检索大型科学文献语料库中的信息,从而实现可控、可复制的评估。此外,AstaBench还包括九种针对科学研究任务优化的Asta代理类别和众多基线代理。
AstaBench is a benchmark suite designed for the comprehensive evaluation of AI Agents conducting scientific research. It contains over 2,400 questions covering the entire scientific discovery workflow and multiple scientific disciplines, with many questions derived from real-world user requests. Furthermore, this suite offers the first scientific research environment integrated with production-grade search tools, which enable retrieval of information from large-scale scientific literature corpora to facilitate controllable and reproducible evaluations. Additionally, AstaBench encompasses nine categories of Asta agents optimized for scientific research tasks, alongside numerous baseline agents.
AstaBench数据集概述
数据集基本信息
- 数据集名称: AstaBench
- 主要功能: 评估AI代理科学研究能力的评估框架
- 数据规模: 超过2,400个示例
- 基准数量: 11个基准测试
核心特性
- 测试完整的研究技能谱系:从文献搜索、代码执行到数据分析和端到端发现
- 提供标准化工具和执行环境
- 支持性能和计算效率的公平比较
技术架构
- 基础框架: 基于InspectAI框架构建
- 扩展性: 提供灵活可扩展的AI系统评估框架
环境要求
- 内存需求: 评估框架本身最多使用10GB内存
- 特定任务需求: 编码任务(特别是SUPER和E2E)可能需要20-30GB内存
- 推荐配置: 128GB内存和8物理CPU核心(16 vCPU)
评估任务类型
- 文献搜索任务
- 编码任务
- 数据分析任务
- 端到端发现任务
工具支持
- 标准化搜索工具(带日期和语料库限制)
- 沙盒代码执行环境
- Python会话工具(类似Jupyter笔记本)
- 成本记录功能
提交要求
- 代理名称: 描述性名称
- 代理描述: 简要说明
- 开放性分类: 开源开放权重/开源闭源权重/闭源API可用/闭源仅UI
- 工具使用分类: 标准/自定义接口/自定义
相关资源
- 论文链接: https://allenai.org/papers/astabench
- 数据集地址: https://huggingface.co/datasets/allenai/asta-bench
- 排行榜: https://huggingface.co/spaces/allenai/asta-bench-internal-leaderboard

- 1AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite艾伦人工智能研究所 · 2025年



