遇见数据集

AARRI-Bench

收藏
arXiv2026-06-06 更新2026-06-09 收录
官方服务:

资源简介:

AARRI-Bench是由西安交通大学与西安电子科技大学联合创建的基准测试数据集,旨在评估大语言模型代理在真实研究场景中模拟人类研究员行为的能力。该数据集包含82个精心设计的人工标注任务,涵盖上下文理解、学术思维、实践操作与交互协作四大研究场景,并依据代理自主性划分为适应、整合、创新与开放探索四个层级。数据通过三阶段人工构建流程,源自研究者的实际痛点,确保了任务的高质量与挑战性。该数据集主要应用于人工智能研究领域,用于检验代理在细粒度研究任务中的专业素养、严谨性及推理能力,旨在推动开发更接近人类研究员行为模式的自主研究系统。

AARRI-Bench is a benchmark dataset jointly developed by Xi'an Jiaotong University and Xidian University, which aims to evaluate the capability of large language model (LLM) agents to simulate the behavioral patterns of human researchers in real-world research scenarios. The dataset includes 82 meticulously curated manually annotated tasks, covering four core research domains: context comprehension, academic thinking, practical operation, and interactive collaboration. It is categorized into four levels—adaptation, integration, innovation, and open exploration—based on the autonomy degree of the agents. The dataset is constructed via a three-stage manual workflow, with all tasks derived from the actual pain points encountered by researchers, thereby ensuring the high quality and challenging nature of the tasks. This dataset is primarily utilized in the field of artificial intelligence research, serving to assess the professional competence, rigor, and reasoning ability of agents in fine-grained research tasks, with the ultimate goal of advancing the development of autonomous research systems that better align with the behavioral patterns of human researchers.

创建时间:
2026-06-06
原始信息汇总

数据集概述:AARRI-Bench

项目名称:AARRI-Bench(Act As a Real Research Intern)
所属系列:AARR(Act As a Real Researcher)基准系列
系列目标:评估LLM智能体在研究生命周期中的表现

系列阶段

阶段 名称 聚焦能力
1 AARRI(本研究数据集) 入门级研究任务,考查严谨性和正确方法论
2 AARRA 更独立的贡献、批判性评估、MCP与智能体技能、LLM-as-judge、众包数据
3 AARRS 完全独立的研究与科学发现,极少监督

核心设计

  • 评估重点:不测试简单的代码执行能力,而是针对前沿智能体与人类研究者之间仍存在的认知差距——上下文敏感性、独立判断、知道何时停止、协作能力
  • 任务容器化:基于 Harbor 框架实现

任务结构

每个任务遵循标准 Harbor 布局:

task-name/ ├── instruction.md # 提供给智能体的指令 ├── task.toml # 元数据、超时、资源限制 ├── environment/ │ └── Dockerfile # 容器配置 ├── solution/ │ └── solve.sh # 参考答案(对智能体不可见) └── tests/ ├── test.sh # 运行pytest,写入奖励 └── test_outputs.py # 对智能体输出的断言

运行方式

方式一(无需克隆仓库)
安装 Harbor CLI 后直接从注册中心拉取数据集运行: bash uv tool install harbor harbor run -d aarr/aarri-bench -m "<模型>" -a "<智能体>"

方式二(本地副本)
克隆仓库到本地运行: bash git clone https://github.com/AARR-bench/AARRI-bench.git cd AARRI-bench uv tool install harbor harbor run -p ./tasks -m "<模型>" -a "<智能体>"

相关资源

搜集汇总
数据集介绍
AARRI-Bench 数据集图片
构建方式
AARRI-Bench的构建源于对真实研究痛点的系统性收集与转化。研究团队汇聚了从高年级博士生到本科实习生等不同层次的研究人员,每位成员基于自身在使用大语言模型代理进行科学研究时遭遇的实际障碍,围绕情境、思维、动手和交互四个水平维度设计任务。构建流程历经三轮迭代:首轮允许参与者根据个人遇到的困难自由选题;次轮由团队汇总分析任务主题分布,为每位贡献者提供定制化的设计指导并鼓励对初始方案进行完善与扩展;第三轮则依据代理能力范围对任务进行垂直分类,剔除重复或主题重叠的条目。经过这三轮人工精细打磨,最终形成了包含82个任务、涵盖两个正交维度的基准测试集。
使用方法
AARRI-Bench的评估基于Harbor框架,该框架为每个任务提供了标准化的容器化执行环境,确保了评估的可重复性和可扩展性。每个任务以独立目录形式封装,包含指令文件、配置文件、环境定义、参考解决方案和测试脚本。评估时,Harbor负责构建干净的隔离环境,启动指定的代理框架(如Claude Code、Hermes Agent或Mini-SWE-Agent)并将其与具体模型端点绑定,随后代理接收任务指令并在环境中自主探索执行。评估采用粗细粒度结合的双层指标:粗粒度依据最终任务是否完成给予0/1奖励;细粒度则通过每个任务精心设计的多项单元测试来提供详细的诊断信息,适用于案例研究和深入分析。
背景与挑战
背景概述
AARRI-Bench是由西安交通大学与西安电子科技大学的研究团队于2026年提出的首个系统性评估大语言模型代理在真实科研场景中行为表现的基准测试。该基准隶属于AARR系列,聚焦于评测前沿模型与代理框架能否像人类研究实习生一样,在精细化科研任务中展现出专业素养、严谨态度与细致推理能力。当前多数基准侧重于宏观执行能力,而AARRI-Bench则开创性地关注研究者品质导向任务设计,旨在弥合自主代理与真实科研协作者之间的鸿沟,对推动AI科研代理的伦理与行为研究具有重要影响力。
当前挑战
该数据集面临的挑战主要体现在两方面:首先,在领域问题层面,现有基准多关注任务完成率与最终结果,缺乏对研究者品质如科研诚信、不确定性认知、谨慎验证及负责任推理的评测;同时,极少以‘对人类简单但代理易错’为设计原则,导致人机差异识别不足。其次,在构建过程中,团队面临任务设计的精细度与覆盖度平衡难题,需通过三阶段人工构建流程确保任务真实反映科研痛点;此外,为保证评估的可重复性与公平性,需在容器化环境中标准化多种代理框架与模型组合,并设计细粒度单元测试,这对基准的可扩展性与鲁棒性提出了较高要求。
常用场景
经典使用场景
在人工智能研究的浪潮中,AARRI-Bench作为AARR系列的首个基准,其最经典的使用场景是评估前沿大语言模型及智能体系统在研究生命周期中的表现,尤其是模拟研究实习生的日常任务。该数据集精心设计了82项跨情境、跨能力层级的任务,覆盖从理解学术背景、独立学术判断、技术执行到人际协作的四个维度,旨在检验智能体是否具备人类研究者般的专业素养与细致入微的推理能力。研究人员通过该基准,能够系统性地衡量模型在那些对人类而言轻而易举、但对智能体却构成巨大挑战的细微研究环节上的表现。
解决学术问题
该数据集的核心贡献在于填补了现有基准对研究者品质评估的空白,解决了当前评估体系过度聚焦宏观执行能力而忽视学术诚信、不确定性意识、谨慎验证等关键素养的学术困境。AARRI-Bench通过引入人工精心构造的对人类易而智能体难的任务,揭示了最先进的智能体系统在数据真实性鉴别、方法论严谨性、独立判断及科研伦理等方面的显著不足,其最高性能配置也仅达68.3%的成功率。这项工作促使学界重新审视开发真正具有研究者思维的AI所需的核心方向,即深入探索研究行为本身而非仅仅追求复杂的框架搭建。
实际应用
在实际应用中,AARRI-Bench为研究机构和企业提供了一个严谨的智能体能力评估沙盒,用于筛选和优化能够在真实研究场景中辅助或协作的AI系统。具体而言,该基准可用于自动化同行评审系统中识别数据造假与实验缺陷,辅助研究生导师检测AI助手在遇到不道德指令时是否具备拒绝的学术自主性,以及评估科研自动化工具在文献理解、代码调试和多轮交互中的稳健性。通过揭示智能体在看似简单任务上的失败模式,该数据集为构建更可靠、更符合科研伦理的AI协作伙伴提供了切实的测试标准与改进方向。
数据集最近研究
最新研究方向
聚焦于评估前沿大语言模型及智能体系统在科研生命周期中扮演真实研究者角色的能力,特别是检验其在细粒度研究场景中能否模仿人类研究者的专业素养、严谨性和细微推理性。与现有侧重宏观执行能力的基准不同,AARRI-Bench开创性地引入了衡量研究者素质(如学术诚信、不确定性意识、谨慎验证和负责任推理)的任务,并专门设计对人类简单但智能体极易出错的场景作为评估核心。最新实验揭示,即便最优配置(Mini-SWE-Agent搭配Claude Opus 4.7)的成功率也仅为68.3%,频繁遗漏人类研究者一目了然的关键细节,这表明发展具备类研究者行为的AI需要深入探索科研行为本身,而非仅依赖复杂的智能体架构设计。
相关研究论文
  • 1
    Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle西安交通大学; 西安电子科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务