GAIR/AgencyBench
收藏官方服务:
资源简介:
AgencyBench是一个全面的基准测试,源自日常AI使用,评估了6种核心代理能力在32个真实世界场景中的表现,包含138个具有特定查询、交付物和评分标准的任务。这些场景平均需要90次工具调用、1百万令牌和数小时的执行时间来解决。数据集支持自动化评估,通过用户模拟代理提供迭代反馈,并使用Docker沙箱进行视觉和功能性的基于标准的评估。
AgencyBench is a comprehensive benchmark derived from daily AI usage, evaluating 6 core agentic capabilities across 32 real-world scenarios, comprising 138 tasks with specific queries, deliverables, and rubrics. These scenarios require an average of 90 tool calls, 1 million tokens, and hours of execution time to resolve. The benchmark enables automated evaluation by employing a user simulation agent for iterative feedback and a Docker sandbox for visual and functional rubric-based assessment.
提供机构:
GAIR搜集汇总
数据集介绍
构建方式
AgencyBench 的构建根植于对现实世界中自主智能体长期复杂任务的深度解构。研究团队首先从日常人工智能应用中提炼出六项核心智能体能力,并以此为基础,精心设计了横跨游戏、前端、后端、代码、研究与MCP六大领域的32个真实场景。每个场景均被拆解为包含具体查询、交付物和评分标准的子任务,共计138项。为消除传统人工评估的瓶颈,该基准引入了一项创新性的自动化评估流水线:通过用户模拟智能体提供迭代反馈,并利用Docker沙箱环境执行基于视觉与功能评分标准的自动化判断,从而实现了大规模、可复现的智能体能力评估。
特点
AgencyBench 最显著的特征在于其对真实世界长期任务的前沿探索。每个任务平均需要约90次工具调用、处理超过100万tokens的上下文,并持续执行数小时,这远超现有基准的复杂度。该基准全面覆盖了从代码开发到游戏构建、从深度研究到协议交互的多元能力谱系,避免了单一维度的能力测试。此外,其评估体系融合了规则性评判、视觉性评判与大语言模型评判,能够在无需人工介入的情况下,对UI密集型任务(如前端界面)进行全自动的可视化评估,为智能体的真实部署能力提供了严峻的试金石。
使用方法
使用AgencyBench进行智能体评估时,研究者首先需搭建包含Docker沙箱的云端环境,尤其对于游戏和前端场景,沙箱提供了渲染和交互的远程虚拟机。随后,通过配置场景文件夹内的环境变量文件,设定智能体框架、待评估模型API以及评估模型参数。运行评估脚本后,系统将自动执行任务并生成包含详细评分与中间产物的评价文件。该基准提供了从数据加载到结果复现的完整工具链,支持通过Hugging Face Datasets库便捷地访问V1与V2版本的数据,使得研究者能够系统性地对比不同模型在资源效率、自我纠错能力及工具偏好上的差异。
背景与挑战
背景概述
随着大语言模型(LLM)技术的迅猛发展,基于LLM的自主智能体在复杂任务中展现出前所未有的潜力,有望深刻重塑经济生产模式。然而,现有基准测试多聚焦于单一智能体能力,难以覆盖真实世界中需要长期规划与多步执行的场景。为弥合这一鸿沟,由上海人工智能实验室(GAIR)团队于2025年提出、2026年正式发布的AgencyBench应运而生。该基准由Keyu Li、Junhao Shi等研究人员主导,旨在系统评估自主智能体在百万级Token真实世界上下文中的综合能力。AgencyBench涵盖了游戏开发、前端构建、后端工程、代码调试、深度研究及模型上下文协议(MCP)工具使用等六大核心智能体能力,包含32个真实场景与138项具体任务,每个任务平均需执行约90次工具调用并处理百万Token的上下文信息,为智能体研究提供了极具挑战性的评估平台,迅速成为该领域的重要参考基准。
当前挑战
AgencyBench所应对的领域核心挑战在于,现有智能体评测体系无法有效模拟真实世界中长周期、多步骤的自主任务,传统基准测试往往依赖人工循环反馈,导致评估过程难以规模化扩展。该数据集在构建过程中面临多重困难:首先,如何设计涵盖多样化能力的任务集,使其既能反映真实应用场景,又具备可重复评估的标准化框架;其次,为突破人工评估瓶颈,研究团队创新性地引入用户模拟智能体提供迭代反馈,并结合Docker沙箱环境实现视觉与功能双重评估,这一自动化评估流程的设计与实现本身构成巨大挑战;此外,任务平均执行时间长达数小时,对计算资源与系统稳定性提出严苛要求,同时需确保评估结果在不同模型间具有可比性与鲁棒性。
常用场景
经典使用场景
AgencyBench作为面向自主智能体的综合性基准测试,其经典使用场景在于评估大语言模型驱动的智能体在百万级词元、数小时执行时长的真实世界长程任务中的核心能力。该基准涵盖游戏开发、前端与后端工程、代码调试、深度研究及模型上下文协议工具使用六大维度,共32个真实场景和138项具体任务。每项任务要求智能体平均执行约90次工具调用、处理近百万词元的上下文信息,并通过Docker沙箱与用户模拟代理实现全自动化视觉与功能评估,从而系统性地衡量智能体在复杂、开放、多步骤工作流中的自主决策与执行能力。
解决学术问题
AgencyBench致力于解决现有智能体基准测试局限于单一能力、缺乏真实世界长程任务评估的学术困境。传统基准多聚焦于短时对话或简单工具调用,未能反映智能体在需要持续数小时、涉及多轮反馈与自我纠错的复杂场景中的表现。该基准通过引入用户模拟代理迭代反馈机制和基于规则、视觉与大语言模型联合判定的评分范式,实现了大规模自动化评估,填补了长程、多能力协同评估的空白。研究结果揭示了闭源模型与开源模型在资源效率、自我修正能力及工具使用偏好上的显著差异,为智能体系统的能力边界与优化方向提供了关键洞察。
衍生相关工作
AgencyBench的发布催生了多项相关研究工作。其提出的用户模拟代理评估方法启发了后续关于智能体自我纠错与反馈学习的研究,例如探索基于迭代反馈的强化学习策略。基准中覆盖的模型上下文协议场景推动了MCP工具使用能力的标准化评估,促进了工具集成框架的优化。此外,对开源与闭源模型在资源效率与工具偏好上的差异分析,引导了针对特定执行框架的模型微调与架构改进工作。该基准还作为验证平台,被用于评估新型智能体脚手架(如ReAct、Plan-and-Solve)在不同任务类型上的泛化能力,进一步推动了自主智能体系统的发展。
以上内容由遇见数据集搜集并总结生成



