遇见数据集

neulab/pace-bench

收藏
Hugging Face2026-07-06 更新2026-07-22 收录
官方服务:

资源简介:

PACE-Bench是由PACE(代理能力评估代理)产生的具体代理基准。它是PACE选择框架在4个代理目标(GAIA、SWE-Bench Verified、SWE-Bench Multimodal和SWT-Bench)上运行后输出的数据集,而非独立手动策划的基准。该数据集包含从12个非代理基准中自动选择的紧凑源实例集合,用于预测模型在代理目标上的性能。每个代理目标的代理由约100个源实例组成,每个实例带有其在PACE线性预测器中的回归权重。评估LLM代理在如SWE-Bench和GAIA等基准上通常成本高昂且缓慢,而PACE通过选择廉价非代理评估中的实例,其聚合分数能可靠预测代理性能。数据集文件包括每个代理目标的JSONL文件和一个图像文件夹,用于多模态实例。实例源自多个上游基准,内容遵循原始许可。

PACE-Bench is a concrete proxy benchmark generated by PACE (Proxy Capability Evaluation Agent). It is a dataset output by the PACE selection framework after running on four proxy goals: GAIA, SWE-Bench Verified, SWE-Bench Multimodal, and SWT-Bench, rather than an independently manually curated benchmark. This dataset comprises a compact set of source instances automatically selected from 12 non-proxy benchmarks, tailored for predicting model performance on proxy goals. For each proxy goal, the corresponding evaluation setup consists of approximately 100 source instances, each with its regression weight in the PACE linear predictor. Evaluating LLM agents on benchmarks such as SWE-Bench and GAIA is typically costly and time-consuming, whereas PACE selects instances from low-cost non-proxy evaluations, and its aggregated scores can reliably predict proxy performance. The dataset files include JSONL files for each proxy goal and an image folder for multimodal instances. All instances are sourced from multiple upstream benchmarks, and their content is subject to their original licenses.

提供机构:
neulab
搜集汇总
数据集介绍
neulab/pace-bench 数据集图片
构建方式
PACE-Bench是基于PACE代理能力评估框架自动生成的具体代理基准数据集,并非人工精心策划的基准测试,而是PACE框架针对四个代理目标(GAIA、SWE-Bench Verified、SWE-Bench Multimodal和SWT-Bench)运行后输出的紧凑源实例集合。该框架从12个非代理基准测试中,通过线性预测模型自动选择约100个廉价、非代理评估的源实例,并为每个实例分配回归权重,以最优预测模型在代理目标上的表现。每个代理目标对应一个JSONL文件,其中包含所选源实例及其权重系数。
特点
作为代理能力评估的代理基准,PACE-Bench的核心创新在于以低成本的非代理评估结果预测昂贵代理任务的性能,显著降低评估成本与时间。每个代理代理集包含约100个源实例,实例涵盖问答、代码生成、函数调用、指令遵循等多元任务类型,并支持多模态输入。数据集具备双选择策略特性:局部策略基于目标相关性,全局策略则提供全局信息,被两种策略同时选中的实例会以两行记录存在,权重各异,需按实例ID分组并对权重求和以获得净权重。内容解析成功率达98.3%,未解析实例保留原因说明。
使用方法
用户可通过HuggingFace Datasets库按代理目标名称加载对应数据配置,例如使用`load_dataset('neulab/pace-bench', 'gaia', split='train')`加载GAIA代理集。每条记录包含实例ID、来源基准、子任务、输入、参考答案、评分指标、权重系数及多模态图像路径等字段。由于双选择策略可能导致重复实例,建议使用Pandas按`instance_id`和`source_benchmark`分组并对`weight`字段求和,以获得每个实例的净权重。多模态图像文件存储在`images/`目录下,需保持文件夹结构与JSONL文件一同使用。
背景与挑战
背景概述
PACE-Bench数据集由美国卡内基梅隆大学Neubig实验室的Song Yueqi等研究者于2026年创建,旨在解决大型语言模型(LLM)代理评估中高昂的计算成本与缓慢的评估速度问题。该数据集是PACE(A Proxy for Agentic Capability Evaluation)框架的输出产物,通过从12个非代理基准测试中自动选取约100个源实例,构建用于预测SWE-Bench、GAIA等代理目标的紧凑代理基准。其核心研究问题在于探索如何以高效、低成本的非代理评估结果可靠地预测模型在复杂代理任务上的性能,为代理评估领域提供一种全新的方法论。PACE-Bench的出现不仅降低了评估门槛,还通过线性预测器为每个源实例分配回归权重,实现了评估精度的量化保障,对LLM代理研究社区产生了深远影响。
当前挑战
PACE-Bench致力于解决代理评估领域的两大核心挑战:其一,传统代理基准如SWE-Bench和GAIA的评估过程耗资巨大且速度缓慢,限制了研究迭代的效率;其二,如何从海量非代理测试实例中筛选出最能反映代理性能的紧凑子集,并确保预测的可靠性与泛化能力。在数据集构建过程中,研究团队面临多重技术难题:首先,来自12个不同上游基准的实例具有异构的评分指标(如正确率、指令检查器评分、代码测试执行等),需统一整合为可比较的格式;其次,部分实例因上游数据集版本更新而失效(如5个visualpuzzles和2个visualwebbench实例),导致内容解析困难,最终有7行数据无法恢复;此外,PACE结合局部与全局两种选择策略产生的重复行需通过权重求和进行去重处理,增加了数据处理的复杂性。
常用场景
经典使用场景
PACE-Bench作为一个精巧的代理基准测试集,其经典使用场景在于高效预测大型语言模型在复杂代理任务上的表现。传统评估方法如SWE-Bench或GAIA需要模型在完整代理环境中执行多步交互,不仅计算成本高昂且耗时漫长。PACE-Bench则通过PACE框架自动从12个非代理基准中筛选出约100个最具代表性的源实例,每个实例携带一个回归权重,使得研究者仅需让模型完成这些简洁的问答或代码生成任务,即可通过加权求和精准预估其在代理目标上的能力。这种轻量级替代方案极大降低了评估门槛,尤其适用于需要快速迭代模型版本或比较多种模型配置的研究场景。
实际应用
在实际应用中,PACE-Bench为人工智能开发流程提供了高效的模型筛选工具。企业在部署大模型驱动的自动化系统(如代码修复助手、多模态操作代理)前,需评估候选模型的执行可靠性。利用PACE-Bench,工程师仅需运行一组标准化的非代理任务(如函数调用、指令遵循、简单推理),即可快速获得与完整代理测试高度相关的性能预估,从而加速模型选型与版本迭代。此外,该数据集还支持跨模型对比和持续集成场景,帮助团队在有限资源下实时监控模型能力变化,降低了对昂贵代理评估环境的依赖。
衍生相关工作
PACE-Bench的诞生催生了多项值得关注的衍生工作。其核心方法PACE(代理能力评估代理)作为一项选择框架,启发了后续研究者探索更高效的基准压缩技术,例如基于信息论或强化学习的实例筛选策略。同时,该数据集所依托的线性回归预测模型,为理解代理能力与非代理能力之间的量化关系提供了实证基础,推动了代理能力解构与迁移学习领域的研究。此外,PACE-Bench的跨基准集成设计(整合12个非代理源)也树立了一种新的基准构建范式,促使学界重新审视传统基准的冗余性,并催生出更多针对特定代理能力的高效预测性测试集,例如面向对话或检索增强生成场景的代理代理评估方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务