遇见数据集

pace-bench

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

PACE-Bench是一个用于评估大型语言模型(LLM)代理能力的代理基准数据集,源自PACE(代理能力评估代理)框架。该框架旨在通过从低成本、非代理的评估中自动选择一小组源实例,来高效预测模型在复杂、昂贵的代理任务(如GAIA、SWE-Bench)上的性能。数据集本身不是手动构建的独立基准,而是PACE框架为四个代理目标(GAIA、SWE-Bench Verified、SWE-Bench Multimodal、SWT-Bench)自动选择的源实例集合。每个目标的代理由大约100个源实例构成,这些实例选自12个上游的非代理基准测试(如IFEval、DebugBench、MMMU、VisualWebBench等)。数据集以JSONL文件格式提供,每个文件对应一个代理目标。每个数据行代表一个被选中的源实例,包含实例ID、来源基准、子目录/任务、输入提示、参考答案(对于基于检查器或测试的评分为null)、评分指标、该实例在PACE线性预测器中的权重系数、相关图像文件路径(对于多模态实例)以及内容解析状态。数据集中绝大多数(98.3%)实例内容已成功解析,主要用于通过运行这些精选的源实例并聚合其加权分数,来快速、低成本地预测或代理LLM在目标代理任务上的性能。

PACE-Bench is a proxy benchmark dataset for evaluating the proxy capabilities of Large Language Models (LLMs), derived from the PACE (Proxy Capability Evaluation Agent) framework. This framework aims to efficiently predict model performance on complex, costly proxy tasks (e.g., GAIA, SWE-Bench) by automatically selecting a small set of source instances from low-cost, non-proxy evaluations. The dataset itself is not a manually constructed independent benchmark, but rather a collection of source instances automatically selected by the PACE framework for four proxy objectives: GAIA, SWE-Bench Verified, SWE-Bench Multimodal, and SWT-Bench. Each proxy objective is composed of approximately 100 source instances, which are selected from 12 upstream non-proxy benchmark tests (e.g., IFEval, DebugBench, MMMU, VisualWebBench, etc.). The dataset is provided in JSONL file format, with each file corresponding to one proxy objective. Each data line represents a selected source instance, containing instance ID, source benchmark, subdirectory/task, input prompt, reference answer (null for checker or test-based scoring), scoring metric, weight coefficient of this instance in the PACE linear predictor, associated image file path (for multimodal instances), and content parsing status. The vast majority (98.3%) of instance contents in the dataset have been successfully parsed. It is primarily used to quickly and cost-effectively predict or proxy the performance of LLMs on target proxy tasks by running these curated source instances and aggregating their weighted scores.

提供机构:
NeuLab @ LTI/CMU
创建时间:
2026-07-02
原始信息汇总

数据集概述:PACE-Bench

基本信息

  • 数据集名称:PACE-Bench
  • 许可证:mixed-upstream(上游混合许可,各实例保留其上游数据集的许可条款)
  • 语言:英语
  • 任务类别:其他
  • 标签:代理评估、代理基准测试、大语言模型评估

背景与目的

PACE-Bench 是由 PACE(A Proxy for Agentic Capability Evaluation) 框架生成的代理基准数据集。其核心目的是解决评估 LLM 智能体(如 SWE-Bench、GAIA 等)成本高昂且速度慢的问题。PACE 通过自动从廉价、非代理的评估中选取一组紧凑的源实例,其聚合得分能最可靠地预测模型在代理目标上的表现。该数据集正是这些被选中的源实例集合,每个代理目标对应一个文件。

数据集组成

文件结构

pace-bench/ ├── gaia.jsonl # 代理目标:GAIA ├── swebench.jsonl # 代理目标:SWE-Bench Verified ├── swebench_multimodal.jsonl # 代理目标:SWE-Bench Multimodal ├── swtbench.jsonl # 代理目标:SWT-Bench └── images/ # 多模态实例的图像文件 ├── mmmu/ ├── visualpuzzles/ └── visualwebbench/

数据集配置

配置名称 数据文件
gaia gaia.jsonl
swebench swebench.jsonl
swebench_multimodal swebench_multimodal.jsonl
swtbench swtbench.jsonl

行(实例)架构

每个 JSON 行包含以下字段:

字段 类型 描述
instance_id 字符串 实例在其源基准中的ID
source_benchmark 字符串 源非代理基准名称
subdir 字符串 源基准中的子任务/拆分/度量桶
input 字符串或null 实例提示/问题
answer 字符串或null 参考答案(若无可为null)
metric 字符串 该实例在源基准中的评分方式
weight 浮点数 该实例在PACE预测器中的系数
images 字符串列表 多模态实例的图像相对路径(无图像则为空列表)
content_status 字符串 "ok" 或 "unresolved:<原因>"

重要说明

  • answer 为 null:当基准没有单一参考答案字符串时(如 IFEval 的指令检查评分、代码测试套件执行),answer 为 null,评分方式由 metric 字段记录。
  • 行去重:PACE 结合了局部(目标相关性)和全局(信息量)两种选择策略。被两种策略同时选中的实例会在文件中出现两行,具有相同的 instance_id 但不同的 weight。如需每实例一行,需按 instance_id 分组并对 weight 求和。
  • 多模态图像:存储在 images/ 目录下,通过 images 字段中的路径引用。

数据覆盖情况

目标文件 总行数 去重实例数 内容正常 含图像
gaia.jsonl 100 80 99 19
swebench.jsonl 100 97 97 62
swebench_multimodal.jsonl 105 96 103 23
swtbench.jsonl 107 100 106 43

总计:405/412行内容已解决(98.3%),7行因源数据集更新导致实例ID失效而保留为 content_status 标记的未解决状态(5个 visualpuzzles,2个 visualwebbench)。

源基准与许可

每个实例的内容受其上游基准的许可条款约束。上游基准来源如下:

源基准 上游来源
acp_gen ibm-research/acp_bench
bfcl Berkeley Function-Calling Leaderboard
debugbench DebugBench
ifeval google/IFEval
lifbench LIFBench
livecodebench livecodebench/code_generation_lite, execution-v2
logiqa EleutherAI/logiqa
mmmu lmms-lab/MMMU
planbench PlanBench
repobench tianyang/repobench_python_v1.1
visualpuzzles neulab/VisualPuzzles
visualwebbench VisualWebBench

使用示例

python from datasets import load_dataset

加载单个目标

gaia = load_dataset("neulab/pace-bench", "gaia", split="train") print(gaia[0])

去重并计算净权重

import pandas as pd df = pd.DataFrame(gaia) net = df.groupby(["instance_id", "source_benchmark"], as_index=False)["weight"].sum()

图像路径 images 是相对于数据集根目录的,需从 images/ 文件夹加载。

相关资源

搜集汇总
数据集介绍
pace-bench 数据集图片
构建方式
PACE-Bench 是基于 PACE 代理能力代理评估框架自动生成的代理基准测试数据集。该框架从多个非代理性基准中筛选出紧凑的源实例集合,用于预测模型在 SWE-Bench、GAIA 等代理目标上的表现。数据集的构建过程遵循 PACE 选择框架的核心机制:通过线性回归模型对 12 个非代理基准中的实例进行加权组合,最终为每个代理目标选取约 100 个实例(预算 C=100),并分别记录每个实例在预测模型中的权重系数。每个代理目标对应一个独立的 JSONL 文件,涵盖 GAIA、SWE-Bench Verified、SWE-Bench Multimodal 和 SWT-Bench 四项任务。
使用方法
用户可通过 HuggingFace Datasets 库加载各子集,例如使用 `load_dataset('neulab/pace-bench', 'gaia', split='train')` 获取 GAIA 代理数据。每条记录包含实例 ID、源基准、输入、参考答案、度量方式及权重等信息。处理重复行时,建议按 `instance_id` 和 `source_benchmark` 分组并对 `weight` 求和得到每个实例的净权重。多模态图像通过 `images` 字段中的相对路径引用,需配合随附的 `images/` 文件夹使用。最终预测分数可通过将各实例的模型得分与对应权重加权求和得出,实现快速、低成本的代理能力评估。
背景与挑战
背景概述
PACE-Bench是由卡内基梅隆大学Neulab团队于2026年提出的代理能力评估代理基准数据集,核心研究者包括Yueqi Song、Graham Neubig等人。该数据集旨在解决大语言模型代理在SWE-Bench、GAIA等复杂任务上评估成本高昂与效率低下的问题。PACE-Bench并非手工构建的独立基准,而是通过PACE框架从12个非代理基准中自动选出的约100个紧凑实例集合,利用线性回归权重预测模型在代理目标上的表现。其研究意义在于为代理能力评估提供了一种低成本、可扩展的替代方案,显著降低了评测所需的时间和计算资源,推动了大语言模型代理研究的发展。
当前挑战
PACE-Bench所面对的领域挑战在于传统代理评估方法(如SWE-Bench和GAIA)执行成本极高,且评测周期漫长,难以支持大规模模型迭代。构建过程中,PACE框架需从多个源基准中筛选出最具预测力的实例,面临实例选择策略的权衡(局域相关性与全局信息性),以及多模态数据(如图像)的整合与兼容性问题。此外,数据集的维护也面临挑战,如上游基准数据集版本变更导致的实例丢失(约1.7%未解决),以及不同源基准的异构许可协议,要求使用者追溯各自的版权条款。
常用场景
经典使用场景
在大型语言模型的代理能力评估领域,PACE-Bench作为一套精巧的代理基准测试集,其核心使用场景在于高效预测模型在诸如SWE-Bench、GAIA等复杂代理任务上的表现。该数据集并非传统的手工精选测试集,而是通过PACE框架从涵盖12个非代理基准测试的丰富源实例中自动筛选出约100个最具预测力的样本,每个样本携带源自线性预测模型的回归权重。研究者仅需在这些廉价、非代理性的源实例上评估模型,即可通过加权聚合得分快速可靠地推断模型在昂贵代理任务上的能力,从而在资源受限条件下实现对LLM代理性能的精准掌控。
解决学术问题
该数据集精准回应了代理评估领域面临的核心矛盾:传统代理任务基准测试(如SWE-Bench、GAIA)因依赖环境交互与多步推理而成本高昂、耗时漫长,严重制约了模型迭代与学术探索的效率。PACE-Bench通过构建代理性评估框架,将评估重心从昂贵的代理执行过程转移至非代理源实例的简单预测,利用统计相关性确保预测结果与真实代理能力的高度一致性。这一范式显著降低了评估的计算开销与时间成本,使得大规模、高频次的代理能力对比成为可能,为代理系统的快速迭代与学术研究提供了坚实的实证基础,推动了代理评估从粗放式向集约化的方法论演进。
实际应用
在工业界与学术界的实际应用中,PACE-Bench为LLM代理的研发与部署提供了高效的评估工具。模型开发团队可在无需完整部署代理环境的前提下,利用该数据集快速筛选候选模型,以极小代价预测其在SWE-Bench(软件工程任务)、GAIA(通用智能助手)、SWT-Bench(网页操作)及多模态变体上的表现,从而加速模型选型与版本迭代。此外,该数据集还可作为持续集成流程中的代理能力监控组件,在模型更新时快速检测回归退化。对云服务提供商而言,PACE-Bench在租户模型评估场景中能显著降低计算资源消耗,使得代理能力的频繁量化成为经济可行的操作,进而优化资源配置与服务质量。
数据集最近研究
最新研究方向
PACE-Bench作为代理式能力评估的代理基准测试集,代表了当前大语言模型评估领域的前沿转向——从昂贵、耗时的端到端智能体基准测试(如SWE-Bench、GAIA)过渡到高效、低成本的代理预测范式。该数据集通过PACE框架从12个非智能体基准中自动筛选出约100个关键源实例,利用线性回归权重预测模型在智能体目标任务上的表现,显著降低了评估成本与时间开销。这一创新直指智能体系统实用化部署中的核心瓶颈:传统基准测试因涉及多步骤交互、代码执行与环境反馈而计算开销巨大。PACE-Bench的发布与多模态扩展(如SWE-Bench Multimodal)呼应了业界对快速、可扩展评估协议的迫切需求,为LLM代理能力的迭代优化与动态监测提供了标准化工具,有望推动智能体评估从学术验证迈向工业化流水线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务