遇见数据集

AceBench

收藏
github2026-06-07 更新2026-06-09 收录
数据链接:
官方服务:

资源简介:

AceBench是一个用于LLM代理中边缘-云协作的基准测试数据集,包含128个可执行任务(其中100个带有细粒度隐私注释),涵盖6个类别(中英文),并评估6种执行策略在任务效用、资源成本和隐私暴露三个维度上的表现。

AceBench is a benchmark dataset for edge-cloud collaboration in LLM agents. It contains 128 executable tasks, 100 of which are annotated with fine-grained privacy annotations. The dataset covers 6 categories (both Chinese and English), and evaluates the performance of six execution strategies across three dimensions: task utility, resource cost, and privacy exposure.

创建时间:
2026-06-07
原始信息汇总

数据集概述

AceBench 是一个面向大语言模型(LLM)智能体在边缘-云协作场景下的评测基准。它专注于在真实的智能体执行环境中,评估不同协作策略在任务完成度、资源成本和隐私暴露三个维度上的综合表现。


核心设计亮点

  • 基于OpenClaw平台:使用OpenClaw智能体循环(包含bash、浏览器、文件操作、API调用和SKILL.md技能),驱动本地工作空间。任务需要长程规划、状态追踪和错误恢复,云调用发生在轨迹中间,基于累积的工作空间上下文。
  • 隐私感知:100个任务标注了敏感信息单元(个人身份信息PII和组织机密),每次云调用都会审计跨越边界的上下文。
  • 多维度评估:联合报告任务效用(Utility)、资源成本(Cost)和隐私暴露(Privacy),呈现完整的Pareto图景。
  • 策略驱动:使用同一套任务,评估6种边缘/云/边缘-云协作策略,隔离了协作组织方式与模型选择的影响。
  • 可复现:每个任务在独立的Docker容器中运行,评分器仅在智能体完成后注入,执行过程中不可见。

任务信息

  • 任务总数:128个可执行任务
  • 任务语言:中文和英文
  • 隐私标注:100个任务带有细粒度的隐私标注
  • 任务格式:每个任务是一个独立的Markdown文件,包含提示词、内联grade()验证器和工作空间路径
  • 任务类别:共6个类别
类别 数量 示例任务 核心挑战
办公与日常任务 36 模糊联系人邮件、会议记录、费用报告、每日总结 多源聚合、澄清、结构化输出
信息搜索与收集 34 邮件搜索、竞争情报、论文隶属关系查询、CRM漏洞查找 网页与本地数据核对、来源验证
安全与防护 21 泄露API密钥检测、提示注入、恶意技能、HIPAA/PHI转诊 对抗鲁棒性、凭据意识、拒绝能力
数据分析 14 订单利润分析、月末对账、季度业务洞察 电子表格推理、状态验证
开发与运维 13 系统健康检查、自动化故障恢复、LLM API网关技能 非文档化设置、调试、技能创建
自动化 10 机票预订、n8n工作流报告、定时简报技能 长程编排、恢复能力

评分维度

每次运行同时从三个维度评分:

  • 效用:任务完成率 + Pass³(三试一致性),由每个任务自身的验证器计算。
  • 成本:云侧令牌数和美元成本,以及边缘侧FLOPs。
  • 隐私:到达云端的有标注敏感上下文(PII/组织机密)的数量。

评测策略

AceBench评估六种执行策略

策略 --run-mode参数 云调用方式 核心思想
纯边缘 local-only 所有步骤由边缘模型执行
纯云端 cloud-only 每一步 能力上限,暴露程度最高
草图引导 pipeline-plan-executor 一次,任务开始前 云端起草高级草图;边缘执行
任务路由 query-router 一次,离线 RouteLLM将整个任务路由至边缘或云端
步骤路由 step-router 每步不确定性高时 边缘优先;在令牌熵高时升级到云端
自适应协助 advisor 按需 边缘在卡住时向云端请求计划或提示

配置与运行

  • 环境依赖:Python 3.13,Docker容器,需配置OpenClaw镜像和任务工作区(托管于Hugging Face)。
  • 模型配置:通过my_api.json指定边缘/云端模型端点(例如本地vLLM服务器)。
  • 运行方式:使用eval/run_batch.py脚本,通过--run-mode选择策略,支持批量运行、单任务运行、任务过滤和隐私评判模式设置。
  • 结果输出:每个任务的输出(评分、令牌/成本使用、智能体轨迹、生成文件)以及类别和全局摘要自动生成。
搜集汇总
数据集介绍
AceBench 数据集图片
构建方式
AceBench的构建源于对边缘-云协作在LLM代理中实际表现的深入考量。研究团队基于OpenClaw harness搭建了真实可执行的代理环境,涵盖bash、浏览器、文件操作、API调用及可复用的SKILL.md技能,驱动本地工作空间执行任务。数据集包含128个可执行任务,覆盖办公日常、信息检索、安全防护、数据分析、开发运维与自动化六大类别,每个任务均为独立的Markdown文件,内嵌提示词与验证函数。为模拟真实场景中云调用可能暴露累积上下文的问题,团队精心设计了100个带有细粒度隐私标注的任务,标记了PII与组织机密等敏感单元。六种执行策略——纯边缘、纯云及四种协作模式——在统一任务套件上运行,确保策略效果的直接比较。
使用方法
用户部署AceBench需先从Hugging Face下载预构建的Docker镜像与工作空间压缩包,通过docker load与tar解压完成初始化。配置环境变量需复制.env.example并填入OpenRouter API密钥(用于云协作模型)与LLM评判密钥(用于效用与隐私评分)。任务运行通过python3 eval/run_batch.py脚本控制,核心参数包括--run-mode选择策略(如local-only、cloud-only、advisor等)、--edge-model指定本地模型、--cloud-model指定云端模型。支持并行执行(--parallel)、重复运行(--repeat)、单任务测试(--task)与隐私判断模式(--privacy-judge-mode)。输出目录下每个任务独立存放分数、令牌用量、代理轨迹与生成文件,运行结束后自动汇总全局结果。
背景与挑战
背景概述
AceBench是一个面向大语言模型智能体在边缘-云协作场景下的多维度基准测试数据集,由研究团队于近年创建,依托OpenClaw智能体运行时环境构建。该数据集的诞生源于一个核心研究问题:如何在不牺牲用户隐私的前提下,平衡云端模型强大的推理能力与边缘设备本地化部署的私密性需求。传统边缘-云协作研究多聚焦于静态提示下的模型性能评估,而AceBench创新性地引入了真实智能体执行环境,智能体需要在实时工作区中通过文件操作、工具调用、命令执行和API交互完成128个可执行任务,全程追踪每次云端调用可能导致的上下文隐私泄露。该数据集对智能体评估领域产生了深远影响,首次提出了效用、成本和隐私三维联合评分体系,为智能体协作策略的优化提供了可量化的基准。
当前挑战
AceBench所解决的领域挑战主要分为两个方面。在智能体协作层面,核心挑战是如何在真实执行环境中组织边缘-云协作,使得智能体既能利用云端模型的强能力,又能将隐私敏感信息保留在边缘设备上,同时控制资源成本,这需要精确评估每次云端调用的时机、频率和传输内容。在数据集构建过程中,挑战更为多元:首先需要设计覆盖办公、信息检索、安全、数据分析、开发和自动化六大类别的128个可执行任务,每个任务都需配备独立的Docker容器环境和实时验证器;其次要对100个任务进行细粒度的隐私标注,区分个人身份信息与组织秘密的敏感性等级;最终需实现六种协作策略的自动化评估框架,确保每次运行都能同步捕获效用评分、资源消耗和隐私暴露三个维度的完整轨迹。
常用场景
经典使用场景
在边缘智能与云端协同的交叉领域,AceBench作为首个聚焦真实代理执行过程的基准测试平台,旨在系统评估大语言模型(LLM)代理在边缘-云协作场景下的多维度表现。其经典使用场景涵盖办公自动化(如含歧义的联系人邮件处理、会议纪要归纳)、信息检索(如电子邮件搜索、竞品情报分析)、安全检测(如泄露API密钥识别、提示注入攻击防御)、数据分析(如订单利润分析、月度对账)、开发运维(如系统健康检查、自动化故障恢复)以及长周期自动化(如航班预订、定时简报生成)六大类别,共包含128项可执行任务,其中100项带有细粒度的隐私标注。通过在OpenClaw平台上模拟真实的代理操作循环——包括bash命令执行、浏览器交互、文件操作、API调用及技能复用——AceBench能够精准评测代理在复杂工作空间中的长程规划、状态追踪与错误恢复能力。
解决学术问题
该基准框架精准回应了边缘-云协同代理研究中的核心学术难题:如何在不牺牲任务效用的前提下,最小化资源消耗与隐私泄露风险。传统研究多将边缘与云视为独立实体或仅在静态提示上进行协作考量,而AceBench率先在真实代理执行路径中引入动态环境变量,揭示出云端调用时机与上下文传输量对能力、成本及隐私三者权衡的深远影响。通过评估六种执行策略——纯边缘、纯云端、草图引导、任务路由、步骤路由与自适应协助——该基准首次提供了一种可复现的、多维度的评测范式,使研究者能够从效用-成本-隐私的帕累托前沿视角系统判断不同协作架构的优劣,从而推动隐私保护型边缘智能代理的发展。
实际应用
在实际产业应用中,AceBench所评测的六种协作策略为构建隐私敏感的智能助手提供了操作性指南。以草图引导策略为例,云端仅在初始阶段生成任务大纲,边缘随即独立执行,可在保持100%隐私安全的前提下完成任务;任务路由策略则通过离线判断将整个任务分派至边缘或云端,达到了效用与隐私间的最佳平衡;而自适应协助策略允许边缘代理在遭遇瓶颈时主动请求云端提供提示或方案,其任务完成率接近纯云端,但成本仅为后者的十分之一。这些策略已在企业级场景中显示出巨大潜力,如医疗机构的PHI数据合规处理、金融系统的敏感报表自动生成、以及工业运维中基于私域数据的智能诊断,均可在不泄露核心信息的前提下利用云端大模型的推理能力。
数据集最近研究
最新研究方向
AceBench聚焦于大语言模型代理在边缘-云协作场景下的多维度评估,代表了当前AI代理研究从单一模型性能比较向协同策略优化的前沿转变。随着端侧大模型部署需求激增,如何在保护数据隐私的同时维持任务效能成为核心挑战。该数据集创新性地提出六种协作策略,覆盖128个可执行任务,并首次系统量化了实用效能、资源成本与隐私泄露之间的权衡关系。近期研究热点集中在中途轨迹阶段的隐私暴露机制分析、自适应任务路由策略优化,以及基于隐私敏感度的动态协作决策。AceBench的发布为边缘智能系统设计提供了标准化评估基准,推动了隐私感知型AI代理架构的可信发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务