遇见数据集

aws-bench-datasets

收藏
github2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

用于评估AI代理在真实世界AWS自动化任务中的场景和任务的数据集,包含134个任务,分为99个内省任务和35个突变任务,并划分为三个子集:QUICKSTART、BASIC和ADVANCED。

This dataset is designed to evaluate AI Agents' scenarios and tasks within real-world AWS automation workflows. It comprises 134 tasks, which are divided into 99 introspective tasks and 35 mutated tasks, and is split into three subsets: QUICKSTART, BASIC, and ADVANCED.

创建时间:
2026-07-14
原始信息汇总

数据集概述

aws-bench-datasets 是一个用于评估 AI 智能体在真实 AWS 自动化任务上表现的数据集,包含场景(Scenarios)和任务(Tasks)。该数据集需配合 aws-bench 框架 使用,以在隔离的 AWS 环境中运行智能体并评估其结果。

任务类型

数据集包含两种任务类型:

  • Introspection(只读诊断):智能体运行后将其答案写入 /logs/agent/agent-output.txt,由 LLM 评判器(rewardkit)与 tests/ground_truth.json 中的参考答案进行比较。
  • Mutation(创建/修改资源):智能体运行后将结构化 JSON 写入 /logs/agent/agent-output.json(如果需要),由程序化的 boto3 验证器(tests/check.py)检查实时的 AWS 状态。

数据集规模与划分

数据集共包含 134 个任务,其中:

  • 99 个任务属于 introspection 类型,要求获取账户状态信息而不做更改。
  • 35 个任务属于 mutation 类型,会导致资源变更。

数据集被划分为三个子集:

子集 任务数量 描述
QUICKSTART 9 用于测试环境设置的简单任务
BASIC 78 评估与 AWS 服务交互所需的基础知识
ADVANCED 47 对当前先进模型也具挑战性的任务

数据集结构

数据集遵循扩展的 Harbor 格式,主要目录结构如下:

tasks/<scenario-id>/<task-name>/ task.toml # 任务配置:场景、角色、元数据、超时、占位符 instruction.md # 提供给智能体的提示 tests/ ground_truth.json # introspection 任务的参考答案 check.py # mutation 任务的 boto3 验证器 test.sh # 验证器入口 solution/ solve.sh # 参考解决方案 environment/ Dockerfile docker-compose.yaml pre_invoke/ # (可选)在智能体运行前执行,例如生成动态状态 post_invoke/ # (可选)在智能体运行后执行,例如回滚变更

scenarios/<scenario-id>/ scenario.toml # 账户标签、区域、配额、超时 deploy/deploy.sh # 引导区域、部署所有堆栈、运行设置脚本 cleanup/cleanup.sh # 拆除已部署的堆栈 reset/, verify/ # (可选)重置辅助/部署后验证 scenario/ Dockerfile # 部署工具容器 cdk_app/ # 自包含的 CDK 应用(堆栈、Lambda 资产、QA 角色) setup/ # (可选)部署后设置脚本

每个任务通过 task.toml 文件中的 scenario_id 引用一个场景。多个任务可以共享同一个场景。每个场景映射到一个 AWS 账户(通过 account_tags),并可以跨多个区域部署堆栈。

智能体引导

shared/steering/ 目录包含 AWS 感知指令,用于引导智能体使用 AWS CLI/SDK 而非搜索本地文件系统。注册表中的数据集会自动附加这些指令。

使用指南

  • 运行基准测试:使用命令 aws-bench run -d <dataset>(运行最新版本)或 -d <dataset>@<version>(指定版本)。可先用 aws-bench-quickstart 数据集进行烟雾测试。
  • 环境要求:运行前需设置 AWS_REGION=us-east-1AWS_DEFAULT_REGION=us-east-1,所有场景均期望在 us-east-1 区域运行。
  • 场景部署:由 aws-bench 框架的 aws-bench env 命令自动完成,使用场景内的 deploy/deploy.sh 脚本,并注入账户凭证。

添加新场景和任务

  1. scenarios/<scenario-id>/ 下创建 scenario.tomldeploy/deploy.sh 和自包含的 CDK 应用(位于 scenario/cdk_app/)。
  2. 创建任务目录 tasks/<scenario-id>/<task-name>/
  3. 对于 introspection 任务,需复制共享的评判器文件:./shared/judge/scripts/sync.sh

详细开发指南请参考 Datasets Development Guide

构建与测试

项目使用 Makefile 管理构建流程,各类检查覆盖 TypeScript、CDK、Python、Shell、Docker 及配置文件的验证。运行 make check 可执行全部检查。数据集的版本信息保存在框架的 registry.json 中。

许可证

本项目采用 Apache License 2.0 许可证。

搜集汇总
数据集介绍
aws-bench-datasets 数据集图片
构建方式
该数据集专为评估AI智能体在AWS自动化任务中的表现而设计,构建过程严谨而系统。整个数据集包含134个任务,依据交互性质划分为两大类别:诊断型任务(Introspection)仅涉及账户信息的只读查询,智能体需将答案写入指定文件,由LLM评判器对照标准答案进行比对;变更型任务(Mutation)则要求智能体创建或修改云资源,并以结构化JSON格式输出结果,由基于boto3的程序化验证器实时检查AWS环境状态。数据集进一步细分为三个子集:QUICKSTART包含9个简单任务用于快速验证,BASIC涵盖78个基础任务以评估对AWS服务的基本操作能力,ADVANCED则包含47个高级任务,对前沿模型构成显著挑战。每个任务基于Harbor扩展格式组织,存放在tasks/目录下,包含task.toml配置文件、instruction.md指令文件、测试脚本及参考解决方案,同时关联scenarios/目录中由CDK实现的容器化部署环境,确保每个实验环境可隔离、可复现。
特点
该数据集的显著特点在于其高度结构化的设计和对真实世界AWS操作场景的逼真模拟。任务覆盖只读诊断与资源变更两类操作,不仅考验智能体的信息获取能力,更强调对云环境的实际操控与结果验证,评估维度全面。三分之二的诊断任务通过LLM评判器实现自动化评分,而三分之一的变更任务则采用程序化验证,后者直接对接AWS实时状态,确保评估客观且可靠。数据集版本化管理机制完善,用户可通过registry.json获取最新版本,或精确指定版本号实现实验的可重复性。此外,shared/steering/目录中预置了AWS感知指令,可引导智能体优先使用AWS CLI和SDK而非本地文件搜索,显著提升任务执行的准确率和效率。整套系统融合了自动化部署、隔离测试环境、多区域支持及高标准的代码质量检查(包括TypeScript、CDK、Python、Shell和Docker的多层验证),为AI智能体的系统性评估提供了坚实而灵活的基础。
使用方法
使用该数据集进行AI智能体评估需结合配套的aws-bench框架。首先在终端设定AWS_REGION=us-east-1和AWS_DEFAULT_REGION=us-east-1环境变量,确保所有操作指向正确的区域。随后可通过命令行工具直接运行评估,例如使用`aws-bench run -d aws-bench-quickstart`启动快速验证任务,或通过`-d <数据集名称>@<版本号>`锁定特定版本。框架会自动调用场景部署引擎,构建scenario/Dockerfile并在其中执行deploy/deploy.sh脚本,为每个任务创建隔离的AWS测试环境。智能体在执行过程中应遵循instruction.md中的提示,对于诊断任务需将答案写入/logs/agent/agent-output.txt,对于变更任务需按要求输出结构化JSON至/logs/agent/agent-output.json。评估完成后,系统分别调用LLM评判器或boto3验证器对结果进行评分。用户还可通过框架的`--extra-instruction-path`标志附加自定义指令,或利用`aws-bench env`命令管理测试环境的生命周期。对于希望贡献新任务的开发者,可按规范在tasks/和scenarios/目录下创建相应的配置文件、CDK应用和验证脚本,并通过make check等命令确保代码质量符合项目标准。
背景与挑战
背景概述
aws-bench-datasets 是由亚马逊云科技(AWS)研究团队于 2024 年创建的一个面向真实世界 AWS 自动化任务的 AI 智能体评估基准数据集。该数据集聚焦于评测大型语言模型驱动的智能体在复杂云环境中的自主操作能力,涵盖了 134 个精心设计的任务,分为基础(BASIC,78 个任务)和高级(ADVANCED,47 个任务)两个层次,以及一个快速验证集(QUICKSTART,9 个任务)。任务类型包括只读的“自省”任务(99 个)和需要创建或修改资源的“状态变更”任务(35 个),旨在系统性地评估智能体在 AWS 服务交互中的诊断、推理和执行能力。该数据集的发布为 AI 在云运维领域的落地提供了一个标准化、可复现的评估平台,对推动自主云管理技术的发展具有重要价值。
当前挑战
该数据集面临的主要挑战包括:1) 所解决的领域问题挑战:真实 AWS 环境具有高度动态性和复杂性,智能体需要同时处理多区域资源、不同服务间的依赖关系、以及账户级别的权限约束。与静态数据集不同,本数据集要求智能体在真实云环境中进行信息获取和资源操作,这对模型的错误容忍度和安全边界提出了极高要求。2) 构建过程中的挑战:为确保评估的公平性和可重复性,每个任务都需要通过 CDK(Cloud Development Kit)构建独立的隔离测试环境,并设计精确的 ground truth 验证机制(包括基于 LLM 的判断器用于自省任务,以及基于 boto3 的程序化验证器用于状态变更任务)。此外,任务之间可能存在资源竞争,需要设计完善的部署和清理脚本,并维护版本控制以确保基准测试的长期稳定性。
常用场景
经典使用场景
在云服务自动化与人工智能代理交汇的前沿领域,aws-bench-datasets被精心设计为评估AI代理在真实Amazon Web Services自动化任务中表现的权威基准。该数据集涵盖134项任务,其中99项内省任务要求代理仅通过只读操作获取账户状态信息,35项变更任务则需代理创建或修改云资源。其核心使用模式是,在利用aws-bench框架隔离预配的AWS环境内运行待测代理,并通过大型语言模型裁判(内省任务)或程序化boto3验证器(变更任务)对代理输出进行自动化评估,从而系统性地衡量AI在复杂基础设施管理场景下的能力边界。
解决学术问题
aws-bench-datasets直面当前AI代理研究中一个关键学术空白:缺乏标准化、可复现且面向真实工业级云操作的任务集。该数据集通过精心构建三组递进难度的子集(QUICKSTART、BASIC、ADVANCED)和严格的任务验证机制,有效解决了因环境动态性导致的研究结果不可比难题。其双轨验证体系——自然语言裁判与代码化检验——为量化代理在安全敏感型云环境中的决策准确性、工具使用能力和状态感知水平提供了方法论基石,极大地推动了AI代理与基础模型在多步骤系统管理任务中的鲁棒性评估研究。
衍生相关工作
基于aws-bench-datasets的范式,研究社区已衍生出若干开创性工作以拓展该基准的边界。最直接的相关工作是用于量化评估的aws-bench框架本身,该框架提供了环境预配、代理调度与结果判定的完整流水线。此外,数据集所采用的Harbor格式任务表示已成为云代理任务标准化的重要参考,催生了针对多区域、多账户协作场景的扩展研究工作。已有学者借鉴其内省与变更任务的双轨设计,构建了面向Kubernetes集群管理和数据库运维的专项基准。在方法论层面,该数据集验证的LLM-as-Judge评估策略已被广泛应用于其他系统级代理的评测体系构建中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务