aws-bench-datasets
收藏资源简介:
用于评估AI代理在真实世界AWS自动化任务中的场景和任务的数据集,包含134个任务,分为99个内省任务和35个突变任务,并划分为三个子集:QUICKSTART、BASIC和ADVANCED。
This dataset is designed to evaluate AI Agents' scenarios and tasks within real-world AWS automation workflows. It comprises 134 tasks, which are divided into 99 introspective tasks and 35 mutated tasks, and is split into three subsets: QUICKSTART, BASIC, and ADVANCED.
数据集概述
aws-bench-datasets 是一个用于评估 AI 智能体在真实 AWS 自动化任务上表现的数据集,包含场景(Scenarios)和任务(Tasks)。该数据集需配合 aws-bench 框架 使用,以在隔离的 AWS 环境中运行智能体并评估其结果。
任务类型
数据集包含两种任务类型:
- Introspection(只读诊断):智能体运行后将其答案写入
/logs/agent/agent-output.txt,由 LLM 评判器(rewardkit)与tests/ground_truth.json中的参考答案进行比较。 - Mutation(创建/修改资源):智能体运行后将结构化 JSON 写入
/logs/agent/agent-output.json(如果需要),由程序化的 boto3 验证器(tests/check.py)检查实时的 AWS 状态。
数据集规模与划分
数据集共包含 134 个任务,其中:
- 99 个任务属于 introspection 类型,要求获取账户状态信息而不做更改。
- 35 个任务属于 mutation 类型,会导致资源变更。
数据集被划分为三个子集:
| 子集 | 任务数量 | 描述 |
|---|---|---|
| QUICKSTART | 9 | 用于测试环境设置的简单任务 |
| BASIC | 78 | 评估与 AWS 服务交互所需的基础知识 |
| ADVANCED | 47 | 对当前先进模型也具挑战性的任务 |
数据集结构
数据集遵循扩展的 Harbor 格式,主要目录结构如下:
tasks/<scenario-id>/<task-name>/ task.toml # 任务配置:场景、角色、元数据、超时、占位符 instruction.md # 提供给智能体的提示 tests/ ground_truth.json # introspection 任务的参考答案 check.py # mutation 任务的 boto3 验证器 test.sh # 验证器入口 solution/ solve.sh # 参考解决方案 environment/ Dockerfile docker-compose.yaml pre_invoke/ # (可选)在智能体运行前执行,例如生成动态状态 post_invoke/ # (可选)在智能体运行后执行,例如回滚变更
scenarios/<scenario-id>/ scenario.toml # 账户标签、区域、配额、超时 deploy/deploy.sh # 引导区域、部署所有堆栈、运行设置脚本 cleanup/cleanup.sh # 拆除已部署的堆栈 reset/, verify/ # (可选)重置辅助/部署后验证 scenario/ Dockerfile # 部署工具容器 cdk_app/ # 自包含的 CDK 应用(堆栈、Lambda 资产、QA 角色) setup/ # (可选)部署后设置脚本
每个任务通过 task.toml 文件中的 scenario_id 引用一个场景。多个任务可以共享同一个场景。每个场景映射到一个 AWS 账户(通过 account_tags),并可以跨多个区域部署堆栈。
智能体引导
shared/steering/ 目录包含 AWS 感知指令,用于引导智能体使用 AWS CLI/SDK 而非搜索本地文件系统。注册表中的数据集会自动附加这些指令。
使用指南
- 运行基准测试:使用命令
aws-bench run -d <dataset>(运行最新版本)或-d <dataset>@<version>(指定版本)。可先用aws-bench-quickstart数据集进行烟雾测试。 - 环境要求:运行前需设置
AWS_REGION=us-east-1和AWS_DEFAULT_REGION=us-east-1,所有场景均期望在us-east-1区域运行。 - 场景部署:由 aws-bench 框架的
aws-bench env命令自动完成,使用场景内的deploy/deploy.sh脚本,并注入账户凭证。
添加新场景和任务
- 在
scenarios/<scenario-id>/下创建scenario.toml、deploy/deploy.sh和自包含的 CDK 应用(位于scenario/cdk_app/)。 - 创建任务目录
tasks/<scenario-id>/<task-name>/。 - 对于 introspection 任务,需复制共享的评判器文件:
./shared/judge/scripts/sync.sh。
详细开发指南请参考 Datasets Development Guide。
构建与测试
项目使用 Makefile 管理构建流程,各类检查覆盖 TypeScript、CDK、Python、Shell、Docker 及配置文件的验证。运行 make check 可执行全部检查。数据集的版本信息保存在框架的 registry.json 中。
许可证
本项目采用 Apache License 2.0 许可证。




