ACWorld
收藏资源简介:
ACWorld是一个用于训练和评估买家与商家代理的多对多环境。发布的基准测试包含两部分:能力基准测试(涵盖10个商业家族和80个能力的200个任务)和大目录基准测试(涵盖4个家族和18个能力的60个任务,搜索从791,431条源记录派生的785,022个列表,并根据确定性全目录预言机对决策进行评分)。
ACWorld is a many-to-many environment for training and evaluating buyer and merchant agents. The released benchmark suite consists of two components: the Capability Benchmark, which includes 200 tasks covering 10 business families and 80 capabilities, and the Large-Scale Catalog Benchmark, which contains 60 tasks covering 4 business families and 18 capabilities, searches through 785,022 listings derived from 791,431 source records, and scores decisions against a deterministic full-catalog oracle.
ACWorld 数据集详情
数据集简介
ACWorld(Agentic Commerce World)是一个面向"氛围商务"(Vibe Commerce)的多对多环境,用于训练和评估买方(Buyer)与商户(Merchant)智能体。智能体通过氛围商务协议(Vibe Commerce Protocol)进行交互,商务智能平台(Commerce Intelligence Platform)验证每个操作,世界(World)记录授权的交易效果。
基准测试组成
ACWorld 发布的基准测试包含两个部分,可单独或合并运行,并保留各自的评分:
| 部分 | 任务数量 | 覆盖范围 | 特点 |
|---|---|---|---|
| 能力基准(Capability benchmark) | 200 个任务 | 10 个商务类别、80 项能力 | 任务请求模拟真实的买方和商户消息 |
| 大型目录基准(Large-catalog benchmark) | 60 个任务 | 4 个类别、18 项能力 | 搜索 785,022 条商品列表(源自 791,431 条源记录),使用确定性全目录预言机评分 |
版本更新(1.1.0)
1.1.0 版本修订了 200 任务能力基准,60 任务大型目录基准保持不变。主要变更包括:
- 任务请求格式更接近真实买方和商户消息
- 隐藏内部字段和组件名称
- 响应解析更宽容,普通格式错误不再导致有效决策失败
- 售后任务不再公布评分器期望的操作
- 拒绝政策未覆盖的请求有时成为正确答案
- 信用主要取决于达成的处置及留下的商业状态,而非操作命名顺序
- 比较候选更接近,正确答案不再限于前几个位置
--workers可提升至 2 以上,每次运行报告未评分任务数量
快速开始
环境要求
- Git
- Python 3.11 或更高版本
- 网络连接
- 至少 5 GB 可用磁盘空间(用于大型目录和输出)
- OpenRouter API 密钥(存储在仓库外的文本文件中)
安装与运行
bash git clone https://github.com/shichengf/ACWorld.git cd ACWorld
./run_benchmark.sh run --tasks 200 --model google/gemini-3.6-flash --api-key-file /absolute/path/to/openrouter-key.txt
选择基准
- 200 任务能力基准:
--tasks 200 - 60 任务大型目录基准:
--tasks 60(首次运行自动下载大型目录) - 合并运行:
--tasks 260 - 省略
--tasks运行原始的 200 任务 --model all运行论文中报告的十个模型
论文模型面板
包含以下模型:
- qwen/qwen3.5-plus-20260420
- deepseek/deepseek-v4-pro
- mistralai/mistral-medium-3-5
- google/gemini-3.5-flash
- anthropic/claude-sonnet-5
- openai/gpt-5.6-terra
- openai/gpt-5.6-sol
- openai/gpt-5.6-luna
- moonshotai/kimi-k3
- google/gemini-3.6-flash
数据下载与验证
大型目录通过 large-catalog-data-v1 发布提供,包含完整的规范化 SQLite 数据库。首次运行 60 任务或 260 任务时自动下载并组装 65 个发布分片。验证命令:
bash ./scripts/run_large_catalog.sh download ./scripts/run_large_catalog.sh validate
验证确认:791,431 条源记录、785,022 条可搜索列表、60 个任务定义。
执行行为
--workers控制并发任务数(1-8,默认 2),任务独立评分,工作线程数不影响分数- 传输或提供方故障会重试一次
- 模型协议错误或错误决策计为已评分结果
- 重复相同命令跳过已完成的任务文件
- 每次运行报告
scored_run_count、unscored_run_count、provider_failed_run_count等字段 - 论文数据在
--workers 2下产生,更高并发仅在unscored_run_count为 0 时与论文可比
输出结构
运行和模型响应在本地生成:
output/ benchmark/ <model>/ runs/ results.csv summary.json large-catalog/ catalog.sqlite catalog-summary.json tasks.json validation-report.json reference/ <model>/ LC-*.json results.csv summary.json
60 任务基准的模型目录保留任务级分数、过程奖励、终端状态、模型调用和延迟。
仓库内容
src/:智能体、VCP、商务智能平台、世界、基准构建、评分和运行器skills/:可复用的买方和商户能力scenarios/:确定性环境示例和市场研究data/:受控目录夹具和来源元数据examples/:扩展示例tests/:公共基准路径的回归测试
许可与使用限制
- 源代码和代码文档采用 MIT 许可证
- MIT 许可证不适用于准备好的大型目录数据库或衍生目录夹具
- 数据包可用于研究复现和 ACWorld 评估
- 未经许可不得再分发、镜像、托管、再许可、出售或重新发布数据包或其内容
- 其他用途需联系仓库维护者
- 仓库不包含原始商户页面或私人用户数据
- 从 CSV 文件重建的研究人员有责任使用其有权处理的数据





