遇见数据集

ACWorld

收藏
github2026-08-19 更新2026-08-22 收录
数据链接:
官方服务:

资源简介:

ACWorld是一个用于训练和评估买家与商家代理的多对多环境。发布的基准测试包含两部分:能力基准测试(涵盖10个商业家族和80个能力的200个任务)和大目录基准测试(涵盖4个家族和18个能力的60个任务,搜索从791,431条源记录派生的785,022个列表,并根据确定性全目录预言机对决策进行评分)。

ACWorld is a many-to-many environment for training and evaluating buyer and merchant agents. The released benchmark suite consists of two components: the Capability Benchmark, which includes 200 tasks covering 10 business families and 80 capabilities, and the Large-Scale Catalog Benchmark, which contains 60 tasks covering 4 business families and 18 capabilities, searches through 785,022 listings derived from 791,431 source records, and scores decisions against a deterministic full-catalog oracle.

创建时间:
2026-07-23
原始信息汇总

ACWorld 数据集详情

数据集简介

ACWorld(Agentic Commerce World)是一个面向"氛围商务"(Vibe Commerce)的多对多环境,用于训练和评估买方(Buyer)与商户(Merchant)智能体。智能体通过氛围商务协议(Vibe Commerce Protocol)进行交互,商务智能平台(Commerce Intelligence Platform)验证每个操作,世界(World)记录授权的交易效果。

基准测试组成

ACWorld 发布的基准测试包含两个部分,可单独或合并运行,并保留各自的评分:

部分 任务数量 覆盖范围 特点
能力基准(Capability benchmark) 200 个任务 10 个商务类别、80 项能力 任务请求模拟真实的买方和商户消息
大型目录基准(Large-catalog benchmark) 60 个任务 4 个类别、18 项能力 搜索 785,022 条商品列表(源自 791,431 条源记录),使用确定性全目录预言机评分

版本更新(1.1.0)

1.1.0 版本修订了 200 任务能力基准,60 任务大型目录基准保持不变。主要变更包括:

  • 任务请求格式更接近真实买方和商户消息
  • 隐藏内部字段和组件名称
  • 响应解析更宽容,普通格式错误不再导致有效决策失败
  • 售后任务不再公布评分器期望的操作
  • 拒绝政策未覆盖的请求有时成为正确答案
  • 信用主要取决于达成的处置及留下的商业状态,而非操作命名顺序
  • 比较候选更接近,正确答案不再限于前几个位置
  • --workers 可提升至 2 以上,每次运行报告未评分任务数量

快速开始

环境要求

  • Git
  • Python 3.11 或更高版本
  • 网络连接
  • 至少 5 GB 可用磁盘空间(用于大型目录和输出)
  • OpenRouter API 密钥(存储在仓库外的文本文件中)

安装与运行

bash git clone https://github.com/shichengf/ACWorld.git cd ACWorld

./run_benchmark.sh run --tasks 200 --model google/gemini-3.6-flash --api-key-file /absolute/path/to/openrouter-key.txt

选择基准

  • 200 任务能力基准--tasks 200
  • 60 任务大型目录基准--tasks 60(首次运行自动下载大型目录)
  • 合并运行--tasks 260
  • 省略 --tasks 运行原始的 200 任务
  • --model all 运行论文中报告的十个模型

论文模型面板

包含以下模型:

  • qwen/qwen3.5-plus-20260420
  • deepseek/deepseek-v4-pro
  • mistralai/mistral-medium-3-5
  • google/gemini-3.5-flash
  • anthropic/claude-sonnet-5
  • openai/gpt-5.6-terra
  • openai/gpt-5.6-sol
  • openai/gpt-5.6-luna
  • moonshotai/kimi-k3
  • google/gemini-3.6-flash

数据下载与验证

大型目录通过 large-catalog-data-v1 发布提供,包含完整的规范化 SQLite 数据库。首次运行 60 任务或 260 任务时自动下载并组装 65 个发布分片。验证命令:

bash ./scripts/run_large_catalog.sh download ./scripts/run_large_catalog.sh validate

验证确认:791,431 条源记录、785,022 条可搜索列表、60 个任务定义。

执行行为

  • --workers 控制并发任务数(1-8,默认 2),任务独立评分,工作线程数不影响分数
  • 传输或提供方故障会重试一次
  • 模型协议错误或错误决策计为已评分结果
  • 重复相同命令跳过已完成的任务文件
  • 每次运行报告 scored_run_countunscored_run_countprovider_failed_run_count 等字段
  • 论文数据在 --workers 2 下产生,更高并发仅在 unscored_run_count 为 0 时与论文可比

输出结构

运行和模型响应在本地生成:

output/ benchmark/ <model>/ runs/ results.csv summary.json large-catalog/ catalog.sqlite catalog-summary.json tasks.json validation-report.json reference/ <model>/ LC-*.json results.csv summary.json

60 任务基准的模型目录保留任务级分数、过程奖励、终端状态、模型调用和延迟。

仓库内容

  • src/:智能体、VCP、商务智能平台、世界、基准构建、评分和运行器
  • skills/:可复用的买方和商户能力
  • scenarios/:确定性环境示例和市场研究
  • data/:受控目录夹具和来源元数据
  • examples/:扩展示例
  • tests/:公共基准路径的回归测试

许可与使用限制

  • 源代码和代码文档采用 MIT 许可证
  • MIT 许可证不适用于准备好的大型目录数据库或衍生目录夹具
  • 数据包可用于研究复现和 ACWorld 评估
  • 未经许可不得再分发、镜像、托管、再许可、出售或重新发布数据包或其内容
  • 其他用途需联系仓库维护者
  • 仓库不包含原始商户页面或私人用户数据
  • 从 CSV 文件重建的研究人员有责任使用其有权处理的数据
搜集汇总
数据集介绍
ACWorld 数据集图片
构建方式
ACWorld数据集从多维度精心构建,旨在模拟真实商务环境中买方与卖方智能体的交互。其构建过程依托于Vibe Commerce协议,通过商务智能平台验证每个动作,并由世界模块记录授权的交易效果。该数据集包含两大基准部分:能力基准涵盖10个商务族系、80种能力,共200项任务;大型目录基准则整合了从791,431条源记录中衍生出的785,022条可搜索清单,并设计60项任务,通过确定性全目录预言机对决策进行精确评分。两部分均支持独立运行或联合使用,且评分体系分别设计,以评估不同分布下的性能。
特点
ACWorld数据集的核心特色在于其可审计性与可验证性,为‘氛围商务’环境提供多对多的智能体训练与评估平台。其任务设计紧密模仿真实买卖双方的消息互动,隐藏内部字段,增强任务自然度;评分机制注重最终处置结果与商业状态,而非操作序列。数据集中包含对比候选,且正确答案不局限于前排,提升了评估难度与真实性。此外,该数据集支持动态调整并发数,并详细报告未评分任务数,确保评估过程的透明度与可重复性。
使用方法
ACWorld数据集的使用方式直白且灵活。研究者可通过简单的命令行工具快速启动基准测试,选择运行200项能力任务或60项大型目录任务,或联合运行260项任务。通过指定OpenRouter API密钥,可调用多种主流大语言模型进行测试。数据集提供了完整的验证与烟雾测试流程,包括免费烟雾测试、单项付费测试及针对大型目录的预警测试,无需模型调用即可验证数据完整性。同时,支持多模型并行运行及成本控制,并生成详尽的输出报告,便于研究者深入分析结果。
背景与挑战
背景概述
ACWorld数据集是由Shicheng Fang等人于2026年发布的一项创新性研究,其核心目标是构建一个多对多的代理交互环境,专门用于训练和评估买家与商家两类智能体在‘氛围商务’(Vibe Commerce)场景下的决策能力。该环境通过‘氛围商务协议’规范代理行为,由商务智能平台验证每一个动作,并在世界中记录经授权的交易效果,从而确保了交互过程的可审计性与可验证性。这一研究填补了现有商业智能体评估中缺乏真实、动态且可扩展环境的空白,为多代理系统在复杂商务场景中的研究提供了一个标准化平台。其包含的能力基准(200项任务)和大规模目录基准(60项任务,涉及近79万条商品记录)覆盖了十个商务家族和八十项能力,显著推动了商务智能体的性能评估与比较研究,对相关领域产生了深远影响。
当前挑战
ACWorld数据集在构建与应用过程中面临多重挑战。首要挑战在于领域问题的复杂性:所解决的‘氛围商务’任务要求买家与商家代理理解自然语言指令、执行多步交易流程、处理售后场景,并依据确定的商务政策做出拒绝或接受的决策,这远超出传统单一分类或生成任务,需评估模型在动态环境中的规划、推理与策略遵循能力。其次,构建数据集面临工程与理论的双重挑战:需要设计一个可审计且可验证的多对多环境,实现协议合规性检查、交易效果记录及确定性评分器;同时,在处理大规模目录时,须从超过79万条源记录中清洗并归一化出78万余条可搜索列表,确保数据一致性与评分准确性。此外,评测过程还面临执行层面的挑战,如并发任务导致的提供商限流与任务未评分问题,要求研究者控制运行参数并小心解读结果,以保证评估的可复现性与公平性。
常用场景
经典使用场景
ACWorld作为一个多对多的智能体环境,其最经典的使用场景在于训练与评估Buyer和Merchant两类智能代理在动态商业交互中的决策能力。研究者可依据Vibe Commerce Protocol,让智能体在高度仿真的商业世界中执行诸如商品检索、议价、下单及售后处理等一系列任务,并通过Commerce Intelligence Platform对每一步操作进行实时验证。该环境支持能力基准(200个任务)与大目录基准(60个任务)的独立或联合运行,从而为智能体在复杂商业情境下的表现提供了可量化、可复现的评估基准。
衍生相关工作
ACWorld的发布催生了一系列相关领域的探索性工作。一方面,其提出的Vibe Commerce Protocol启发了后续研究对结构化商业交流协议的深化与扩展,推动了人机协同商务范式的构建。另一方面,基于该基准的评测体系已被用于新模型的性能验证,如多模态大模型在商业决策任务中表现的系统性分析。此外,其可审计、可验证的环境设计理念也渗透至金融、供应链等其他智能体应用场景,衍生出诸如可解释性强化学习框架以及基于过程的奖励建模等研究方向。这些衍生工作共同构筑了一个围绕智能体商务交互的学术生态,持续推动着可信自主代理研究的前沿。
数据集最近研究
最新研究方向
ACWorld数据集的最新研究聚焦于构建可审计、可验证的多智能体商业交互环境,以推动‘氛围商务’(Vibe Commerce)这一新兴范式的发展。其核心创新在于引入Vibe Commerce协议与商务智能平台,实现对买家与商家智能体行为的严格验证与效果记录。研究重点包括:通过260项任务覆盖十类商业家族与80种能力,评估智能体在真实商业场景中的决策质量;利用大规模目录基准(含785,022条商品列表)测试智能体在复杂信息检索与全目录最优决策上的表现。该数据集强调运行的可复现性与评分的确定性,并关注任务表述的自然化与评分机制的容错性,以适应大语言模型作为智能体时的交互特性。相关工作与电商智能化、多智能体系统及可验证AI等热点方向紧密相连,为构建可信赖的商业自动化智能体提供了标准化测试平台与基准,对推动下一代商务交互系统的研究具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务