EntCollabBench
收藏资源简介:
EntCollabBench是一个用于评估企业导向多智能体协作的基准数据集,专注于现实工作场所中的任务执行场景。该数据集模拟企业环境,具有角色分离、服务边界、审批工作流和可观察的副作用等特点。它包含四个任务文件和两个支持性资源归档文件,总计300个任务样本,其中200个是MCP导向任务,100个是审批导向任务。任务样本涵盖单任务、多步骤协作、审批决策和多子任务协调等类型。数据集支持多智能体任务分解与委派、结构化企业环境中的工具使用、跨角色协作、基于本地政策文档的审批推理、智能体工作流评估以及端到端操作成功基准测试等研究方向。数据字段包括任务标识符、描述、指令、智能体分配、子任务列表、参考操作和状态变化规范等。基准测试环境涉及多个专业智能体角色和模拟企业系统。
EntCollabBench is a benchmark dataset for evaluating enterprise-oriented multi-agent collaboration, focusing on task execution scenarios in real workplaces. It simulates enterprise environments, featuring role separation, service boundaries, approval workflows, and observable side effects. The dataset contains four task files and two supporting resource archive files, totaling 300 task samples, among which 200 are MCP-oriented tasks and 100 are approval-oriented tasks. The task samples cover categories such as single-task execution, multi-step collaboration, approval decision-making, and multi-subtask coordination. This dataset supports multiple research directions, including multi-agent task decomposition and delegation, tool utilization in structured enterprise environments, cross-role collaboration, approval reasoning based on local policy documents, agent workflow evaluation, and end-to-end operational success benchmarking. The data fields include task identifier, description, instructions, agent assignment, subtask list, reference operations, and state change specifications, among others. The benchmark environment involves multiple professional agent roles and simulated enterprise systems.
EntCollabBench 数据集概述
数据集简介
EntCollabBench 是一个面向企业级多智能体协作的基准测试数据集,模拟真实工作场景中的任务执行。在该场景中,一个入门级智能体需要调用工具、与企业系统交互,并在必要时将子任务委派给专门的同级智能体,以完成用户请求。
数据集构成
数据集包含 300 个任务,分为四个任务文件和两个支持资源包:
| 配置文件 | 任务文件 | 数量 | 说明 |
|---|---|---|---|
mcp_tasks |
mcp_tasks_160.json |
160 | 面向企业 MCP 工具使用的单任务样本 |
mcp_multi_tasks |
mcp_multi_tasks_40.json |
40 | 多步骤/多子任务协作样本 |
approval_tasks |
approval_tasks_80.json |
80 | 基于文档的审批决策任务 |
approval_multi_tasks |
approval_multi_task_20.json |
20 | 多子任务审批与协调任务 |
任务类型分布:
- 200 个 MCP 导向任务
- 100 个审批导向任务
支持资源包:
seed.zip:用于初始化模拟企业后端服务的种子数据local_data.zip:审批智能体使用的本地审批文档和政策材料(包括财务、法律、采购等政策)
数据字段
通用字段:
task_id:任务批次的唯一标识符description:批次的自然语言描述(可选)task:单任务样本的任务指令target_agent:单任务样本的初始智能体sub_task_list:多任务样本中的子任务列表sub_task_id:批次内子任务的唯一标识符user_prompt:子任务的用户指令beginning_agent:分配给子任务的初始智能体ground_truth:结构化参考操作或预期的工具使用路径(可选)state_export:评估企业服务状态变化的规范(可选)
字段别名兼容性:
task或user_prompttarget_agent、begin_agent或beginning_agentsub_task_list或task_list
智能体角色
基准测试环境使用以下专门的企业智能体角色,每个角色具有特定的工具和责任边界:
it_service_desk_l1(IT 服务台)it_change_engineer(IT 变更工程师)hr_service_specialist(人力资源专家)customer_support_specialist(客户支持专家)knowledge_base_specialist(知识库专家)collaboration_ops_specialist(协作运营专家)developer_engineer(开发工程师)qa_test_engineer(QA 测试工程师)finance_approval_specialist(财务审批专家)legal_approval_specialist(法律审批专家)procurement_approval_specialist(采购审批专家)
企业服务领域
任务可能涉及以下模拟企业系统:
calendar(日历)csm(客户服务管理)drive(云盘)email(邮件)gitea(代码仓库)hr(人力资源)itsm(IT 服务管理)teams(团队协作)
审批任务额外依赖 local_data.zip 提供的本地政策与提交文档。
支持的科研用途
该数据集适用于以下研究方向:
- 多智能体任务分解与委派
- 结构化企业环境中的工具使用
- 访问约束下的跨角色协作
- 基于本地政策文档的审批推理
- 基于轨迹的智能体工作流评估
- 端到端运营成功的基准测试(不仅限于最终文本质量)





