遇见数据集

Cowork Bench

收藏
github2026-07-12 更新2026-07-14 收录
官方服务:

资源简介:

Cowork Bench是一个多工具LLM代理基准测试:包含496个端到端任务,模拟真实办公工作流程——从模拟数据库提取数据、构建Excel/Word/PPTX文档、安排日历事件、发送电子邮件——通过MCP(模型上下文协议)服务器执行(每个任务约120个工具可见)。评估完全确定性(程序化检查+SQL副作用验证,无LLM作为评判),完全在本地运行:一个Docker Compose、一个预置的PostgreSQL,评估时零外部API调用。所有任务陈述和系统提示均为俄语(标识符保持拉丁字母以进行精确匹配),涉及俄罗斯特定领域(铁路、莫斯科交易所、1C HR、电子商务)。

Cowork Bench is a multi-tool LLM agent benchmark comprising 496 end-to-end tasks that simulate real-world office workflows, including extracting data from simulated databases, creating Excel/Word/PPTX documents, scheduling calendar events, and sending emails. All tasks are executed via Model Context Protocol (MCP) servers, with approximately 120 tools visible per task. The evaluation is fully deterministic, relying on programmatic checks and SQL side effect verification without using an LLM as the judge, and runs entirely locally: it only requires a Docker Compose setup and one pre-provisioned PostgreSQL instance, with zero external API calls during the evaluation process. All task descriptions and system prompts are in Russian, while identifiers remain in Latin letters to enable precise matching. The benchmark covers Russia-specific domains including railways, Moscow Exchange, 1C HR, and e-commerce.

创建时间:
2026-07-12
原始信息汇总

数据集概述:Cowork Bench

Cowork Bench 是一个面向多工具 LLM 代理的基准测试集,旨在评估代理在真实办公场景中执行复杂、跨系统任务的能力。

  • 核心规模:包含 496 个端到端任务,覆盖多种办公流程,如从数据库提取数据、创建 Excel/Word/PPTX 文件、安排日历事件和发送电子邮件。
  • 技术架构:任务通过 MCP (Model Context Protocol) 服务器 执行,每个任务可见约 120 个工具。
  • 评估方式:采用 完全确定性评估,包含程序化检查与 SQL 副作用验证,不依赖 LLM 作为评判。
  • 运行环境:完全本地化运行,基于 Docker Compose 和预先播种数据的 PostgreSQL 数据库。评估过程中无需调用任何外部 API。
  • 语言与领域:所有任务描述和系统提示使用 俄语,标识符保留拉丁字母以确保精确匹配。涉及俄罗斯特定领域,如铁路、莫斯科交易所 (MosBirzha)、1C 人力资源软件和电子商务。
  • 基础项目:构建于 Toolathlon 项目之上。

数据集结构

  • 任务存储:所有任务位于 tasks/finalpool/ 目录下。每个任务目录包含以下标准结构:
    • task_config.json: 定义代理可用的 MCP 服务器和本地工具。
    • docs/task.md: 任务描述,隐去了工具品牌名,促使代理进行推理。
    • docs/agent_system_prompt.md: 系统提示。
    • evaluation/main.py: 自动评估器。
    • preprocess/main.py: 准备数据库的初始状态。
    • initial_workspace/: 代理工作空间的输入文件。
    • groundtruth_workspace/: 用于验证的预期输出。
  • 运作流程preprocess/main.py 初始化工作空间,代理使用工具执行任务,然后 evaluation/main.py 将结果与 groundtruth_workspace/ 中的标准答案进行比对。

数据源与模拟数据

使用本地 PostgreSQL 数据库,数据来自压缩的数据库转储 (db/init.sql.gz) 和后期初始化迁移。所有数据均被模拟或来源于公开数据集。

领域 描述 数据库模式
canvas 学习管理系统 (LMS): 课程、用户、作业、提交、测验、公告 canvas
moex 金融交易所: 股票报价、财务报告、新闻、期权 moex
woocommerce/insales 电子商务: 商品、订单、客户、优惠券、评论 wc
rzd 铁路: 车站、列车、路线、座位 rzd
teamly 知识库 (俄罗斯版 Confluence) teamly
forms 调查和表单 gform
hr1c 企业人力资源 hr1c_data
youtube 视频平台: 频道、播放列表、视频、字幕 youtube

基准测试结果

所有 496 个任务均使用 pass@1 指标进行评估。

模型 窗口大小 PASS@1 方法
MiniMax-M3 (428B-A23B, FP8) 400k 323 / 496 — 65.1% parallel
Qwen 3.5 397B-A17B (BF16, MoE) 262k 312 / 496 — 62.9% solo
Qwen 3.6 27B (Dense, FP8) 262k 309 / 496 — 62.3% solo
Qwen 3.6 35B-A3B (FP8, MoE) 262k 300 / 496 — 60.5% solo
GigaCode Agentic v1.6 * 262k 120 / 421 — 28.5% parallel, ex-stall
GigaChat-3.5 *** 130k 119 / 496 — 24.0% solo
GigaChat-3-Max ** 130k 41 / 375 — 10.9% parallel, ex-stall
GigaChat-3-Pro *** 130k 24 / 496 — 4.8% solo

注:部分结果标记了因基础设施问题(如流中断)而排除的任务数。

关键特点

  1. 规模与多样性:涵盖数百个任务、数十个 MCP 服务器和多个数据领域,需要跨系统协调。
  2. 本地化与可复现性:整个环境通过一个 Docker Compose 文件启动,无需外部 API 密钥,数据库转储具有版本控制,确保可复现。
  3. 现实复杂性:任务模拟真实的办公工作流,如 HR 分析、LMS 截止日期同步和生成数据驱动的演示文稿,通常需要 4-7 个工具调用。
搜集汇总
数据集介绍
Cowork Bench 数据集图片
构建方式
Cowork Bench 是一个面向多工具智能体的基准测试集,其构建源于对现有工具使用数据集覆盖狭窄、依赖变动外部API等局限的深刻洞察。该数据集精心设计了496项端到端任务,这些任务模拟了真实的办公室工作流,例如从模拟数据库提取数据、构建Excel/Word/PPTX文件、安排日历事件及发送电子邮件。所有任务均通过MCP(模型上下文协议)服务器执行,每个任务暴露约120个工具。初始化通过预处理脚本`preprocess/main.py`准备工作空间状态,智能体随后利用固定工具集执行任务,最终由`evaluation/main.py`与标准答案工作空间进行确定性比对,全程无需手动标注或外部服务调用,确保了评估的完全自动化与可重复性。
特点
该数据集的核心特点在于其大规模、多样性与完全本地化的可复现性。它横跨数十个MCP服务器与多个数据域,覆盖LMS、金融、电商、铁路、HR等俄罗斯特有领域,任务要求跨系统协调与多步规划,通常需要4至7个工具调用才能完成。尤为突出的是,整个评估环境仅凭单个Docker Compose文件即可本地启动,使用预播种的PostgreSQL数据库,运行时无需任何外部API调用,从而消除了API限制、模式变更或数据漂移的影响。所有任务描述和系统提示均使用俄语,而标识符保留拉丁语以确保确定性验证,这使得模型必须真正理解工具语义而非依赖关键词识别。
使用方法
使用Cowork Bench需具备Docker与bash环境。用户首先通过复制`.env.example`配置模型提供商与密钥,而后构建Docker镜像。通过`cowork_bench`脚本套件管理完整流程:`up`命令启动Postgres容器及网络,`run`命令执行单任务智能体推理与评估,`bench`命令支持并发运行全部任务。评估结果由系统自动生成,包含详细轨迹日志与`eval_res.json`中的通过/失败判定。研究者可通过设置环境变量或配置文件切换不同运行器(如默认的CAMEL或支持阶段隔离的Strands),并可根据需要添加新的MCP服务器与任务域,扩展性极强。
背景与挑战
背景概述
Cowork Bench 诞生于2024至2025年间,由俄罗斯研究团队基于HKUST-NLP的Toolathlon项目构建,专注于评估大型语言模型驱动的智能体在多工具协作场景中的执行力。该数据集涵盖496项端到端任务,模拟现代办公环境中的典型工作流,如从模拟数据库提取数据、生成Excel/Word/PPTX文档、调度日历事件及发送邮件等,所有操作均通过MCP(模型上下文协议)服务器暴露的约120个工具完成。其核心研究问题在于如何构建一个完全本地化、可复现、且无需依赖外部API的基准测试,以客观衡量智能体在跨系统协调、多步规划与结构化数据处理方面的能力。凭借确定性的评估机制(程序化检查加SQL副作用验证)和丰富的模拟数据(涵盖LMS、电商、金融、HR等俄罗斯特定领域),Cowork Bench为智能体研究提供了高生态效度的测试平台,显著推动了工具使用类基准测试向真实办公场景的演进。
当前挑战
Cowork Bench 面对的核心挑战在于解决真实办公工作流中智能体规划的复杂性,任务需跨越多个异构MCP服务器,例如从HR数据库提取信息、生成Excel报告、在日历中设置事件并发送邮件,每一步均依赖工具间的精确协调与状态同步,极易因步骤缺失或顺序错误导致失败。构建过程中,团队需克服模拟数据库的建设难题,设计覆盖铁路、交易所、HR、电商等俄罗斯特有领域的21个数据表,同时确保所有任务描述与系统提示以俄语呈现而标识符保留拉丁文,以支持确定性验证。此外,数据集需完全运行于Docker容器内,避免外部API调用以消除服务漂移,这要求创建自洽的postgreSQL初始化流程与无品牌命名的工具接口,防止模型依赖关键词猜测。最终,数据集需在496项任务上实现从4.8%到65.1%的模型性能显著差异,凸显智能体在鲁棒规划与长程任务完成上的根本性瓶颈。
常用场景
经典使用场景
在智能体(Agent)与工具使用(Tool-Use)的交汇领域,Cowork Bench 被设计为一项严苛的基准测试,用于评估语言模型在多工具协作场景下的端到端执行能力。其经典用法是向模型提交一个包含跨系统数据流转、文档生成、日历调度与邮件发送等环节的复合办公任务,迫使模型在约120个MCP工具中自主规划并完成长达4至7步的推理链条。该基准完全运行于本地Docker环境,依赖确定性校验而非大模型的自我评判,因而成为检验LLM真实工具调用与任务完成能力的黄金标准。
衍生相关工作
Cowork Bench 脱胎于HKUST-NLP团队的Toolathlon项目,后者首次系统性地提出以真实MCP接口与数据库状态机为基础的智能体评估框架。在此之上,Cowork Bench 重构了池化任务库,将所有系统提示和任务描述本地化为俄语,并替换了多个外部API为俄罗斯本地服务模拟(如RZD铁路、MosBirzha交易所、1C HR系统),形成了一具备文化适应性、语言特定性与领域扩展性的衍生基准。这一工作催生了更广泛的跨语言、跨区域智能体评估趋势,为进一步探索LLM在多语言、多文化办公环境下的泛化能力提供了可靠路径。
数据集最近研究
最新研究方向
在大型语言模型(LLM)智能体的评估领域,Cowork Bench代表了从单一工具或固定API依赖向多工具、全本地化、高保真办公场景模拟的范式转变。该基准聚焦于真实世界工作流中的多步规划与跨系统协调能力,涵盖数据检索、文档生成、日历管理与邮件发送等复杂任务链,并通过496个端到端任务与约120个MCP(模型上下文协议)工具实现严格测试。当前前沿研究热点包括:探索不同规模模型(从27B到428B)在确定性局部环境下的性能差异,例如Qwen系列在单线程条件下达到60%以上通过率,揭示了模型规模并非唯一决定因素;同时,针对俄罗斯特有领域(如铁路系统、企业人力资源与电商平台)的本地化适配,推动了多语言、多文化背景下的智能体泛化研究。Cowork Bench的意义在于其完全可复现的设计——Docker Compose一键部署、零外部API调用与确定性评估——为领域提供了标准化、可扩展的测试平台,促进了MCP协议在实际业务流程中的集成与优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务