Cowork Bench
收藏资源简介:
Cowork Bench是一个多工具LLM代理基准测试:包含496个端到端任务,模拟真实办公工作流程——从模拟数据库提取数据、构建Excel/Word/PPTX文档、安排日历事件、发送电子邮件——通过MCP(模型上下文协议)服务器执行(每个任务约120个工具可见)。评估完全确定性(程序化检查+SQL副作用验证,无LLM作为评判),完全在本地运行:一个Docker Compose、一个预置的PostgreSQL,评估时零外部API调用。所有任务陈述和系统提示均为俄语(标识符保持拉丁字母以进行精确匹配),涉及俄罗斯特定领域(铁路、莫斯科交易所、1C HR、电子商务)。
Cowork Bench is a multi-tool LLM agent benchmark comprising 496 end-to-end tasks that simulate real-world office workflows, including extracting data from simulated databases, creating Excel/Word/PPTX documents, scheduling calendar events, and sending emails. All tasks are executed via Model Context Protocol (MCP) servers, with approximately 120 tools visible per task. The evaluation is fully deterministic, relying on programmatic checks and SQL side effect verification without using an LLM as the judge, and runs entirely locally: it only requires a Docker Compose setup and one pre-provisioned PostgreSQL instance, with zero external API calls during the evaluation process. All task descriptions and system prompts are in Russian, while identifiers remain in Latin letters to enable precise matching. The benchmark covers Russia-specific domains including railways, Moscow Exchange, 1C HR, and e-commerce.
数据集概述:Cowork Bench
Cowork Bench 是一个面向多工具 LLM 代理的基准测试集,旨在评估代理在真实办公场景中执行复杂、跨系统任务的能力。
- 核心规模:包含 496 个端到端任务,覆盖多种办公流程,如从数据库提取数据、创建 Excel/Word/PPTX 文件、安排日历事件和发送电子邮件。
- 技术架构:任务通过 MCP (Model Context Protocol) 服务器 执行,每个任务可见约 120 个工具。
- 评估方式:采用 完全确定性评估,包含程序化检查与 SQL 副作用验证,不依赖 LLM 作为评判。
- 运行环境:完全本地化运行,基于 Docker Compose 和预先播种数据的 PostgreSQL 数据库。评估过程中无需调用任何外部 API。
- 语言与领域:所有任务描述和系统提示使用 俄语,标识符保留拉丁字母以确保精确匹配。涉及俄罗斯特定领域,如铁路、莫斯科交易所 (MosBirzha)、1C 人力资源软件和电子商务。
- 基础项目:构建于 Toolathlon 项目之上。
数据集结构
- 任务存储:所有任务位于
tasks/finalpool/目录下。每个任务目录包含以下标准结构:task_config.json: 定义代理可用的 MCP 服务器和本地工具。docs/task.md: 任务描述,隐去了工具品牌名,促使代理进行推理。docs/agent_system_prompt.md: 系统提示。evaluation/main.py: 自动评估器。preprocess/main.py: 准备数据库的初始状态。initial_workspace/: 代理工作空间的输入文件。groundtruth_workspace/: 用于验证的预期输出。
- 运作流程:
preprocess/main.py初始化工作空间,代理使用工具执行任务,然后evaluation/main.py将结果与groundtruth_workspace/中的标准答案进行比对。
数据源与模拟数据
使用本地 PostgreSQL 数据库,数据来自压缩的数据库转储 (db/init.sql.gz) 和后期初始化迁移。所有数据均被模拟或来源于公开数据集。
| 领域 | 描述 | 数据库模式 |
|---|---|---|
| canvas | 学习管理系统 (LMS): 课程、用户、作业、提交、测验、公告 | canvas |
| moex | 金融交易所: 股票报价、财务报告、新闻、期权 | moex |
| woocommerce/insales | 电子商务: 商品、订单、客户、优惠券、评论 | wc |
| rzd | 铁路: 车站、列车、路线、座位 | rzd |
| teamly | 知识库 (俄罗斯版 Confluence) | teamly |
| forms | 调查和表单 | gform |
| hr1c | 企业人力资源 | hr1c_data |
| youtube | 视频平台: 频道、播放列表、视频、字幕 | youtube |
基准测试结果
所有 496 个任务均使用 pass@1 指标进行评估。
| 模型 | 窗口大小 | PASS@1 | 方法 |
|---|---|---|---|
| MiniMax-M3 (428B-A23B, FP8) | 400k | 323 / 496 — 65.1% | parallel |
| Qwen 3.5 397B-A17B (BF16, MoE) | 262k | 312 / 496 — 62.9% | solo |
| Qwen 3.6 27B (Dense, FP8) | 262k | 309 / 496 — 62.3% | solo |
| Qwen 3.6 35B-A3B (FP8, MoE) | 262k | 300 / 496 — 60.5% | solo |
| GigaCode Agentic v1.6 * | 262k | 120 / 421 — 28.5% | parallel, ex-stall |
| GigaChat-3.5 *** | 130k | 119 / 496 — 24.0% | solo |
| GigaChat-3-Max ** | 130k | 41 / 375 — 10.9% | parallel, ex-stall |
| GigaChat-3-Pro *** | 130k | 24 / 496 — 4.8% | solo |
注:部分结果标记了因基础设施问题(如流中断)而排除的任务数。
关键特点
- 规模与多样性:涵盖数百个任务、数十个 MCP 服务器和多个数据领域,需要跨系统协调。
- 本地化与可复现性:整个环境通过一个 Docker Compose 文件启动,无需外部 API 密钥,数据库转储具有版本控制,确保可复现。
- 现实复杂性:任务模拟真实的办公工作流,如 HR 分析、LMS 截止日期同步和生成数据驱动的演示文稿,通常需要 4-7 个工具调用。





