Workspace-Bench
收藏资源简介:
Workspace-Bench 1.0是一个用于评估AI代理在具有大规模文件依赖的工作空间任务上的基准测试。它旨在研究一种称为工作空间学习的能力:代理是否能够识别、推理、利用和更新真实工作者工作空间中的显式和隐式文件依赖关系。该基准测试包含5个现实工作者配置文件、74种文件类型、20,476个文件(工作空间大小高达20GB)、388个任务(每个任务配有显式文件依赖图)和7,399个细粒度评估标准。
Workspace-Bench 1.0 is a benchmark for evaluating AI Agents on workspace tasks with large-scale file dependencies. It aims to investigate a capability termed workspace learning: whether an AI Agent can identify, reason about, leverage, and update both explicit and implicit file dependencies in real-world worker workspaces. This benchmark includes 5 real-world worker profiles, 74 file types, 20,476 files (with a maximum workspace size of 20GB), 388 tasks each paired with an explicit file dependency graph, and 7,399 fine-grained evaluation criteria.
数据集概述
Workspace-Bench 1.0 是一个用于评估 AI agent 在具有大规模文件依赖关系的工作空间任务中的基准测试。该基准的核心是评估一种称为 Workspace Learning 的能力:即 agent 能否识别、推理、利用和更新真实工作空间中异构文件之间的显式和隐式依赖关系。
核心特点
- 与现实工作空间高度一致,agent 需自主探索目录、定位相关证据、理解跨文件关系并生成正确交付物。
- 聚焦真实工作场景行为,而非孤立的工具使用或单文件问答。
数据集规模
| 维度 | 数值 |
|---|---|
| 工作角色 | 5 个(运营经理、物流经理、AI产品经理、研究员、后端开发) |
| 文件类型 | 74 种 |
| 文件总数 | 20,476 个 |
| 工作空间最大规模 | 20 GB |
| 任务总数 | 388 个 |
| 细粒度评分标准 | 7,399 条 |
Lite 子集
- Workspace-Bench-Lite: 包含 100 个任务,在保留原基准分布的同时,可将评估成本降低约 70%。
发布状态
- 完整数据集、任务规格、输入文件、标准化输出格式和评估脚本 即将发布。
引用
- 论文链接:https://arxiv.org/abs/2605.03596
- BibTeX 引用格式见前述 README 内容。




