OS-Marathon
收藏资源简介:
OS-Marathon是由微软、牛津大学等机构联合构建的基准测试数据集,专注于评估计算机使用代理(CUA)在长周期重复性任务中的性能。该数据集包含242项任务,覆盖费用报告和成绩单处理两大领域,数据来源融合了真实收据、OCR数据集及合成生成的高保真文档,通过模块化模板和LLM生成技术确保数据多样性和逻辑一致性。其核心目标是解决现有代理在长流程任务中逻辑连贯性、幻觉规避及子任务一致性维护等关键挑战,为自动化办公场景提供标准化评估框架。
OS-Marathon is a benchmark dataset jointly constructed by Microsoft, University of Oxford and other institutions, focusing on evaluating the performance of Computer Use Agents (CUA) in long-cycle repetitive tasks. This dataset includes 242 tasks covering two major fields: expense report processing and transcript handling. Its data sources integrate real receipts, OCR datasets and synthetic high-fidelity documents, with data diversity and logical consistency ensured via modular templates and Large Language Model (LLM) generation technologies. Its core objective is to address key challenges faced by existing agents in long-process tasks, such as logical coherence, hallucination avoidance and subtask consistency maintenance, providing a standardized evaluation framework for automated office scenarios.
OS-Marathon 数据集概述
数据集基本信息
- 数据集名称:OS-Marathon
- 核心目标:评估计算机使用代理在长视野、重复性任务上的性能。
- 发布日期:2026年1月29日(论文发布于arXiv),网站于2026年1月28日发布。
- 作者与机构:
- Jing Wu (University of Oxford)
- Daphne Barretto (Microsoft)
- Yiye Chen (Georgia Institute of Technology)
- Nicholas Gydé (Microsoft)
- Yanan Jian (Microsoft)
- Yuhang He (Microsoft)
- Vibhav Vineet (Microsoft)
- *标注为在微软实习期间完成的工作,‡标注为在微软雇佣期间完成的工作。
- 资源链接:
- arXiv: 可用
- 代码: 可用
- 任务数据: 在HuggingFace上可用
- BibTeX: 可用
- 当前状态:代码和数据正在内部审核中,即将发布。
数据集任务与范围
- 任务类型:长视野、重复性工作流。
- 应用场景:处理专业场景中的重复性任务,例如根据收据处理费用报告、根据试卷录入学生成绩。
- 核心挑战:针对此类任务,计算机使用代理面临三个关键挑战:
- 逻辑不连贯:代理无法理解子工作流的底层逻辑,经常以错误的顺序执行任务。
- 幻觉:代理在尝试填充系统字段时经常产生幻觉。
- 长视野不一致性:代理无法规划完成整个工作流所需的完整迭代轨迹。
基准测试构成
- 领域数量:2个(用于日常长视野重复性任务)。
- 任务总数:242个长视野重复性任务。
- 难度等级:7个。
- 完全功能执行环境:7个。
详细统计
| 领域 | 等级 | 难度等级标准 | #执行环境 | #任务 | 任务可扩展? | #收据 | 包含多页文档? |
|---|---|---|---|---|---|---|---|
| 费用报告 | L1 | 5 | 5 | 30 | 是 | ||
| L2 | 5 | 30 | |||||
| L3 | ~15 | 50 | |||||
| L4 | ~30 | 50 | |||||
| 成绩单记录 | L1 | 1 | 1 | 2 | 18 | 是 | |
| L2 | 2 | 1 | 30 | ||||
| L3 | / | >1 | 34 |
方法
- 提出方法:少样本浓缩工作流演示(Few-shot Condensed Workflow Demonstration, F CWD)。
- 方法描述:通过从少量样本数据中抽象出工作流的关键步骤来构建浓缩的人类演示,以指导计算机使用代理的推理。
实验结果
定性结果
展示了多种基线计算机使用代理在基准测试上的表现,并指出了存在的问题(如逻辑不连贯、幻觉、长视野不一致性)。
定量结果
在费用报告和成绩单领域的第1级和第2级任务上,评估了代理和人类的子工作流准确性和成功率。
- 费用报告领域:在网站和电子表格环境中,比较了人类操作员、基线代理和所提出代理的性能。
- 成绩单领域:比较了人类操作员、基线代理和所提出代理在子工作流准确性和成功率上的表现。
数据
- 数据生成:通过合成数据生成流程创建可视化数据样本。
- 数据样本类型:包括汽车租赁电子邮件收据、食品收据、航班收据、成绩单等多种类型的合成收据和文档。
引用格式
bibtex @article{wu2026OS-Marathon, title={OS-Marathon: Benchmarking Computer-Use Agents on Long-Horizon Repetitive Tasks}, author={Wu, Jing and Barretto, Daphne and Chen, Yiye and Gydé, Nicholas and Jian, Yanan and He, Yuhang and Vineet, Vibhav}, journal={arXiv}, year={2026} }




