遇见数据集

OmegaUse-OfficeVal

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

OmegaUse-OfficeVal是一个基准数据集,用于评估大语言模型智能体在真实办公套件长时程任务上的表现。其核心特点是经济基础性,每个任务都标注了人力劳动时间和任务价格代理,以衡量任务完成度并分析人力成本和经济价值。数据集包含100个从真实办公场景收集的任务,涵盖文字处理文档、电子表格、演示文稿及跨文件工作流,任务来源包括从业者真实需求和自由职业平台。每个任务提供高层级用户指令和输入工件,要求智能体生成最终交付物(如Word文档、电子表格或演示文稿),评估聚焦于最终交付物的质量和正确性。数据规模约216个输入文件(平均每个任务约2.2个)和110个最终输出文件,输入为多模态,包括文本指令、Office文档、图像和视频,任务指令和材料主要为中文,元数据和文档为英文。任务按输出格式分为五类:Word(37个)、PowerPoint(39个)、Excel(19个)、PDF(4个)和跨文件(Word + Excel,1个)。评估采用基于代码的确定性验证器进行两阶段评分,包括可用性维度和任务完成维度。数据构建经过多阶段任务适应流程,确保隐私保护、可执行性和真实性。

OmegaUse-OfficeVal is a benchmark dataset for evaluating the performance of Large Language Model (LLM) AI Agents on long-duration real-world office suite tasks. The core characteristic of this dataset lies in its economic grounding: each task is annotated with two complementary signals, namely man-hour labor time and task price proxy, enabling the evaluation to not only measure task completion but also analyze the associated labor costs and economic value of the task. The dataset contains 100 tasks collected from real office scenarios, covering word processing documents, spreadsheets, presentations, and cross-file workflows. These tasks originate from real office requirements proposed by practitioners and freelance platforms, ensuring the benchmark is grounded in realistic economic demands. Each task provides high-level user instructions and input artifacts, requiring the AI Agent to generate final deliverables (such as Word documents, spreadsheets, or presentations). The evaluation focuses on the quality and correctness of the final deliverables, rather than the specific execution trajectories. In terms of data scale, the dataset contains approximately 216 input files (averaging about 2.2 per task) and 110 final output files. The inputs are multimodal, including text instructions, Office documents, images, and videos, as many critical details in real-world office requests are explicitly conveyed through embedded media rather than plain text. Task instructions and materials are primarily in Chinese, while metadata and supporting documents are in English. Tasks are categorized into five types based on the required output format: Word (37), PowerPoint (39), Excel (19), PDF (4), and cross-file (Word + Excel, 1). The distribution of input files and golden standard artifacts covers various formats such as video/audio, images, DOCX, PPTX, XLSX, and PDF. The evaluation uses a code-based deterministic validator to perform two-stage scoring on final output files: first, conduct availability checks (including file format, openability, content integrity, etc.), then carry out fine-grained, user-centric scoring based on task completion dimensions (covering content, format, structure, numerical accuracy, layout, instruction adherence, etc.). The dataset contains a total of approximately 381 availability check items and 2,236 task completion scoring items. The dataset construction follows a multi-stage task adaptation workflow, including task collection, funnel screening, privacy-preserving adaptation, input reconstruction and de-identification, scoring criterion generation and code-based validator creation, and final acceptance review. This ensures that the tasks have no privacy risks, can be executed normally, and conform to the language, structure, and artifact formats of real office scenarios.

创建时间:
2026-07-23
原始信息汇总

OmegaUse-OfficeVal 数据集概述

基本信息

  • 数据集名称: OmegaUse-OfficeVal
  • 许可证: Apache-2.0
  • 语言: 中文和英文
  • 规模: 100 个样本(少于 1K)
  • 领域: Office 套件生产力任务(Word、PowerPoint、Excel、PDF 及跨文件工作流)
  • 任务类别: 其他(办公代理、LLM 代理、计算机使用、经济接地、文档处理、电子表格、演示文稿)

数据集内容

该基准测试用于评估 LLM 代理在长周期、真实世界办公套件任务上的表现,涵盖文字处理文档、电子表格、演示文稿及跨文件生产力工作流。任务来源于从业者提出的真实办公需求和自由职业平台,具有真实经济需求基础。每个任务提供高层次的用户指令和输入工件,要求代理生成最终交付物(如 Word 文档、电子表格或演示文稿)。评估聚焦于最终交付物的质量和正确性,而非具体执行轨迹。

核心特性

  • 经济接地: 每个任务标注了人类劳动时间和任务价格代理两个补充信号,可从任务完成度、人类努力和经济价值三方面分析代理性能。
  • 数据规模: 100 个长周期任务,220 个输入文件(平均每个任务 2.2 个文件),115 个金色工件。
  • 模态: 文本指令、Office 文档、PDF、图像、音频和视频。
  • 评估方式: 基于最终交付工件的确定性、基于代码的验证器。
  • 双语: 中文和英文的任务定义与评估标准。

数据分布

根据所需输出格式,任务分为五类:

输出类型 任务数 占比
Word 37 37%
PowerPoint 39 39%
Excel 19 19%
PDF 4 4%
跨文件(Word + Excel) 1 1%
总计 100 100%

输入文件和金色工件分布:

文件类型 输入文件数 金色工件数
视频/音频 10 0
图像 77 0
DOCX 63 48
PPTX 31 40
XLSX 25 24
PDF 14 3
总计 220 115

任务组成

每个任务包含五个组成部分:

  1. 指令: 用户请求的文本描述及具体要求。
  2. 输入文件: 完成任务所需的文件集合(托管在数据集中)。
  3. 人类劳动时间: 人类工人在无 LLM 辅助下完成任务的记录时间(以分钟为单位)。
  4. 任务价格代理: 任务级别的价格信号,估算完成该任务的市场价格(以人民币元为单位)。
  5. 代码验证器: 由指令和评估标准派生出的可执行评估代码,为候选工件分配分数。

经济接地机制

  • 人类劳动时间: 每个任务由至少两名招募的标注者在质量把控协议下完成;当两次有效完成时间差异较大时,增加第三名标注者。报告的人类劳动时间为最短两次有效完成时间的平均值,以减少异常慢速尝试的影响。
  • 任务价格代理: 采用混合策略。具有明确价格信号的任务直接使用从业者提供的价格(price_source = explicit_price);无明确价格的任务由三名领域专家独立估算,并通过一致性基础程序聚合估计值,剔除明显异常值(price_source = estimated_price)。

评估协议

  • 评估方法: 使用确定性、基于代码的验证器对最终输出文件进行评估,不强制固定执行轨迹。代理可通过 GUI 操作、脚本、API 或混合策略完成任务。
  • 评估维度:
    • 可用性评估(Dim-1): 检查文件格式是否正确、文件可正常打开、内容/布局未被严重损坏、工件保持可编辑性。若任一可用性项目失败,任务得分为零,不再评估完成度。
    • 任务完成度评估(Dim-2): 细粒度、以用户为中心的评分点,涵盖内容、格式、结构、数值准确性、布局和指令遵循。正向项目奖励正确完成的要求(权重 +1/+3/+5);负向项目惩罚非预期更改或可避免的损坏(对称惩罚 -1/-3/-5)。
  • 评分计算: 工件必须首先通过所有可用性项目;然后基于加权正负评估项目计算归一化任务完成度分数,原始分数下限截断为零。

评估标准统计:

评估维度 总项目数 平均每任务
可用性检查(Dim-1) 219 2.19
任务完成度项目(Dim-2) 2009 20.09

数据构建与隐私

数据集通过多阶段任务适配流程构建:

  1. 任务收集: 从业者提出基于日常工作流程的真实办公套件任务及代表性样例材料。
  2. 漏斗筛选: 初始任务池逐步筛选,仅保留基于真实需求、交付物明确且具有足够非平凡性和长周期性的任务。
  3. 隐私保护适配: 重写指令以移除敏感或可识别信息,同时保留原始用户意图、约束和任务关键细节。移除主观、不可验证的要求,保留自然口语化表达。
  4. 输入重建与去标识化: 输入文件在 LLM 辅助下重建并人工修订,消除隐私/版权风险,修复布局和一致性问题,保持工件与预期任务一致。
  5. 评估标准生成与代码验证器: 评估标准在 LLM 辅助下生成并由专家迭代精炼,转换为可执行代码验证器,解决人类与代码判断差异。
  6. 最终验收审查: 三名高级专家确认每个任务无隐私风险、可正常执行、符合真实办公场景的语言、结构和工件格式;仅当三位专家一致同意时任务才被纳入。

筛选阶段统计:

漏斗阶段 保留任务数
初始池 1,715
筛选阶段 1 595
筛选阶段 2 282
最终基准 100

预期用途与限制

OmegaUse-OfficeVal 旨在作为可复现、经济接地的大规模测试平台,用于衡量 LLM 代理在日常办公生产力方面取得可靠进展的程度。它用于衡量 LLM 代理能否替代整个职业;而是评估工人在有能力代理协助下的实际工作场景。由于负面失败模式无法穷举,分数下限为零,应将其解读为交付物质量的相对度量。

引用

bibtex @inproceedings{omegause_officeval_2026, title = {OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding}, booktitle = {tech report}, year = {July, 2026} }

搜集汇总
数据集介绍
OmegaUse-OfficeVal 数据集图片
构建方式
OmegaUse-OfficeVal的构建历经多阶段任务适配流水线。首先,由从业者提出源于日常工作的真实办公任务并附上样例材料;随后,经过漏斗式筛选,从1715个初始任务中逐步剔除不够真实、可交付或过于简单的任务,最终保留100个。在隐私保护阶段,指令被重写以去除敏感信息但保留用户意图与约束,同时移除主观性要求。输入文件借助大语言模型辅助重构并人工修订,以消除隐私与版权风险。评估准则由专家迭代精炼,转化为可执行的代码验证器,并通过人与代码的一致性校验确保自动化评判与专家判断对齐。最终,经三位资深专家一致确认每项任务无隐私风险、可正常执行且符合真实办公场景,方被纳入基准测试集。
特点
该数据集的核心特色在于其经济锚定性,即每项任务均附带两个互补信号:人工完成时间与任务价格代理,从而允许从人力投入与经济价值双重维度分析智能体性能。任务覆盖文字处理、电子表格、演示文稿、PDF及跨文件工作流等多样化办公产出,且不限定执行轨迹,智能体可通过图形界面操作、脚本、API或混合策略完成任务,贴近真实办公中多路径达成同一交付件的场景。评估采用确定性的代码验证器,先检验可用性维度(文件格式、可编辑性等),再对任务完成度进行精细打分,并引入对称惩罚项以惩罚对用户下游修复成本的增加。
使用方法
用户可通过Hugging Face的datasets库直接加载该数据集,调用load_dataset("baidu-frontier-research/OmegaUse-OfficeVal")即可获取100条训练样本。每条记录包含任务标识符、英文指令、操作意图、领域、人工时长、价格代理及来源、输入文件的URL序列化信息以及评估准则的序列化内容。输入文件可通过仓库中的URL模式下载使用。此外,数据集在中英文双语版本中同时提供任务定义与评估准则,并附有Data Studio视图以便浏览与过滤。用户也可参照配套GitHub仓库中的评估框架,自行运行代码验证器对智能体生成的交付件进行标准化评分,以衡量其在长周期办公任务中的实际表现。
背景与挑战
背景概述
大型语言模型(LLM)代理在长周期、多步骤的办公自动化任务中展现出巨大潜力,然而现有基准测试多聚焦于单一操作或简化场景,缺乏对真实办公流程中复杂性与经济价值的考量。在此背景下,百度前沿研究院于2026年发布了OmegaUse-OfficeVal基准,旨在系统性地评估LLM代理在Word、Excel、PowerPoint等办公套件中的长期任务执行能力。该数据集包含100个源自实际从业者需求和自由职业平台的高质量任务,并创新性地引入了“人类劳动时间”与“任务价格代理”双重经济信号,从而将代理性能与人类劳动的经济价值直接关联。该基准通过确定性代码验证器对最终交付物进行评分,而非追踪执行路径,为评估代理在办公场景中的实用性与可靠性提供了标准化平台。
当前挑战
OmegaUse-OfficeVal面临的挑战首先来自领域问题的复杂性:办公套件任务涉及多格式文档的交叉操作、跨文件工作流以及长期依赖的规划,要求代理具备精确的格式控制、内容生成与数值推理能力,而现有模型在端到端完成此类高保真交付物时仍面临巨大困难。其次,数据构建过程中挑战重重:需要从1715个候选任务中筛选出100个兼具真实性与非琐碎性的案例,期间须应对隐私脱敏、版权规避、输入文件重建与一致性校正等多重障碍;同时,评分准则需平衡可用性检查与完成度评估,共包含2009个细粒度评分点,如何通过人工与代码协同确保评估的客观性与准确性,亦是构建阶段的核心难题。
常用场景
经典使用场景
OmegaUse-OfficeVal的经典使用场景在于衡量大语言模型(LLM)代理在长时间跨度、多步骤办公套件任务中的综合能力。该基准覆盖了文字处理、电子表格、演示文稿以及跨文件工作流等典型办公场景,要求代理根据高层用户指令与输入素材,直接生成符合交付要求的最终产出物。它不限定代理完成任务的路径——无论是通过图形界面操作、脚本调用、API集成还是混合策略,均可被接受。正因如此,这一基准能真实还原现实办公中灵活多变的工作方式,为评估代理在复杂指令理解、多模态输入处理和精细化成果产出上的能力提供了标准化的测试平台。
解决学术问题
该数据集在学术研究中主要解决了两个关键问题:一是缺乏具有经济意义的办公任务评估基准,二是传统评估方式过于关注代理执行过程的正确性而忽略最终交付成果的质量。OmegaUse-OfficeVal引入了经济锚定机制,为每个任务标注了人类劳动时间和任务价格代理信号,使研究者能够从劳动成本与经济价值的角度解读代理性能,而非仅关注任务是否完成。此外,其基于代码的确定性评估体系专注于对交付物进行正反两方面的细粒度评分,区分了可用性检查与任务完成度,避免了代理通过“花哨但无用”的路径获得高分的漏洞,推动了代理评估从过程导向到成果导向的范式转变。
衍生相关工作
OmegaUse-OfficeVal的提出推动了一系列与之相关的衍生研究工作。在其基础上,研究者可以探索将经济信号引入代理训练过程的方法,例如利用任务价格代理作为强化学习的奖励信号,训练代理优先选择高价值任务完成策略。此外,该基准的多模态输入特性催生了关于多模态大模型在办公场景中的适配性研究,例如如何结合视觉语言模型与结构化数据分析能力以提升跨文档信息提取的准确性。还促使社区开发出基于该基准的公开排行榜,推动不同团队在同一测试平台上的公平比较,并启发了将类似评估范式拓展至其他专业领域(如医疗报告撰写、法律文书生成等)的构想,形成了以交付物质量为核心、经济价值为辅助的代理评估方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务