遇见数据集

OfficeComprehensionBenchmark

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

OfficeComprehensionBenchmark (OCB) 是一个用于评估对Microsoft Office文件(Word、Excel、PowerPoint)的文档理解和基于文档的推理能力的基准测试数据集。它包含两个主要轨道:1) 文件保真度问答(File Fidelity Q&A),用于衡量对文档结构元素(如文本、表格、图表、公式、格式、嵌入对象)的感知能力;2) 领域问答(Domain Q&A),用于衡量对12个不同行业真实商业文档的专家级推理能力。数据规模方面,文件保真度轨道包含244个文件和922个查询,领域问答轨道包含124个文件和120个查询,共计8,450个原子断言。数据集采用混合分发模型:部分参考文件(其源许可允许在CDLA-Permissive-2.0下重新分发)直接托管在Hugging Face上,同时包含所有问题、参考答案和断言评分标准;另一部分参考文件(其源许可不允许重新分发)通过URL清单引用,用户需通过配套工具从原始公开来源获取。由于许可兼容性问题,三个源自Kaggle的Excel文件未包含在公开版本中。该数据集仅用于评估目的(如基准测试、模型比较、消融研究),不适用于训练。主要许可协议为CDLA-Permissive-2.0,不同来源的子组件可能遵循其他许可(如美国政府作品/公共领域、CC0 1.0、MIT等)。

OfficeComprehensionBenchmark (OCB) is a benchmark for evaluating document understanding and document-based reasoning capabilities for Microsoft Office files (Word, Excel, PowerPoint). It includes two main tracks: 1) File Fidelity Q&A, which measures perception of document structural elements (text, tables, charts, formulas, formatting, embedded objects); 2) Domain Q&A, which measures expert-level reasoning on real-world business documents from 12 different industries. In terms of data scale, the File Fidelity track contains 244 files and 922 queries, while the Domain Q&A track contains 124 files and 120 queries, totaling 8,450 atomic assertions. The dataset uses a hybrid distribution model: some reference files (whose source licenses permit redistribution under CDLA-Permissive-2.0) are hosted directly on Hugging Face, along with all questions, reference answers, and assertion scoring criteria; other reference files (whose source licenses do not permit redistribution) are referenced via URL manifests, requiring users to fetch them from original public sources using accompanying tools. Due to license compatibility issues, three Excel files sourced from Kaggle are not included in the public version. The dataset is intended only for evaluation purposes (e.g., benchmarking, model comparison, ablation studies) and not for training. The primary license is CDLA-Permissive-2.0, with subcomponents from different sources potentially following other licenses (e.g., U.S. Government Works/Public Domain, CC0 1.0, MIT, etc.).

提供机构:
Microsoft
创建时间:
2026-06-04
原始信息汇总

OfficeComprehensionBenchmark (OCB) 数据集概述

  • 数据集名称: OfficeComprehensionBenchmark (OCB)
  • 发布机构: Microsoft
  • 许可证: CDLA-Permissive-2.0(社区数据许可协议 - 许可版 2.0)
  • 语言: 英语
  • 数据集大小: 1,000 < 样本数 < 10,000
  • 数据集类型: 基准测试
  • 标签: 基准测试、文档理解、Office文档、问答、大语言模型评估

数据集规模:

  • 文件保真度问答轨道: 244 个文件,922 个查询
  • 领域问答轨道: 124 个文件,120 个查询,8,450 个原子断言,覆盖 12 个行业

数据集构成

该数据集包含两个主要配置:

  • ocb_qna_data:包含问答数据(训练集),文件格式为 Parquet。
  • ocb_source_urls:包含源文件 URL 清单(训练集),文件格式为 Parquet。

数据集内容与结构

OCB 是一个用于评估对 Microsoft Office 文件(Word、Excel、PowerPoint)进行文档理解和基于事实推理能力的基准测试,包含两个评估轨道:

  1. 文件保真度问答轨道:衡量对文档构件(文本、表格、图表、公式、格式、嵌入对象)的结构和视觉感知能力。
  2. 领域问答轨道:衡量对 12 个行业真实商业文档的专业级推理能力。

数据分布模式

采用混合分发模式:

  • 直接托管于 Hugging Face:许可证允许在 CDLA-Permissive-2.0 下重新分发的参考文件,以及所有问题、参考答案和断言评分规则。
  • 通过 URL 清单引用:许可证不允许重新分发的参考文件,清单随数据集提供,用户需通过配套 GitHub 仓库从原始公共来源下载并转换(如从 PDF 转换为 .docx, .xlsx, .pptx 等 Office 原生格式)。

许可信息

  • OCB 原创内容(问题、参考答案、原子断言、专家撰写的参考文件):CDLA-Permissive-2.0。
  • 来自美国政府开放数据门户的托管参考文件:美国政府作品/公共领域,或允许重新分发的开放数据条款。
  • 来自 Kaggle 的托管参考文件:仅重新分发 CC0 1.0 或 MIT 许可的文件,属性与通知义务保留在 NOTICES.md 文件中。
  • URL 引用的文件:保留其原始许可证,OCB 不对这些文件主张许可。

预期用途

  • 已验证的用例:评估模型在结构化与半结构化 Office 文件上的基于事实的问答准确性;比较模型在跨格式推理(如 Word + Excel 输入)上的表现;评估文档结构与视觉感知的保真度;进行基于检索与基于 Office 文档的管道消融研究。
  • 不推荐用途:用作训练数据;对 .docx / .xlsx / .pptx 及其变体以外的文件格式进行评估;仅基于 OCB 得分在监管领域(医疗、法律、金融建议)做出高风险部署决策。

补充信息

  • 配套代码仓库:GitHub 上的 microsoft/OfficeComprehensionBench 仓库提供评估提示、裁判脚本、文件下载工具和 PDF 转 Office 格式脚本。
  • 2023年5月7日更新:由于许可不兼容,三个原本包含于评估集的 Excel 文件及其关联的文件保真度查询已从本次公开发布中移除。用户如需复现完整评估,可从 Kaggle 直接获取这些源数据。

维护与引用

  • 维护方:Microsoft
  • 维护承诺:发布后至少维护 3 年。问题、修正及勘误请求通过数据集仓库的讨论页面跟踪。
  • 引用格式:参见 citation 部分。
搜集汇总
数据集介绍
OfficeComprehensionBenchmark 数据集图片
构建方式
OfficeComprehensionBenchmark(OCB)旨在评估大语言模型对微软Office文件(Word、Excel、PowerPoint)的文档理解与基于证据的推理能力。该基准采用混合分发模型:一部分参考文件因遵循CDLA-Permissive-2.0许可协议而直接托管于HuggingFace平台;其余文件因原始许可限制无法直接分发,其URL清单随数据集发布,用户需借助GitHub仓库中的脚本从原始公共来源下载并转换为原生Office格式。所有问题、参考答案及原子断言评分标准均由专家构建,共计覆盖244份文件、1042项查询。
特点
OCB设计了双轨评估体系:文件保真度问答聚焦于文档结构、视觉元素(文本、表格、图表、公式、格式、嵌入对象)的精确感知;领域问答则横跨12个行业的真实商业文档,包含8450条原子断言用于细粒度推理能力评测。该基准通过混合分发策略平衡了开放性与版权合规性,托管文件来自美国政府开放数据门户及Kaggle的CC0/MIT许可数据集,外部引用文件保留原始许可。
使用方法
OCB专用于评估场景而非训练场景,支持模型在结构化与非结构化Office文件上的问答精度对比、跨格式推理分析以及检索与接地组件的消融实验。用户需先克隆GitHub仓库以获取评测提示、判分脚本及文件下载工具,随后加载HuggingFace数据集中的问题与答案进行推理,并通过原子断言判分器自动评估模型输出。若因许可原因缺失三个Excel文件,用户可自行从Kaggle获取以复现完整评测结果。
背景与挑战
背景概述
OfficeComprehensionBenchmark(OCB)是由微软研究院主导,于2026年发布的专门评估大语言模型对Microsoft Office文件(Word、Excel、PowerPoint)理解与推理能力的基准数据集。该数据集由File Fidelity Q&A与Domain Q&A双轨构成,前者聚焦文档结构、排版、表格、图表等视觉元素的精准感知,后者涵盖12个行业真实商业文档的专家级推理。OCB的问世填补了现有NLP基准在办公文档多模态、多格式、细粒度理解上的空白,因其设计精良与高难度,迅速成为评估当代LLM文档理解能力的重要标尺。
当前挑战
OCB旨在解决的核心挑战在于:现有基准多聚焦于纯文本或简单含图文档,无法评估模型对Office文件特有的嵌套表格、公式、嵌入对象及复杂版式等结构性元素的忠实理解,更缺乏跨文档、跨行业的专业推理能力。构建过程中,团队面临许可兼容性难题——部分源自Kaggle的原始数据采用CC BY-NC-SA 4.0协议,与CDLA-Permissive-2.0不兼容,导致3个Excel评估文件及其对应查询被迫移出公开版本;同时,需手动将PDF源文件转换为原生.docx、.xlsx、.pptx格式,并精心设计8,450条原子断言以支撑细粒度的自动评估,均对数据集的质量与可复现性提出了极高要求。
常用场景
经典使用场景
在文档智能与办公自动化研究领域,OfficeComprehensionBenchmark(OCB)数据集被精心设计为评估大语言模型在结构化与非结构化Microsoft Office文件(Word、Excel、PowerPoint)上进行 grounded reasoning 的权威标杆。其经典使用场景涵盖两大核心方向:文件保真问答(File Fidelity Q&A)用于度量模型对文档内部元素(如文本、表格、图表、公式、嵌入对象)的视觉与结构感知能力;而领域问答(Domain Q&A)则聚焦于跨12个行业的真实商业文档,考验模型的专业推理水平。这种双轨架构为研究者提供了一个统一、可复现的评估框架,能够系统性地揭示模型在处理办公文档时的理解深度与可靠性,成为该领域不可或缺的评测基准。
实际应用
在实际产业环境中,OCB数据集的应用价值尤为凸显,尤其是在需要深度理解与处理办公文档的自动化场景。例如,企业知识管理系统可利用OCB作为标杆来筛选和优化文档问答引擎,确保其能准确提取合同中的条款、财报中的关键指标或演示文稿中的图表数据。金融分析师借助该数据集的评测任务可以评估AI助手在研报阅读与数据校验中的表现,而法律科技领域则能检验模型对格式化文书(如庭审笔录、尽职调查文件)的解析能力。此外,办公软件套件的智能辅助功能,如自动摘要、表格修正和演示建议,其核心算法也依赖OCB进行效果验证与迭代改进,从而推动更高效、更智能的人机协作体验。
衍生相关工作
OCB数据集的发布极大地激发了文档理解与办公自动化领域的衍生研究。基于其文件保真问答任务,涌现出一系列关于文档视觉结构理解的新方法,如结合OCR与版面分析的多模态模型微调策略,以及针对复杂表格和嵌入式图表的混合检索-推理流水线。领域问答轨道则促进了跨行业文档推理模型的开发,研究者利用其原子化断言体系构建了更精细的误差分析工具,推动了大语言模型在特定垂直领域(如医疗、法律)的适应性与可解释性提升。OCB还催生了多项关于数据混合分布策略的讨论,特别是在处理许可受限的公共数据集时如何平衡复现科学性与法律合规性,为后续类似标杆的建设提供了宝贵的实践经验与范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务