遇见数据集

CORPORATEBENCH

收藏
arXiv2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

CORPORATEBENCH是一个大规模、人工验证的多任务问答基准数据集,由Epiq AI实验室与康奈尔大学联合创建,旨在评估大语言模型在企业通信场景下的推理能力。该数据集包含四个模拟公司,员工规模从12至10,210人,共生成263,466份文档,覆盖丰富的关系三元组。其创建过程基于程序化生成的知识图谱,通过模拟公司层级、工作活动及会议,并借助大语言模型填充邮件内容,确保逻辑一致性与可扩展性。该数据集用于评估模型在长文本、多文档推理上的表现,填补了企业级基准测试的空白,解决真实场景中信息提取与知识库查询的挑战。

CORPORATEBENCH is a large-scale, manually validated multi-task question answering benchmark dataset co-created by Epiq AI Lab and Cornell University, aiming to evaluate the reasoning capabilities of large language models (LLMs) in enterprise communication scenarios. This dataset includes four simulated companies with employee counts ranging from 12 to 10,210, and a total of 263,466 generated documents covering rich relational triples. Its construction is based on programmatically generated knowledge graphs, which simulate corporate hierarchies, work activities and meetings, and leverage large language models to populate email content, ensuring logical consistency and scalability. This dataset is designed to evaluate model performance on long-text and multi-document reasoning tasks, filling the gap in enterprise-level benchmark testing and addressing the challenges of information extraction and knowledge base querying in real-world scenarios.

创建时间:
2026-08-28
原始信息汇总

CorporateBench 数据集概述

基本信息

  • 许可证:Apache 2.0
  • 语言:英语(en)
  • 任务类型:问答(question-answering)、文本分类(text-classification)
  • 数据规模:100K < n < 1M
  • 标签:benchmark、synthetic、temporal-reasoning、knowledge-graphs

数据集简介

CorporateBench(CB)是一个大规模、多任务的问答基准数据集,用于评估大型语言模型在企业级文档集合上的信息抽取、检索和问答能力。该数据集包含四个合成的企业语料库,文档数量从353篇到232,692篇不等,语料由随时间演化的知识库生成,确保跨文档的逻辑一致性。

数据集结构

数据目录(data/)包含以下子目录:

  • kb/:每个公司的 .kb 归档文件
  • kb_qa/:知识库问答问题
  • topic_qa/:文档主题问答问题
  • integrated_qa/:结合图与主题证据的问题
  • additional_qa/:补充的主题层次配置

每个 .kb 文件(ZIP兼容归档)包含:

路径 内容
graph.nq 真实实体、属性和时间关系的 N-Quads 图
ontologies/*.ttl 用于验证图的 RDF 本体
documents/*.txt 合成的邮件、议程、会议纪要和日历文档
manifest.json 归档格式、版本、组件和文档计数元数据

公司配置

配置 规模 行业 员工数 文档数(.kb
zenith 科技 12 353
streamvibe 媒体 122 3,925
biocure 医药保健 1,110 26,492
pound 特大 金融 10,210 232,692

任务与评估

任务 配置 评估协议 指标
知识库评估 全部四个公司 从每篇文档抽取实体和关系并映射到真实数据 按类型的实体F1、宏平均实体F1;结构和时间关系F1
主题分类 biocurepound 分别31和17个标签;0、10或50次样本;1,000篇测试文档;五次重复 跨主题的宏平均F1
知识库问答 全部四个公司 每公司250题,涉及实体、关系和时间 标量答案精确匹配;列表答案集合F1
主题问答 全部四个公司 每公司250题,涉及文档主题 标量答案精确匹配;列表答案集合F1
综合问答 全部四个公司 每公司250题,结合图和文档证据 标量答案精确匹配;列表答案集合F1

三个问答任务共包含3,000个核心问题,评估采用文档检索(RAG,k=10)或对真实知识库的SQL访问,每个问题最多5次工具调用。

问答模式(QA Schema)

每个核心问答文件是包含 metadataquestions 字段的 JSON 对象:

  • metadata.dataset_typekb_qatopic_qaintegrated_qa
  • metadata.kb:关联的 .kb 文件名
  • metadata.topic_level(可选):生成主题感知问题所用的主题层次级别
  • questions[].id:文件内问题标识符
  • questions[].question:自然语言评估问题
  • questions[].answer:确定性真实答案(布尔、整数、字符串或字符串列表)
  • questions[].answer_typeboolintdatestrList[str]
  • questions[].template:实例化的问题模板
  • questions[].variables:用于构建问题的模板值
  • questions[].constraints(可选):回答问题所需的约束数量

additional_qa/ 下的补充文件使用相同的模式,提供备选主题层次级别。

构建与验证流程

  1. 为公司、部门、团队、员工、项目、任务、会议和时间关系定义 RDF 本体
  2. 生成有效的组织层次结构,并在90天的季度内模拟任务、会议和层次变化
  3. 标注实体并将世界序列化为经过本体验证的 N-Quads 图
  4. 围绕图派生的证据字符串生成企业文档,邮件结构基于 Enron 语料库建模,主题、员工个性和正式程度提供多样性
  5. 通过人工验证的 SPARQL 查询导出问答答案,而非模型生成

负责任使用

CorporateBench 仅用于研究和评估检索、抽取和推理系统,包含的是合成组织和通信,而非真实企业记录。生成的名称可能偶然与真实人物重合。

引用方式

请参考论文:Hamilton, Sil et al. "CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases." Findings of the Association for Computational Linguistics: EMNLP 2026.

搜集汇总
数据集介绍
CORPORATEBENCH 数据集图片
构建方式
该数据集的构建依托于程序化生成的知识图谱,通过先定义企业本体论框架,再模拟企业组织架构与运作流程,最终生成大规模且逻辑自洽的企业通信文档。具体而言,构建流程始于对四家规模各异(12至10,000名员工)的虚拟企业的知识图谱初始化,涵盖部门、团队、员工、项目及会议等实体及其关联关系。基于此,系统逐步模拟员工的任务分配、会议安排及组织变更,并利用大语言模型对实体进行语义标注,生成多样化的邮件文档。为确保文档间的逻辑一致性,每封邮件均插入明确的证据字符串,用以揭示特定的关系或事件,从而在保证可扩展性的同时,维持了跨文档的因果连贯性。
使用方法
该数据集适用于评估大语言模型在企业级文档检索、信息抽取及复杂推理方面的性能。研究者可利用其构建检索增强生成(RAG)或基于知识库(KB)的问答系统,通过工具调用接口实现对大规模文档语料或结构化知识图谱的查询。具体任务包括:实体与关系抽取,用于检验模型从非结构化文本中构建知识库的能力;主题分类,评估模型对文档语义的理解;以及多跳问答与综合问答,测试模型跨文档整合信息与推理的能力。通过对比模型在RAG与KB两种模式下的表现,可深入分析模型在不同信息获取机制下的性能差异,为优化企业级LLM应用提供参考。
背景与挑战
背景概述
在企业级大规模文档处理场景中,大型语言模型(LLM)面临检索与推理的严峻挑战,而现有基准多因规模不足或真实度欠缺难以准确评估其能力。为填补这一空白,Epiq AI Labs与康奈尔大学的研究团队于2024年构建了CORPORATEBENCH基准,旨在模拟接近真实的企业通信网络。该基准通过程序化生成的知识图谱,构建了从12至10,210名员工、规模达230,000余份文档的四个合成公司语料,并设计了涵盖信息抽取与知识库问答的多任务评估体系,系统检验LLM在跨文档逻辑一致性与超长上下文理解方面的表现,为衡量模型在企业环境中的实用性提供了重要参照。
当前挑战
CORPORATEBENCH的构建面临多维挑战。领域层面,现有合成基准过度简化,真实企业数据受保密协议限制难以获取,且企业级语料规模庞大,生成成本高昂,如何在保持逻辑一致性的前提下实现任意规模扩展是一大难题。构建层面,需确保文档间知识无矛盾,并模拟时间演化、组织层级调整等动态特征,同时通过人工验证保证数据质量。评估结果显示,LLM在关系抽取与时序推理上性能随规模增大显著下降,尤其在超长上下文中准确检索与整合证据仍远未解决,凸显了企业场景下多文档推理的巨大挑战。
常用场景
经典使用场景
CORPORATEBENCH作为大规模企业级问答基准,其经典使用场景聚焦于评估大语言模型在真实企业通信网络中的多文档推理能力。该数据集通过程序化生成的知识库构建了包含超过23万份文档的语料库,跨越四个规模递增的合成企业,从12人到10210名员工。研究者利用其高证据密度(平均每问关联87.6份文档)来模拟企业知识工作的复杂性,从而系统性地测试模型在长上下文理解、跨文档信息整合以及时序关系推理方面的表现,填补了现有基准在规模与真实性之间的鸿沟。
解决学术问题
该数据集解决了当前企业级LLM评估中的核心难题:真实企业数据因保密协议而难以获取,而合成数据往往过于简化,缺乏跨文档的逻辑一致性。CORPORATEBENCH通过从时间演化的知识库中采样文档,保证了实体关系在数十万份文档间的连贯性,使研究者能够精确衡量模型在构建结构化知识库(关系抽取)和基于知识库的问答(KB QA)上的能力。其提供的确定性标签和SPARQL验证的答案,为可复现评估奠定了基础,揭示了模型在规模逼近现实场景时性能急剧下降的现象,为企业AI落地提供了关键评测维度。
实际应用
在实际应用中,CORPORATEBENCH为部署于企业环境的LLM系统提供了压力测试工具。它可模拟法律、金融、制药等行业的通信网络场景,用于验证检索增强生成(RAG)系统在百万级文档规模下的检索准确性与答案忠实度。企业开发者可利用该基准对模型进行选型与调优,例如对比直接SQL访问知识库与RAG检索的性能差异,从而优化企业知识管理平台的架构设计。此外,其时间感知的任务设计可帮助评估模型处理合同审查、尽职调查、员工流动追踪等真实商业活动的能力,为AI助手的可靠性与合规性提供依据。
数据集最近研究
最新研究方向
在大型语言模型(LLM)长上下文处理能力日益提升的背景下,CORPORATEBENCH基准的发布标志着对企业级文档理解评估的范式革新。该数据集创新性地采用知识图谱驱动的程序化生成方法,构建了涵盖12至10,210名员工的四家合成企业,总计263,466篇逻辑自洽的文档,突破了以往基准在规模与真实性上的双重局限。研究揭示,随着语料规模逼近现实应用场景,各主流模型在知识抽取与问答任务上的性能呈现显著下降趋势,尤其在时序关系抽取与大规模检索增强生成(RAG)任务中表现不力。这一发现精准刻画了当前技术瓶颈,为评估LLM在企业通信网络中的真实推理能力提供了关键度量标准,对推动企业级智能应用的发展具有重要里程碑意义。
相关研究论文
  • 1
    CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge BasesEpiq AI实验室; 康奈尔大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务