CORPORATEBENCH
收藏资源简介:
CORPORATEBENCH是一个大规模、人工验证的多任务问答基准数据集,由Epiq AI实验室与康奈尔大学联合创建,旨在评估大语言模型在企业通信场景下的推理能力。该数据集包含四个模拟公司,员工规模从12至10,210人,共生成263,466份文档,覆盖丰富的关系三元组。其创建过程基于程序化生成的知识图谱,通过模拟公司层级、工作活动及会议,并借助大语言模型填充邮件内容,确保逻辑一致性与可扩展性。该数据集用于评估模型在长文本、多文档推理上的表现,填补了企业级基准测试的空白,解决真实场景中信息提取与知识库查询的挑战。
CORPORATEBENCH is a large-scale, manually validated multi-task question answering benchmark dataset co-created by Epiq AI Lab and Cornell University, aiming to evaluate the reasoning capabilities of large language models (LLMs) in enterprise communication scenarios. This dataset includes four simulated companies with employee counts ranging from 12 to 10,210, and a total of 263,466 generated documents covering rich relational triples. Its construction is based on programmatically generated knowledge graphs, which simulate corporate hierarchies, work activities and meetings, and leverage large language models to populate email content, ensuring logical consistency and scalability. This dataset is designed to evaluate model performance on long-text and multi-document reasoning tasks, filling the gap in enterprise-level benchmark testing and addressing the challenges of information extraction and knowledge base querying in real-world scenarios.
CorporateBench 数据集概述
基本信息
- 许可证:Apache 2.0
- 语言:英语(en)
- 任务类型:问答(question-answering)、文本分类(text-classification)
- 数据规模:100K < n < 1M
- 标签:benchmark、synthetic、temporal-reasoning、knowledge-graphs
数据集简介
CorporateBench(CB)是一个大规模、多任务的问答基准数据集,用于评估大型语言模型在企业级文档集合上的信息抽取、检索和问答能力。该数据集包含四个合成的企业语料库,文档数量从353篇到232,692篇不等,语料由随时间演化的知识库生成,确保跨文档的逻辑一致性。
数据集结构
数据目录(data/)包含以下子目录:
- kb/:每个公司的
.kb归档文件 - kb_qa/:知识库问答问题
- topic_qa/:文档主题问答问题
- integrated_qa/:结合图与主题证据的问题
- additional_qa/:补充的主题层次配置
每个 .kb 文件(ZIP兼容归档)包含:
| 路径 | 内容 |
|---|---|
graph.nq |
真实实体、属性和时间关系的 N-Quads 图 |
ontologies/*.ttl |
用于验证图的 RDF 本体 |
documents/*.txt |
合成的邮件、议程、会议纪要和日历文档 |
manifest.json |
归档格式、版本、组件和文档计数元数据 |
公司配置
| 配置 | 规模 | 行业 | 员工数 | 文档数(.kb) |
|---|---|---|---|---|
zenith |
小 | 科技 | 12 | 353 |
streamvibe |
中 | 媒体 | 122 | 3,925 |
biocure |
大 | 医药保健 | 1,110 | 26,492 |
pound |
特大 | 金融 | 10,210 | 232,692 |
任务与评估
| 任务 | 配置 | 评估协议 | 指标 |
|---|---|---|---|
| 知识库评估 | 全部四个公司 | 从每篇文档抽取实体和关系并映射到真实数据 | 按类型的实体F1、宏平均实体F1;结构和时间关系F1 |
| 主题分类 | biocure、pound |
分别31和17个标签;0、10或50次样本;1,000篇测试文档;五次重复 | 跨主题的宏平均F1 |
| 知识库问答 | 全部四个公司 | 每公司250题,涉及实体、关系和时间 | 标量答案精确匹配;列表答案集合F1 |
| 主题问答 | 全部四个公司 | 每公司250题,涉及文档主题 | 标量答案精确匹配;列表答案集合F1 |
| 综合问答 | 全部四个公司 | 每公司250题,结合图和文档证据 | 标量答案精确匹配;列表答案集合F1 |
三个问答任务共包含3,000个核心问题,评估采用文档检索(RAG,k=10)或对真实知识库的SQL访问,每个问题最多5次工具调用。
问答模式(QA Schema)
每个核心问答文件是包含 metadata 和 questions 字段的 JSON 对象:
metadata.dataset_type:kb_qa、topic_qa或integrated_qametadata.kb:关联的.kb文件名metadata.topic_level(可选):生成主题感知问题所用的主题层次级别questions[].id:文件内问题标识符questions[].question:自然语言评估问题questions[].answer:确定性真实答案(布尔、整数、字符串或字符串列表)questions[].answer_type:bool、int、date、str或List[str]questions[].template:实例化的问题模板questions[].variables:用于构建问题的模板值questions[].constraints(可选):回答问题所需的约束数量
additional_qa/ 下的补充文件使用相同的模式,提供备选主题层次级别。
构建与验证流程
- 为公司、部门、团队、员工、项目、任务、会议和时间关系定义 RDF 本体
- 生成有效的组织层次结构,并在90天的季度内模拟任务、会议和层次变化
- 标注实体并将世界序列化为经过本体验证的 N-Quads 图
- 围绕图派生的证据字符串生成企业文档,邮件结构基于 Enron 语料库建模,主题、员工个性和正式程度提供多样性
- 通过人工验证的 SPARQL 查询导出问答答案,而非模型生成
负责任使用
CorporateBench 仅用于研究和评估检索、抽取和推理系统,包含的是合成组织和通信,而非真实企业记录。生成的名称可能偶然与真实人物重合。
引用方式
请参考论文:Hamilton, Sil et al. "CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases." Findings of the Association for Computational Linguistics: EMNLP 2026.

- 1CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge BasesEpiq AI实验室; 康奈尔大学 · 2026年



