IndustryRAG-Dataset
收藏资源简介:
检索增强生成(RAG)已成为将大型语言模型应用于训练期间未获得的信息的标准方法。虽然许多现有数据集和基准测试专注于网络或其他公共来源,但仍未广泛采用能够真实反映公司内部知识性质的数据集。与此同时,初创企业、企业和研究人员越来越多地开发专为处理此类专有数据而设计的代理。为了帮助缩小这一差距,我们引入了一个新的数据集,模拟企业知识环境,并提供了一个灵活的框架,用于根据特定用例扩展和定制数据。
Retrieval-Augmented Generation (RAG) has emerged as the standard paradigm for applying Large Language Models (LLMs) to information not acquired during their pre-training phase. While numerous existing datasets and benchmarks prioritize web or other public data sources, datasets that authentically mirror the nature of internal corporate knowledge remain underadopted. Concurrently, startups, enterprises, and researchers are increasingly developing AI Agents specifically tailored to process such proprietary data. To address this gap, we propose a novel dataset that simulates enterprise knowledge environments, alongside a flexible framework for expanding and customizing the data to align with specific use cases.
IndustryRAG-Bench 数据集概述
数据集基本信息
- 数据集名称: IndustryRAG-Bench
- 发布者/组织: Onyx
- 许可证: MIT
- 数据集访问: 通过 GitHub 最新发布版本下载
- 相关链接:
- 官方网站: https://onyx.app/
- 排行榜: https://huggingface.co/spaces/onyx-dot-app/IndustryRAG-Bench-Leaderboard
- 论文草稿: 参见 paper_draft.md
数据集内容与规模
- 文档总数: 略超过 500,000 份文档
- 问题总数: 500 个问题
- 模拟场景: 模拟一家名为 "Redwood Inference" 的提供 AI 模型推理服务的公司
- 核心目的: 帮助团队评估其 RAG 系统,并在真实的企业数据上微调智能体。代码还提供了为不同行业、不同规模公司等生成类似数据集的方法。
数据来源与分布
数据集包含以下来源的文档,具体分布如下:
| 来源类型 | 近似数量 | 描述 |
|---|---|---|
| Slack | 275,000 | 内部频道和团队讨论 |
| Gmail | 120,000 | 来自管理层、销售、领导和独立贡献者的电子邮件线程 |
| Linear | 35,000 | 工程、产品和设计的项目管理工单 |
| Google Drive | 25,000 | 共享文件和协作文档 |
| Hubspot | 15,000 | 销售客户关系管理记录 |
| Fireflies | 10,000 | 内部和外部会议的会议记录 |
| GitHub | 8,000 | 不同代码仓库的拉取请求和评论 |
| Jira | 6,000 | 内部和面向客户的支持工单 |
| Confluence | 5,000 | 维基、操作手册和结构化/精炼的文档 |
语料库广泛覆盖了业务活动的关键领域,包括但不限于规划、工程、文档、销售、客户成功、内部讨论、电子邮件等。
问题类别
问题分为 10 个类别,具体如下:
| 类别 | 数量 | 描述 |
|---|---|---|
| Basic | 175 | 简单问题,具有单一的基准真实文档 |
| Semantic | 125 | 与 Basic 类似但更迂回,关键词/短语重叠较少,且没有 giveaway 类型的关键词 |
| Intra-Document Reasoning | 40 | 需要结合单个较长文档中多个相距较远部分的信息 |
| Project Related | 40 | 汇总公司内单个项目/计划的相关文档知识 |
| Constrained | 30 | 具有多个相关文档但带有限定条件的问题,这些条件使得除一个答案外其他所有答案都不合格 |
| Conflicting Info | 20 | 文档直接相互矛盾的问题。要求系统给出完整且正确的答案 |
| Completeness | 20 | 需要获取所有相关文档(不超过 10 份)才能提供正确答案的问题 |
| Miscellaneous | 20 | 针对非正式、离题或组织松散文档的问题 |
| High Level | 10 | 高级别问题,答案不在任何单一文档中。注意:这些问题没有任何基准真实文档 |
| Info Not Found | 20 | 答案不可用的问题。注意:这些问题没有任何基准真实文档 |
额外说明:
- 文件
extra_questions.jsonl中包含额外的 100 个依赖于元数据的问题,供对元数据感知 RAG 感兴趣的团队使用。这些问题被排除在排行榜之外,因为其评估标准与核心的检索导向基准不同。
数据集使用
- 下载地址: 从 GitHub 最新发布版本下载
- 主要文件:
all_documents.zip: 包含所有文档的单个归档文件<source_type>_slice_<slice_number>.zip: 单独的 zip 文件,每个文件包含最多 5000 个文档(无嵌套目录结构)
- 问题集: 位于
questions.jsonl文件中,也可在发布版本中找到 - 答案评估: 参考
answer_evaluation目录下的README.md - 快速入门: 更多使用信息请参考
quickstart.md
数据集设计原则
详细过程请参考 methodology.md。数据集设计和生成过程遵循五个原则:
- 跨文档一致性
- 真实的体积分布
- 真实的噪声
- 内部术语
- 跨企业设置的通用性
排行榜与提交
- 排行榜地址: https://huggingface.co/spaces/onyx-dot-app/IndustryRAG-Bench-Leaderboard
- 提交方式: 联系 joachim@onyx.app
- 提交要求:
- 开源: 提供重现结果的指南
- 闭源: 提供一个沙箱或端点,以便发送问题进行验证
- 注意: Onyx 提供基于 RAG 的产品,为避免利益冲突,其自身不参与排行榜排名。
背景与意义
现有的检索增强生成和信息检索数据集主要关注公开可访问的文档集。迄今为止,还没有一个完全专注于公司内部数据的公开可访问数据集。本数据集/仓库旨在提供这样一个数据集。



