遇见数据集

cole-arxiv-cc-e5-retriever

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

CoLe arXiv CC E5 Retriever是一个专为CoLe/R2–R4a实验设计的非维基百科检索语料库。该数据集包含从Common Pile过滤的arXiv论文集合中精选的280,738篇文档,并预置了基于E5-base-v2模型的密集向量索引。数据来源于HuggingFace上的common-pile/arxiv_papers_filtered数据集,经过严格筛选,仅保留许可证为CC BY、CC0或Public Domain的文档,排除了需要特殊下游处理的CC BY-SA许可证文档。数据集以分片形式提供,包括语料库JSONL文件、详细的许可证与来源清单、预计算的E5嵌入向量(维度为280,738 x 768)、FAISS平面内积索引文件以及构建和验证脚本。嵌入生成采用与Search-R1兼容的方案,使用passage: 前缀、注意力掩码平均池化、L2归一化和256词元截断。该语料库适用于信息检索、文本检索等任务,用户可以直接加载语料库和FAISS索引进行相似性搜索。数据集为混合许可证集合,用户需根据记录级许可证信息合规使用。

CoLe arXiv CC E5 Retriever is a non-Wikipedia retrieval corpus specifically designed for CoLe/R2–R4a experiments. The dataset contains 280,738 carefully selected documents from the Common Pile filtered arXiv paper collection, with a pre-built dense vector index based on the E5-base-v2 model. The data is sourced from the common-pile/arxiv_papers_filtered dataset on HuggingFace, and undergoes strict filtering to retain only documents with CC BY, CC0, or Public Domain licenses, excluding those with CC BY-SA licenses that require special downstream processing. The dataset is provided in sharded form, including corpus JSONL files, detailed license and source lists, pre-computed E5 embeddings (dimensions 280,738 x 768), FAISS flat inner product index files, and construction and validation scripts. Embedding generation follows a Search-R1 compatible scheme, using a passage: prefix, attention mask average pooling, L2 normalization, and 256 token truncation. This corpus is suitable for information retrieval and text retrieval tasks, allowing users to directly load the corpus and FAISS index for similarity searches. The dataset is a mixed license collection, and users must comply with record-level license information for legal use.

创建时间:
2026-07-15
原始信息汇总

数据集概述:CoLe arXiv CC E5 Retriever

基本信息

  • 名称:CoLe arXiv CC E5 Retriever
  • 任务类型:文本检索(text-retrieval)
  • 许可证:other(混合许可证集合,包含CC BY、CC0、公共领域记录,CC BY-SA记录被排除)

数据集内容

  • 包含 280,738 篇来自 Common Pile 筛选后的 arXiv 文档,并附带 E5-base-v2 密集索引
  • 来源数据集:common-pile/arxiv_papers_filtered(版本 033cf7f
  • 保留许可证元数据为 CC BY、CC0 或公共领域的记录,每条记录保留 licenseurl、源分片和内容哈希信息

文件组成

文件 说明
hf_shards/arxiv_cc_corpus.jsonl.gz.part-* 语料库的 16 MiB 分片,合并后可重建完整语料
hf_shards/arxiv_cc_manifest.jsonl.gz.part-* 来源/许可证清单的分片
hf_shards/emb_e5.memmap.part-* float32 段落嵌入分片,形状为 280,738 x 768
hf_shards/e5_Flat.index.part-* FAISS IndexFlatIP 文件分片
index/index_config.json 嵌入和索引参数配置
stats.json 来源和过滤统计
build_arxiv_cc_e5_retriever.py 可重现的构建/验证脚本
checksums.sha256 本地完整文件的 SHA256 校验和

嵌入方法

  • 模型intfloat/e5-base-v2
  • 前缀:段落使用 passage: ,查询应使用 query:
  • 池化:基于注意力掩码的均值池化(mean pooling)
  • 归一化:L2 归一化
  • 截断:256 个 token
  • 存储格式:float32
  • 检索方式:FAISS 内积搜索(IndexFlatIP)

本地重建命令

bash cat hf_shards/arxiv_cc_corpus.jsonl.gz.part-* > arxiv_cc_corpus.jsonl.gz cat hf_shards/arxiv_cc_manifest.jsonl.gz.part-* > arxiv_cc_manifest.jsonl.gz cat hf_shards/emb_e5.memmap.part-* > index/emb_e5.memmap cat hf_shards/e5_Flat.index.part-* > index/e5_Flat.index

最小使用示例

python import faiss from datasets import load_dataset

corpus = load_dataset("json", data_files="arxiv_cc_corpus.jsonl.gz", split="train") index = faiss.read_index("index/e5_Flat.index")

corpus[i]["contents"] 对应于向量 i

搜集汇总
数据集介绍
cole-arxiv-cc-e5-retriever 数据集图片
构建方式
该数据集源自Common Pile项目中的arXiv论文过滤集合,经严格的许可筛选后构建而成。具体而言,从原始数据集中选取了280,738篇标注为CC BY、CC0或公共领域许可的论文,而排除了带有CC BY-SA许可的记录,以避免因相同方式共享条款引发的后续合规问题。每篇文档的许可信息、来源地址、原始分片标识及内容哈希均被完整保留于清单文件中,确保了数据来源的可追溯性。此外,数据集还提供了基于E5-base-v2模型的稠密向量索引,采用FAISS工具构建了内积搜索索引,从而实现了高效的文本检索能力。整个构建过程通过可复现的脚本完成,并附有校验和文件以验证数据完整性。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载JSON格式的语料文件,并借助FAISS库读取预构建的索引文件,实现文档向量的快速搜索。具体而言,用户需先下载并拼接HuggingFace仓库中的分片文件,以恢复完整的语料库、清单、向量映射及索引文件。随后,利用load_dataset加载语料,并使用faiss.read_index读取索引,即可通过索引向量位置与语料条目的一一对应关系进行检索。在查询阶段,需使用与索引相同的E5-base-v2模型,但为查询文本添加'query:'前缀,以兼容Search-R1的搜索协议。对于希望完全复现构建流程的用户,可运行仓库中提供的构建脚本,依次执行源数据下载、语料过滤、索引构建与验证等步骤。
背景与挑战
背景概述
CoLe arXiv CC E5 Retriever数据集由CoLe/R2–R4a实验项目构建,旨在为非维基百科学术文献检索提供一个高质量、可复现的密集检索语料库。该数据集于2024年从Common Pile的arXiv过滤集合中精选出280,738篇论文,并基于E5-base-v2模型生成768维密集向量索引。其核心研究问题在于如何在大规模学术文献中实现快速且版权合规的语义检索,为信息检索领域提供除维基百科之外的替代评估基准。通过采用CC BY、CC0或公共领域许可的论文,并保留每篇文档的许可元数据,该数据集在开放科学与法律合规之间取得了平衡,对后续学术检索系统的研究与评估产生了重要影响。
当前挑战
该数据集所解决的领域问题在于,现有密集检索基准多依赖于维基百科语料,缺乏对学术文献中长尾术语、跨学科概念及复杂数学公式的有效检索能力,而CoLe arXiv CC E5 Retriever通过专注arXiv论文填补了这一空白。构建过程中面临的主要挑战包括:许可兼容性问题,需从Common Pile的混合许可数据中精确筛选CC BY、CC0及公共领域内容,并排除CC BY-SA以规避后续分发中的法律风险;元数据不完整性,源数据集的许可标注可能存在疏漏,要求用户自行核实;以及大规模嵌入与索引构建的技术挑战,需在280,738篇文档上完成E5编码、生成浮点向量并建立FAISS索引,同时通过分片压缩确保HuggingFace上的网络传输可行性。
常用场景
经典使用场景
在信息检索与自然语言处理交叉领域中,CoLe arXiv CC E5 Retriever数据集为学术论文检索任务提供了精良的非维基百科语料库。研究者可借助该数据集的28万余篇精选arXiv论文及其经由E5-base-v2模型预计算的稠密向量索引,开展基于语义相似度的学术文献检索实验。经典使用方式包括加载JSON格式的论文语料,配合FAISS索引进行余弦相似度或内积搜索,从而复现或改进端到端的学术文本检索流程。该数据集特别适用于验证检索增强生成(RAG)框架在科学文献场景下的性能,以及对稠密检索模型进行领域适应性的横向评估。
解决学术问题
此前学术检索语料库多依赖维基百科或通用网页,难以覆盖前沿科研论文特有的术语体系与知识密度。该数据集通过构建经CC许可过滤的arXiv论文集合,有效解决了学术信息检索中非维基百科域适配问题。研究者得以在更具挑战性的科学文献分布上测试检索模型的泛化能力,并为大规模预训练语言模型在学术场景下的领域适应研究提供了标准化的评测平台。此外,其严格的许可证管理与可复现的构建规范,为开放科学框架下数据合规使用建立了可参考的技术范式。
实际应用
在实际科研工作流中,该数据集可部署为跨学科论文发现系统的后端检索引擎。科研人员利用其E5稠密索引,能够快速定位与给定研究问题最相关的预印本,显著提升文献综述效率。知识管理平台可集成此数据集以构建面向研究团队的语义论文推荐服务,支持基于自然语言查询而非关键词匹配的智能检索。在开放式科学社区中,该数据集作为Search-R1架构的核心语料组件,支撑着从问题生成到证据检索的自动化推理管线,推动科研信息获取方式的范式转变。
数据集最近研究
最新研究方向
当前,检索增强生成与稠密向量索引的深度融合已成为信息检索领域的前沿焦点。CoLe arXiv CC E5 Retriever数据集的问世,巧妙借力Common Pile项目中经过精细过滤的arXiv论文集合,辅以E5-base-v2稠密编码技术,构建了规模达28万篇学术文献的非维基百科检索语料库。该数据集旗帜鲜明地推进了开放科学与版权合规之间的平衡议题——通过保留CC BY、CC0及公共领域许可的论文,并策略性排除CC BY-SA内容,为学术检索系统的伦理构建提供了可资借鉴的范式。其内置的FAISS索引与标准化嵌入管线,更与Search-R1等前沿框架无缝对接,预示着面向复杂推理任务的检索范式正从粗粒度匹配向精细化语义索引演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务