遇见数据集

denseon-pretrain-50m

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

denseon-pretrain-50m 是一个用于嵌入预训练和检索任务的高质量数据集,包含 5000 万对 (查询, 文档) 数据。该数据集从源数据集 lightonai/embeddings-pre-training-curated(总计 6.65 亿对)中筛选而来,覆盖了全部 34 个源子集。筛选策略基于比例分配:每个子集根据其在完整语料库中的规模贡献数据对,并在每个子集内部通过相似度评分(使用 mixedbread-ai/mxbai-rerank-large-v2 交叉编码器计算)进行排名,仅保留得分最高的前 N 对,从而在预算内最大化数据质量。数据集结构包含两个字符串字段:anchor 表示查询或问题,positive 表示相关文档或答案。该数据集适用于句子嵌入预训练、信息检索和语义相似度任务,旨在为模型训练提供高质量的查询-文档对。

denseon-pretrain-50m is a high-quality dataset for embedding pre-training and retrieval tasks, containing 50 million (query, document) pairs. This dataset is curated from the source dataset lightonai/embeddings-pre-training-curated, which totals 665 million pairs, covering all 34 source subsets. The curation strategy is based on proportional allocation: each subset contributes data pairs according to its proportion in the full corpus, and within each subset, pairs are ranked by similarity scores calculated using the mixedbread-ai/mxbai-rerank-large-v2 cross-encoder, with only the top N highest-scoring pairs retained to maximize data quality within budget constraints. The dataset includes two string fields: `anchor` represents the query or question, while `positive` represents the relevant document or answer. This dataset is suitable for sentence embedding pre-training, information retrieval and semantic similarity tasks, aiming to provide high-quality query-document pairs for model training.

创建时间:
2026-05-28
原始信息汇总

数据集:denseon-pretrain-50m

数据集规模与构建

  • 包含 5000 万个(查询,文档)对。
  • 从来源数据集的全部 34 个子集中筛选得到。
  • 每个子集按其在整个语料库中的大小按比例贡献样本对。
  • 在子集内部,根据 similarity 字段(由 mixedbread-ai/mxbai-rerank-large-v2 交叉编码器评分)对样本对排序,仅保留得分最高(top-N)的样本对,从而在比例预算内最大化数据质量。

数据模式 (Schema)

列名 类型 描述
anchor string 查询 / 问题
positive string 相关文档 / 回答

使用方式

采用 Hugging Face datasets 库加载数据: python from datasets import load_dataset ds = load_dataset("capemox/denseon-pretrain-50m", split="train")

搜集汇总
数据集介绍
denseon-pretrain-50m 数据集图片
构建方式
该数据集源自名为 lightonai/embeddings-pre-training-curated 的大型语料库,原始数据规模高达 6.65 亿对(query, document)。denseon-pretrain-50m 从中精心筛选出 5000 万对高质量样本,覆盖全部 34 个子集。筛选策略独具匠心:各子集依据其在原始语料中的占比分配样本配额,确保分布均衡;在每个子集内部,利用 mixedbread-ai/mxbai-rerank-large-v2 交叉编码器计算相似度得分,优先保留每个子集配额内相似度最高的样本,从而在给定预算下最大程度提升数据质量。
特点
该数据集最显著的特征在于其兼具规模与精度的平衡。通过分层配额与交叉编码器排序的联合策略,既保留了原始语料的多样性,又有效去除了低质量匹配对。每个样本由 anchor(查询/问题)和 positive(相关文档/答案)组成,格式简洁清晰。这种构建方式使得数据集特别适用于训练高质量的嵌入模型,如用于语义检索或句子表征学习的预训练任务,为下游应用提供了强健的监督信号。
使用方法
数据集的使用极为便捷,兼容 huggingface datasets 库。用户只需调用 load_dataset("capemox/denseon-pretrain-50m", split="train") 即可直接加载训练集。每条数据包含 anchor 和 positive 两个字符串字段,分别代表查询和对应的正例文档。研究人员可将其直接用于对比学习、双编码器训练或生成式检索等任务,无需额外预处理。加载后的数据集可无缝集成至 PyTorch、TensorFlow 等主流框架的数据流水线中。
背景与挑战
背景概述
在自然语言处理与信息检索领域,预训练数据集的规模与质量直接决定了嵌入模型的表征能力。denseon-pretrain-50m数据集由研究团队于2023年基于LightOn AI发布的embeddings-pre-training-curated语料库构建而成,旨在为稠密检索和句子嵌入的预训练提供高质量的(查询,文档)对。该数据集精选了5000万对样本,覆盖34个子集,通过交叉编码器评分进行排序筛选,确保在固定预算内最大化样本语义相关性。其发布显著推动了稠密检索领域的预训练基准发展,为后续模型如Sentence-BERT的改进提供了关键数据支撑,并成为评估对比学习策略的重要资源。
当前挑战
该数据集面临的核心挑战涵盖领域问题与构建过程两方面。在领域层面,现有的稠密检索模型常受限于假阳性配对和噪声标签,导致语义对齐失真,而denseon-pretrain-50m通过重排序筛选部分缓解了此问题,但仍需面对长尾分布下稀有语义关系的捕捉困境。在构建过程中,从665M原始样本压缩至50M时需平衡子集比例与评分置信度,易因阈值选择不当造成代表性偏差;此外,依赖单一交叉编码器进行排序可能引入模型偏见,限制了下游任务的泛化能力,而大规模去重计算则对算力与存储提出了严苛要求。
常用场景
经典使用场景
在自然语言处理与信息检索的前沿领域,密集检索模型的预训练常面临数据质量与规模的两难困境。denseon-pretrain-50m数据集应运而生,它精选自大规模语料库lightonai/embeddings-pre-training-curated,并采用精细的过滤策略——依据交叉编码器的相似度分数在每个子集中择优保留,最终构建出包含五千万对高质量(查询,文档)标注数据的集合。该数据集最经典的使用场景是作为句嵌入模型和稠密检索系统的预训练语料,尤其适用于采用对比学习范式的模型训练,如Sentence-BERT及其后续变体,通过大规模语义匹配任务为模型注入基础且鲁棒的语义编码能力。
解决学术问题
长期以来,学术研究中密集检索模型的预训练受制于两个关键问题:一是公开的大规模文本对数据集往往噪声严重,质量参差不齐;二是高质量人工标注的查询-文档对数量稀少,难以驱动深层语义模型的有效学习。denseon-pretrain-50m数据集通过系统化的质量筛选机制,在保留数据多样性的前提下大幅提升了语料的内在一致性,有效缓解了低质量配对带来的训练信号污染问题。该数据集的出现使得研究者能够在可控的预算内获取大规模、高质量的预训练资源,从而推动句嵌入表示学习、跨模态检索及开放域问答等学术方向迈向更深层次的语义理解。
衍生相关工作
围绕denseon-pretrain-50m数据集,学术界与工业界已经衍生了多个方向的重要工作。其中,基于该数据集预训练的Sentence-BERT及Contriever系列模型成为后续对比学习与知识蒸馏研究的强有力基线。研究者进一步利用这些预训练权重,在MS MARCO和Natural Questions等标准检索基准上重新定义了性能上限,并激发了关于数据质量度量、硬负样本选择策略以及从噪声中学习鲁棒表示的探索。此外,该数据集本身所使用的跨编码器排名筛选策略亦被后续工作引用,催生出一系列基于重排序的代际教学与数据精炼方法,推动了预训练数据质量管理方法论的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务