denseon-pretrain-50m
收藏资源简介:
denseon-pretrain-50m 是一个用于嵌入预训练和检索任务的高质量数据集,包含 5000 万对 (查询, 文档) 数据。该数据集从源数据集 lightonai/embeddings-pre-training-curated(总计 6.65 亿对)中筛选而来,覆盖了全部 34 个源子集。筛选策略基于比例分配:每个子集根据其在完整语料库中的规模贡献数据对,并在每个子集内部通过相似度评分(使用 mixedbread-ai/mxbai-rerank-large-v2 交叉编码器计算)进行排名,仅保留得分最高的前 N 对,从而在预算内最大化数据质量。数据集结构包含两个字符串字段:anchor 表示查询或问题,positive 表示相关文档或答案。该数据集适用于句子嵌入预训练、信息检索和语义相似度任务,旨在为模型训练提供高质量的查询-文档对。
denseon-pretrain-50m is a high-quality dataset for embedding pre-training and retrieval tasks, containing 50 million (query, document) pairs. This dataset is curated from the source dataset lightonai/embeddings-pre-training-curated, which totals 665 million pairs, covering all 34 source subsets. The curation strategy is based on proportional allocation: each subset contributes data pairs according to its proportion in the full corpus, and within each subset, pairs are ranked by similarity scores calculated using the mixedbread-ai/mxbai-rerank-large-v2 cross-encoder, with only the top N highest-scoring pairs retained to maximize data quality within budget constraints. The dataset includes two string fields: `anchor` represents the query or question, while `positive` represents the relevant document or answer. This dataset is suitable for sentence embedding pre-training, information retrieval and semantic similarity tasks, aiming to provide high-quality query-document pairs for model training.
数据集:denseon-pretrain-50m
- 语言:英语 (en)
- 许可证:Apache-2.0
- 标签:embeddings, retrieval, sentence-transformers, pretrain
- 来源数据集:lightonai/embeddings-pre-training-curated(共 6.65 亿对)
数据集规模与构建
- 包含 5000 万个(查询,文档)对。
- 从来源数据集的全部 34 个子集中筛选得到。
- 每个子集按其在整个语料库中的大小按比例贡献样本对。
- 在子集内部,根据
similarity字段(由mixedbread-ai/mxbai-rerank-large-v2交叉编码器评分)对样本对排序,仅保留得分最高(top-N)的样本对,从而在比例预算内最大化数据质量。
数据模式 (Schema)
| 列名 | 类型 | 描述 |
|---|---|---|
| anchor | string | 查询 / 问题 |
| positive | string | 相关文档 / 回答 |
使用方式
采用 Hugging Face datasets 库加载数据:
python
from datasets import load_dataset
ds = load_dataset("capemox/denseon-pretrain-50m", split="train")




