capemox/denseon-pretrain-50m
收藏资源简介:
denseon-pretrain-50m 是一个用于嵌入预训练的大规模数据集,包含5000万个(查询,文档)对。这些对是从源数据集 lightonai/embeddings-pre-training-curated 的34个子集中均匀随机采样的,覆盖了多种领域,如新闻、学术论文、问答平台和用户生成内容。采样策略确保每个子集按其原始大小比例贡献数据,并通过均匀伯努利采样(种子42)选择,保留包括困难正例在内的完整质量范围。数据集模式包括两列:anchor(查询或问题)和positive(相关文档或答案)。该数据集旨在支持句子嵌入、检索和预训练任务。
denseon-pretrain-50m is a large-scale dataset for embedding pre-training, consisting of 50 million (query, document) pairs. These pairs are uniformly randomly sampled from 34 source subsets of the lightonai/embeddings-pre-training-curated dataset, covering diverse domains such as news, academic papers, Q&A platforms, and user-generated content. The sampling strategy ensures each subset contributes proportionally to its size in the full corpus, with pairs selected via uniform Bernoulli sampling (seed 42) — not filtered by similarity score — preserving the full quality range including hard positives. The dataset schema includes two columns: anchor (query or question) and positive (relevant document or answer). It is designed to support sentence embeddings, retrieval, and pre-training tasks.




