遇见数据集

msmarco_lateon

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集提供了基于BEIR msmarco数据集的dev子集(共8,841,823篇文档和6,980个查询)的多向量(晚期交互)嵌入表示,由LightOn LateOn模型(revision 62911e105059585d244384c7d17826e35f669c17)生成。每个文档和查询被编码为变长的128维向量集合(文档为fp16精度,查询为fp32精度),并附带原始ID、token ID、文档长度与查询长度信息。同时包含TREC格式的qrels(7,437行)以及基于全集精确MaxSim计算的top-1000和top-100检索结果(分别为6,980,000和698,000行)。嵌入向量经过L2归一化,文档截断至300个token,查询截断至32个token,文档跳过了32个标点符号token。数据可用于评估晚期交互模型(如ColBERT)的检索质量、执行精确MaxSim相似度计算,或作为信息检索研究的基准嵌入集。许可证为CC-BY-SA-4.0。

创建时间:
2026-09-27
搜集汇总
数据集介绍
msmarco_lateon 数据集图片
构建方式
该数据集以BEIR基准中的msmarco开发集为源语料,通过ir_datasets工具载入原始文档、查询及qrels,并采用lightonai/LateOn多向量编码模型进行推理。文档与查询分别以float16和float32精度编码,每段文本被转换为128维向量序列,经L2归一化后存储。文档侧截断至300个标记并去除32个标点符号,查询侧截断至32个标记,所有标识符保持源数据原貌,最终以NumPy数组与TSV文件形式固化。
特点
该数据集的核心特质在于其多向量晚期交互表示形式,每篇文档和每个查询均由可变长度的128维向量集合构成,而非单一稠密向量。文档向量以fp16存储,查询向量以fp32存储,并配有精确的MaxSim全库检索真值。数据集涵盖884万余篇文档与6980条查询,嵌入维度统一为128,且所有向量均经过单位范数验证,确保向量空间的一致性。
使用方法
使用该数据集时,需通过NumPy加载documents.npy、doclens.npy、doc_ids.npy等文件,利用doclens的累积和计算文档向量偏移量,从而按索引重建文档向量序列。查询加载同理,需根据query_lens截取有效向量。检索评分采用MaxSim函数,即查询向量与文档向量点积后在查询维度上取最大值并求和。真值文件gt_top1000.tsv和gt_top100.tsv提供了精确的检索排名,可用于评估。
背景与挑战
背景概述
信息检索领域长期致力于从海量文本中精准定位相关文档,多向量后期交互模型凭借其细粒度匹配能力,逐渐成为稠密检索研究的重要方向。msmarco_lateon数据集由LightOn团队于2026年构建,基于BEIR基准中的MS MARCO段落检索任务,采用LateOn模型对文档与查询进行多向量编码,生成包含884万篇文档、6980条查询及逾6亿文档向量的高质量嵌入资源,并提供精确MaxSim排序真值。该数据集为后期交互检索模型的训练、评估与系统优化提供了标准化基准,推动了多向量检索范式在可复现性与规模化方面的研究进展。
当前挑战
该数据集所应对的核心领域问题在于大规模多向量检索中的高效精确匹配与系统评估。传统单向量稠密检索难以捕捉查询与文档间的细粒度语义交互,而后期交互模型虽能提升相关性建模能力,却面临存储开销巨大与计算复杂度高昂的挑战。其构建过程亦存在多重难点:需在异构精度下保持文档与查询向量的一致性,处理变长多向量序列的对齐与截断策略,确保精确MaxSim真值在海量语料上的可扩展计算,以及维持索引与真值之间的严格对应关系,从而保障检索评估的有效性与鲁棒性。
常用场景
经典使用场景
在信息检索与神经排序研究领域,多向量后交互(late-interaction)范式凭借其兼顾表达力与检索效率的特性,已成为稠密检索的重要分支。msmarco_lateon数据集正是为该范式量身打造的资源,其最经典的使用场景在于为ColBERT类模型提供预编码的多向量嵌入与精确的MaxSim检索基准。研究者可直接加载文档与查询的变长128维向量集合,利用qrels与top-1000 ground truth进行端到端的检索评测,或以此为基础复现和比较不同后交互模型的排序性能。
实际应用
在实际应用层面,该数据集可服务于搜索引擎、问答系统与推荐系统中的候选召回与精排模块。工程团队能够借助其预计算的多向量表示,快速搭建基于MaxSim的检索流水线,并在真实规模的文档集合上评估延迟与准确率的权衡。所附的qrels与检索质量指标为系统调参提供了直接参照,而fp16文档与fp32查询的存储设计亦为内存敏感型部署提供了参考范例,有助于推动后交互检索技术从实验室走向工业级落地。
衍生相关工作
围绕msmarco_lateon,学界与工业界衍生出一系列经典工作。一方面,研究者基于其精确MaxSim真值,探索更高效的近似最近邻搜索与向量量化策略,以缓解全量穷举的计算开销;另一方面,该数据集常被用作ColBERTv2、PLAID等后交互检索系统的评测基准,推动索引压缩与多向量剪枝技术的发展。此外,其提供的token级对齐信息也激发了词汇级检索可解释性与查询扩展机制的研究,进一步拓展了多向量检索的理论与应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务