遇见数据集

irds/mmarco_v2_vi_dev

收藏
Hugging Face2023-01-05 更新2024-03-04 收录
官方服务:

资源简介:

`mmarco/v2/vi/dev`数据集由`ir-datasets`包提供,主要用于文本检索任务。该数据集包含101,093个查询(即主题)和59,273个相关性评估。文档部分需要使用`irds/mmarco_v2_vi`数据集。用户可以通过Python代码加载并使用该数据集。

The `mmarco/v2/vi/dev` dataset, provided by the `ir-datasets` package, is primarily intended for text retrieval tasks. It contains 101,093 queries (i.e., topics) and 59,273 relevance judgments. The document corpus of this dataset requires the use of the `irds/mmarco_v2_vi` dataset. Users can load and utilize this dataset via Python code.

提供机构:
irds
原始信息汇总

数据集概述

数据集名称

mmarco/v2/vi/dev

数据来源

  • 原始数据集:irds/mmarco_v2_vi

任务类别

  • 文本检索

数据内容

  • queries(查询):数量为101,093
  • qrels(相关性评估):数量为59,273
  • docs(文档):使用irds/mmarco_v2_vi数据集

使用示例

python from datasets import load_dataset

queries = load_dataset(irds/mmarco_v2_vi_dev, queries) for record in queries: record # {query_id: ..., text: ...}

qrels = load_dataset(irds/mmarco_v2_vi_dev, qrels) for record in qrels: record # {query_id: ..., doc_id: ..., relevance: ..., iteration: ...}

引用信息

@article{Bonifacio2021MMarco, title={{mMARCO}: A Multilingual Version of {MS MARCO} Passage Ranking Dataset}, author={Luiz Henrique Bonifacio and Israel Campiotti and Roberto Lotufo and Rodrigo Nogueira}, year={2021}, journal={arXiv:2108.13897} }

搜集汇总
数据集介绍
irds/mmarco_v2_vi_dev 数据集图片
构建方式
在信息检索领域,多语言文本检索数据集的发展对于推动跨语言搜索技术至关重要。irds/mmarco_v2_vi_dev 数据集作为 mMARCO 项目的一部分,是基于广泛使用的 MS MARCO 语料库的越南语翻译版本构建而成。该数据集由 ir-datasets 包提供支持,专注于开发集(dev)的构建,包含 101,093 条查询(queries)和 59,273 条相关性评估(qrels)。其构建过程依托于对原始英文 MS MARCO 数据集的机器翻译与人工校验,确保了越南语版本在语义和检索任务上的可靠性。文档部分则通过关联 irds/mmarco_v2_vi 数据集实现完整性,从而形成一套标准化的多语言检索评估框架。
特点
该数据集的核心特点在于其专门针对越南语文本检索场景的优化设计。查询规模庞大,达到十万余条,覆盖了多样化的用户信息需求,为模型训练提供了丰富的样本空间。相关性评估(qrels)以三元组形式呈现,包含查询标识符、文档标识符和相关性等级,支持细粒度的检索性能度量。作为开发集,它专注于模型验证阶段,避免与训练集重叠,从而确保评估结果的客观性。此外,数据集遵循 ir-datasets 的标准化接口,便于与其他语言版本的 mMARCO 数据集成套使用,助力跨语言检索系统的对比研究。
使用方法
使用该数据集时,研究人员可通过 Hugging Face 的 datasets 库便捷加载。具体而言,利用 load_dataset 函数分别调用 'queries' 和 'qrels' 子集,即可获取包含查询文本和相关性标注的结构化数据。加载后的记录以字典格式呈现,查询子集提供 query_id 与 text 字段,而 qrels 子集包含 query_id、doc_id、relevance 及 iteration 字段,便于直接用于检索模型的训练或评估。文档部分需额外加载 irds/mmarco_v2_vi 数据集以补全检索语料库。整个流程无需手动下载,数据会以 Hugging Face 的标准格式自动缓存,显著降低了使用门槛。
背景与挑战
背景概述
跨语言信息检索是自然语言处理领域的重要研究方向,旨在突破语言壁垒,实现多语言环境下的高效信息获取。在此背景下,mMARCO数据集应运而生,由Luiz Henrique Bonifacio、Israel Campiotti、Roberto Lotufo和Rodrigo Nogueira等研究人员于2021年共同创建。该数据集是基于英文MS MARCO段落排序数据集的多语言扩展版本,覆盖包括越南语在内的多种语言,其中irds/mmarco_v2_vi_dev子集专注于越南语开发集,包含101,093条查询和59,273条相关性评估。其核心研究问题在于构建和评估跨语言检索模型,推动多语言信息检索技术的发展,对低资源语言的检索研究具有重要影响力。
当前挑战
该数据集面临的核心挑战在于多语言检索场景下的语义对齐问题。不同语言间的词汇、语法和语义差异导致查询与文档的匹配困难,尤其在越南语等低资源语言中,缺乏大规模预训练语料加剧了这一难题。构建过程中,研究人员需将英文MS MARCO的查询和文档通过机器翻译转换为越南语,但机器翻译的噪声和不准确性可能引入语义偏差,影响标注质量。此外,相关性判断的跨语言一致性难以保证,不同语言标注者可能对查询意图理解存在差异,导致qrels标注的可靠性面临考验。这些挑战限制了模型在真实多语言环境中的泛化能力。
常用场景
经典使用场景
在跨语言信息检索研究领域,irds/mmarco_v2_vi_dev数据集作为mMARCO多语言语料库的越南语开发集,承载着评估检索模型在低资源语言上泛化能力的重要使命。该数据集包含逾十万条查询与近六万条相关性标注,为研究者提供了在越南语场景下训练和验证神经检索模型的标准平台,尤其适用于测试基于预训练语言模型的零样本或少量样本迁移效果。通过在此开发集上对比不同检索架构的性能,学界得以洞悉多语言表示学习在信息检索中的实际瓶颈与突破方向。
解决学术问题
该数据集的核心学术贡献在于填补了越南语信息检索基准的空白,解决了长期以来非英语语言缺乏大规模、高质量检索评测数据的困境。它使得研究者能够系统性地探究多语言预训练模型在越南语上的检索有效性,并量化分析跨语言表示对齐中的语义偏差问题。借助此数据集,学界得以验证诸如mBERT、XLM-R等模型在低资源语言上的迁移能力,从而推动多语言信息检索理论从英语中心主义向真正多语化演进,为构建公平、包容的全球信息访问基础设施提供实证基础。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作,其中最经典的是mMARCO原始论文中提出的多语言检索基线,为后续研究奠定了评价标准。在此基础上,研究者开发了针对越南语的稠密检索模型,如基于DPR架构的跨语言变体,以及利用对比学习增强多语言段落表示的方法。此外,该数据集还被用于评估生成式检索模型在多语言场景下的表现,催生了诸如mT5-based检索器等创新架构。这些工作共同推动了多语言信息检索领域从稀疏表示向稠密化、跨语言对齐的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务