遇见数据集

miracl/miracl

收藏
Hugging Face2024-12-29 更新2024-03-04 收录
官方服务:

资源简介:

MIRACL(跨语言连续体的多语言信息检索)是一个多语言检索数据集,专注于18种不同语言的搜索,这些语言在全球范围内拥有超过30亿的母语使用者。该数据集包含16种已知语言的收集数据,另外2种惊喜语言的数据将在稍后发布。数据集的主题由每种语言的母语者生成,并且他们还会标记主题与给定文档列表之间的相关性。该存储库仅包含MIRACL的主题和qrels。数据集的结构包括主题和qrels,分别以.tsv和标准TREC格式保存。

MIRACL (Multilingual Information Retrieval across the Cross-Language Continuum) is a multilingual information retrieval dataset focused on search across 18 distinct languages, which collectively have over 3 billion native speakers worldwide. The dataset contains curated data for 16 languages, while data for the remaining 2 surprise languages will be released at a later date. Dataset topics are generated by native speakers of each respective language, who also annotate the relevance between the topics and the provided document list. This repository only contains the topics and qrels of MIRACL. The dataset structure includes topics and qrels, which are saved in .tsv format and standard TREC format respectively.

提供机构:
miracl
原始信息汇总

数据集卡片 for MIRACL (Topics and Qrels)

数据集描述

MIRACL (Multilingual Information Retrieval Across a Continuum of Languages) 是一个多语言检索数据集,专注于搜索18种不同语言,这些语言共同覆盖了全球超过30亿母语使用者。

该数据集包含16种“已知语言”的集合数据。剩余的2种“惊喜语言”将在稍后发布。

主题由每种语言的母语使用者生成,他们还标记了主题与给定文档列表之间的相关性。

本仓库仅包含MIRACL的主题和qrels。集合数据可以在这里找到。

数据集结构

  1. 下载文件:

    • miracl-v1.0-{lang}/topics文件夹下,主题以.tsv格式保存,每行格式为:

      qid query

    • miracl-v1.0-{lang}/qrels文件夹下,qrels以标准TREC格式保存,每行格式为:

      qid Q0 docid relevance

  2. 使用HuggingFace datasets访问数据: python lang=ar # 或任何16种语言之一 miracl = datasets.load_dataset(miracl/miracl, lang, use_auth_token=True)

    训练集:

    for data in miracl[train]: # 或 dev, testA query_id = data[query_id] query = data[query] positive_passages = data[positive_passages] negative_passages = data[negative_passages]

    for entry in positive_passages: # 或 negative_passages docid = entry[docid] title = entry[title] text = entry[text]

    train, dev, 和 testA 集的结构相同,其中 testA 仅存在于Mr. TyDi语言(即阿拉伯语、孟加拉语、英语、芬兰语、印度尼西亚语、日语、韩语、俄语、斯瓦希里语、泰卢固语、泰语)中。 注意,negative_passages 也是由母语使用者标注的,而不是来自前k检索结果的非正样本。

数据集统计

下表包含每种语言的查询数量(#Q)和判断数量(#J),包括训练集和开发集,其中判断包括正样本和负样本。

语言 训练集 开发集
#Q #J #Q #J
ar 3,495 25,382 2,896 29,197
bn 1,631 16,754 411 4,206
en 2,863 29,416 799 8,350
es 2,162 21,531 648 6,443
fa 2,107 21,844 632 6,571
fi 2,897 20,350 1,271 12,008
fr 1,143 11,426 343 3,429
hi 1,169 11,668 350 3,494
id 4,071 41,358 960 9,668
ja 3,477 34,387 860 8,354
ko 868 12,767 213 3,057
ru 4,683 33,921 1,252 13,100
sw 1,901 9,359 482 5,092
te 3,452 18,608 828 1,606
th 2,972 21,293 733 7,573
zh 1,312 13,113 393 3,928
搜集汇总
数据集介绍
构建方式
MIRACL(Multilingual Information Retrieval Across a Continuum of Languages)是一个面向多语言检索的数据集,覆盖18种语言,其构建过程严谨而精细。数据集的查询(Topics)由每种语言的母语者生成,确保了查询的自然性和语言地道性。同时,这些母语者对查询与给定文档列表之间的相关性进行标注,生成了正例和负例的判断(Qrels),其中负例并非简单的非正例检索结果,而是经过人工精心筛选。该数据集包含了16种已知语言的语料,而剩余的两种惊喜语言则留待后续发布。数据以标准TREC格式存储查询和相关性判断,便于研究者直接使用。
特点
MIRACL数据集的核心特点在于其多语言覆盖的广泛性和标注的专业性。它涵盖了阿拉伯语、孟加拉语、英语等18种语言,服务于全球超过三十亿母语人口,为跨语言信息检索研究提供了宝贵的资源。每个语言的查询和相关性判断均由母语者生成,保证了数据的高质量和语言真实性。此外,训练集、开发集和测试集的划分细致,其中测试集A仅存在于Mr. TyDi项目涉及的11种语言中。数据集还提供了丰富的统计信息,如各语言的查询数量和判断数量,为模型评估提供了清晰的基准。
使用方法
使用MIRACL数据集的方法灵活多样。研究者可直接通过HuggingFace的datasets库加载数据,指定目标语言代码(如'ar'表示阿拉伯语),并利用认证令牌访问。加载后的数据包含查询ID、查询文本、正例段落和负例段落,每个段落包含文档ID、标题和文本内容。训练集、开发集和测试集的结构一致,便于模型训练和评估。此外,数据也以TSV和TREC格式文件形式提供,可直接下载使用。这种多接口的设计极大地方便了不同研究需求的用户,无论是进行模型微调还是评估检索性能。
背景与挑战
背景概述
MIRACL(Multilingual Information Retrieval Across a Continuum of Languages)是一个由多语言信息检索领域的研究人员于2022年创建的多语言检索数据集,其核心研究问题在于跨越语言壁垒实现高效的文档检索。该数据集由来自全球多个机构的研究团队共同开发,覆盖阿拉伯语、孟加拉语、英语、西班牙语等18种语言,这些语言的总使用人口超过三十亿。MIRACL的诞生填补了多语言检索领域缺乏高质量、大规模标注数据集的空白,为评估和推动跨语言信息检索系统的性能提供了重要基准。其研究影响力体现在,它首次系统性地涵盖了从高资源到低资源的多种语言,并通过母语者生成的查询和人工标注的相关性判断,确保了数据集的真实性和可靠性。该数据集的发布促进了多语言检索技术的进步,尤其在低资源语言上的表现评估,为相关领域的研究奠定了坚实基础。
当前挑战
MIRACL数据集面临的核心挑战在于解决多语言检索中的跨语言语义鸿沟问题,即如何在语言结构、词汇和语法差异巨大的情况下,实现准确的文档与查询匹配。具体挑战包括:第一,语言多样性带来的检索难度,例如从形态丰富的芬兰语到字符复杂的日语,不同语言的特征差异要求检索模型具备高度的泛化能力。第二,低资源语言(如斯瓦希里语、泰卢固语)的标注数据相对稀缺,限制了模型在这些语言上的性能提升。第三,构建过程中,研究者需克服母语者标注成本高昂、一致性难以保证的问题,同时确保负面样本(negative passages)的标注质量,而非简单依赖检索结果中的非相关文档。此外,数据集的评估指标需要适应多语言场景,避免高资源语言主导模型优化方向,从而确保检索系统在全部18种语言上的公平性。
常用场景
经典使用场景
MIRACL数据集作为多语言信息检索领域的标杆性资源,其经典使用场景集中于跨语言文档检索任务的训练与评估。研究者利用该数据集构建和微调基于深度学习的检索模型,如双编码器架构的密集检索系统,旨在跨越阿拉伯语、孟加拉语、英语等18种语言的高维语义空间,实现查询与文档的精准匹配。该数据集由母语者精心标注的查询与相关性判断构成,特别适用于零样本跨语言迁移学习场景,为模型在低资源语言上的泛化能力提供了可靠的测试基准。
实际应用
在实际应用中,MIRACL数据集驱动的检索技术被广泛部署于多语言搜索引擎、跨国知识库问答系统以及全球化数字图书馆平台。例如,企业级搜索产品利用基于该数据集训练的模型,能够同时处理阿拉伯语法律文档、日语技术手册与斯瓦希里语社区内容,实现跨语言信息的无缝获取。此外,该数据集还支撑了国际组织的多语言信息管理系统,助力人道主义救援中的实时文档检索、多语种舆情监控以及跨文化交流中的知识发现。
衍生相关工作
MIRACL数据集衍生了一系列开创性研究工作,包括Mr. TyDi基准测试的构建,该工作首次系统评估了多语言密集检索模型在11种语言上的表现,并揭示了语言资源差异对检索性能的影响。后续研究如基于对比学习的多语言检索预训练方法、跨语言知识蒸馏框架以及面向低资源语言的检索增强生成模型,均以MIRACL作为核心评测集。这些工作不仅深化了对多语言语义匹配机制的理解,还催生了如mBERT、XLM-R等多语言预训练模型在检索任务中的适配方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务