遇见数据集

nlpai-lab/miracl-multilingual-triplets

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

MIRACL 51种语言三元组数据集是一个多语言检索和重排序数据集,用于训练密集检索、句子嵌入、重排序和跨语言搜索模型。它包含从MIRACL英文训练集派生的(查询、正例、负例)三元组。该数据集提供51种语言子集:原始英文数据和翻译成50种语言的数据。每个子集包含2,863个对齐的训练示例,具有相同id的行表示同一源三元组的翻译。对齐的(查询、正例、负例)结构支持多语言检索、多语言重排序、对比学习和困难负样本训练。数据格式为Parquet,子集包括51种语言代码(如en、ko、ja、zh、de、fr等),仅包含训练分割,每个子集行数为2,863,总行数跨子集为146,013。数据列包括id(跨语言子集共享的对齐标识符)、查询(搜索查询)、正例(与查询相关的段落)和负例(与查询无关的段落)。数据集基于MIRACL源数据集,使用google/translategemma-27b-it模型翻译,并遵循Apache-2.0许可证。

MIRACL Triplets in 51 Languages is a multilingual retrieval and reranking dataset for training dense retrieval, sentence embedding, reranker, and cross-lingual search models. It contains (query, positive, negative) triplets derived from the English training split of miracl/miracl. The dataset provides 51 language subsets: the original English data and translations into 50 languages. Each subset contains 2,863 aligned training examples, where rows with the same id represent translations of the same source triplet. The aligned (query, positive, negative) structure supports multilingual retrieval, multilingual reranking, contrastive learning, and hard-negative training. Format: Parquet. Subsets: 51 language codes including en, ko, ja, zh, de, and fr. Split: train. Rows per subset: 2,863. Total rows across subsets: 146,013. Columns: id (alignment identifier shared across language subsets), query (search query), positive (passage relevant to the query), negative (passage not relevant to the query). Source dataset: miracl/miracl, translated using google/translategemma-27b-it model, and released under Apache-2.0 license.

提供机构:
nlpai-lab
搜集汇总
数据集介绍
nlpai-lab/miracl-multilingual-triplets 数据集图片
构建方式
在多语言信息检索领域,高质量的训练数据对模型性能提升至关重要。MIRACL-multilingual-triplets数据集基于英文版MIRACL数据集的训练样本构建而成,利用强大的翻译模型google/translategemma-27b-it将原始的英文查询、相关段落与不相关段落三元组(query, positive, negative)独立翻译为50种目标语言,从而形成覆盖51种语言的对齐三元组。每个语言子集均包含2,863条训练样本,且所有子集中具有相同ID的行代表同一源三元组的翻译版本,确保了跨语言数据的高度一致性。
特点
该数据集的核心优势在于其多语言覆盖范围与对齐结构,涵盖从阿拉伯语、中文、日语到祖鲁语等51种资源丰瘠程度各异的语言。三元组形式(查询-正例-负例)专为对比学习、稠密检索和重排序任务设计,支持跨语言语义匹配与表示学习。所有样本均以Parquet格式存储,高效压缩且便于快速加载。此外,数据集遵循Apache-2.0开源协议,具备良好的学术与商业使用兼容性。
使用方法
研究者可通过HuggingFace Datasets库便捷加载所需语言子集,例如使用load_dataset函数指定语言代码'ko'即可获取韩语子集。默认加载英文子集作为入口。数据包含id、query、positive、negative四个字段,每个字段均为字符串或整型,可直接用于训练Sentence-BERT等双编码模型、跨语言检索系统或重排序器。建议根据任务需求选用单一语言子集进行单语训练,或利用对齐ID合并多语言数据进行跨语言迁移学习。
背景与挑战
背景概述
在跨语言信息检索与多语言自然语言处理领域,高质量的训练数据是推动模型能力的基石。MIRACL Multilingual Triplets数据集由研究人员基于MIRACL语料库构建,于近期发布,旨在填补多语言稠密检索与句子嵌入训练中缺乏对齐三元组数据的空白。该数据集覆盖51种语言,包含2,863组对齐的(查询,相关文档,不相关文档)三元组,通过机器翻译从英文种子数据扩展而来。其核心研究问题在于如何利用大规模翻译数据提升跨语言检索与重排序模型的表现,尤其服务低资源语言场景。该数据集对多语言对比学习、跨语言语义匹配及零样本检索任务具有重要推动作用,为多语言NLP社区提供了标准化训练资源。
当前挑战
该数据集所应对的领域挑战是多语言稠密检索中训练数据匮乏与语言间语义对齐的困难,尤其在低资源语言中,高质量标注三元组几乎不存在,阻碍了跨语言模型的泛化能力。构建过程中面临的挑战包括:依赖机器翻译模型生成多语言版本时,翻译准确性及语义保真度难以保证,可能导致三元组中的负样本与查询的语义边界模糊;同时,源自单一语言(英文)的查询与文档经翻译后,文化特定表达与知识背景的迁移可能产生歧义。此外,跨51种语言的对齐保持与格式统一也增加了数据质量控制的复杂性。
常用场景
经典使用场景
在跨语言信息检索与多语言自然语言处理领域,MIRACL多语言三元组数据集以其51种语言的平行结构,为稠密检索与句子嵌入模型的训练提供了坚实的基石。该数据集包含对齐的查询、相关段落与不相关段落三元组,使其成为对比学习范式的理想选择。研究者常利用这些三元组训练多语言稠密检索器,通过构建跨语言语义空间,实现查询与文档在不同语言间的精准匹配。同时,该数据集也被广泛用于多语言重排序任务,通过学习查询与候选文档的细粒度相关性,提升检索系统的精确度。其规整的三元组形式与大规模语言覆盖,为跨语言语义表征学习开辟了新的实验途径。
衍生相关工作
基于MIRACL三元组数据集,衍生出一系列影响深远的研究工作。在模型层面,研究者利用该数据训练了诸如mBERT-based与XLM-R-based的多语言稠密检索模型,并探索了联合对比学习与知识蒸馏的优化策略。在任务扩展方面,该数据集催生了跨语言段落重排序、多语言零样本检索等新方向,促进了多语言FAQ系统与跨语言实体检索的进步。此外,该数据集还作为基准被引入多语言语句嵌入的评估体系,其对齐的三元组结构激发了大量关于语言无关性表征学习的研究,为多语言自然语言处理领域注入了持续的动力与创新源泉。
数据集最近研究
最新研究方向
MIRACL多语言三元组数据集近期研究聚焦于跨语言稠密检索与对比学习的范式突破。当前前沿方向包括:利用其在51种语言中经过人工专家验证与机器翻译对齐的(查询,正例,负例)三元组结构,推动多语言句子嵌入模型的预训练与微调;探索基于翻译Gemma模型的高质量合成数据在低资源语言检索任务中的迁移效能;以及其在多语言重排序器与跨语言语义匹配场景下的基准评估价值。该数据集为构建统一的跨语言信息检索框架提供了关键训练资源,尤其支撑了多语言稠密检索模型从英语主导到覆盖祖鲁语、斯瓦希里语等稀缺语言的能力跃迁,对打破语言壁垒、实现全球知识平等获取具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务