遇见数据集

castorini/mr-tydi-corpus

收藏
Hugging Face2022-10-12 更新2024-03-04 收录
官方服务:

资源简介:

Mr. TyDi是一个多语言基准数据集,基于TyDi构建,涵盖11种类型多样的语言,包括阿拉伯语、孟加拉语、英语、芬兰语、印尼语、日语、韩语、俄语、斯瓦希里语、泰卢固语和泰语。该数据集专门用于单语检索,特别是评估学习到的密集表示的排名。数据集的唯一配置是语言,所有三个折叠(训练、开发和测试)共享相同的语料库,因此每个语言下只有一个训练折叠。

Mr. TyDi is a multilingual benchmark dataset built upon TyDi, covering 11 diverse languages including Arabic, Bengali, English, Finnish, Indonesian, Japanese, Korean, Russian, Swahili, Telugu, and Thai. It is specifically designed for monolingual retrieval tasks, particularly for evaluating the ranking of learned dense representations. The only configurable aspect of this dataset is language; all three folds (training, development, and test) share the same corpus, thus there is only one training fold per language.

提供机构:
castorini
原始信息汇总

数据集概述

Mr. TyDi 是一个多语言基准数据集,基于 TyDi,涵盖了十一种类型多样的语言。它专门设计用于单语言检索,特别是评估使用学习密集表示的排名。

数据集结构

数据集的唯一配置是 language。由于所有三个折叠(train、dev 和 test)共享相同的语料库,每个语言下只有一个 train 折叠,与 castorini/mr-tydi 不同。

文档数据条目的示例如下: json { docid: 25#0, title: Autism, text: Autism is a developmental disorder characterized by difficulties with social interaction and communication, ... }

加载数据集

加载数据集的示例如下: python language = english dataset = load_dataset(castorini/mr-tydi-corpus, language, train)

引用信息

plaintext @article{mrtydi, title={{Mr. TyDi}: A Multi-lingual Benchmark for Dense Retrieval}, author={Xinyu Zhang and Xueguang Ma and Peng Shi and Jimmy Lin}, year={2021}, journal={arXiv:2108.08787}, }

搜集汇总
数据集介绍
构建方式
Mr. TyDi语料库是基于多语言基准数据集TyDi构建而成的,覆盖了阿拉伯语、孟加拉语、英语、芬兰语、印尼语、日语、韩语、俄语、斯瓦希里语、泰卢固语和泰语等十一种类型学上极具多样性的语言。该数据集专为单语检索任务设计,旨在评估基于学习的稠密表示在排序中的表现。其语料库仅包含一个名为“train”的分割,因为训练、验证和测试三个子集共享同一份文档集合。每条文档记录由文档标识符、标题和文本内容三个字段组成,结构简洁明了。
特点
该数据集的核心特点在于其多语言覆盖的广度和类型学多样性,涵盖了从闪含语系到南岛语系的多种语言,为跨语言和单语检索研究提供了丰富的测试场景。与传统的检索数据集不同,Mr. TyDi专注于稠密检索方法的评估,强调通过神经网络学习到的向量表示来捕捉语义相关性。此外,语料库与查询和判断数据分离存储,用户需通过另一个数据集获取完整评测资源,这种设计便于独立管理和更新不同组件。
使用方法
使用时,用户需通过HuggingFace的datasets库加载指定语言的语料库。例如,对于英语,可以执行`load_dataset('castorini/mr-tydi-corpus', 'english', 'train')`来获取文档。由于语料库仅包含一个分割,加载时需明确指定语言参数和'train'分割。查询和相关性判断则需要从配套的`castorini/mr-tydi`数据集中获取,从而实现完整的检索评测流程。建议用户结合官方提供的引用信息,确保在学术工作中正确引用该基准数据集。
背景与挑战
背景概述
Mr. TyDi是由加拿大滑铁卢大学Jimmy Lin团队于2021年创建的多语言密集检索基准数据集,其研究核心在于评估基于稠密向量表示(dense representations)的跨语言信息检索能力。该数据集以TyDi为基础,覆盖阿拉伯语、孟加拉语、英语等11种类型学差异显著的语言,旨在推动多语言文本检索领域从传统稀疏方法向神经密集方法的范式迁移。作为首个系统评估多语言密集检索的标准化资源,Mr. TyDi对低资源语言的信息获取、跨语言知识共享以及多语言预训练模型(如mBERT、XLM-R)的检索性能验证产生了深远影响,为构建真正通用的多语言搜索引擎奠定了实验基础。
当前挑战
该数据集面临的核心挑战包括:1)跨语言语义对齐难题——不同语言间的词汇形态与句法结构差异导致密集检索模型难以学习到语言无关的通用表示,尤其在形态丰富的芬兰语、泰卢固语等语言上表现脆弱;2)低资源语言数据稀缺性——尽管覆盖11种语言,但部分语言(如斯瓦希里语、泰语)的文档与查询规模远低于英语,模型易陷入对高资源语言的过拟合陷阱;3)构建过程中需处理TyDi原始数据中噪声标注(如不匹配的查询-文档对)与文档长度分布不均问题,同时保证多语言语料库在跨语言检索场景下的公平性评估标准统一,避免因语言特性差异引入评估偏差。
常用场景
经典使用场景
Mr. TyDi 数据集专为多语言密集检索任务而设计,其经典使用场景在于评估和训练基于稠密向量表示的跨语言信息检索系统。该数据集覆盖阿拉伯语、孟加拉语、英语等十一种类型多样的语言,为研究者提供了统一的文档集合,使其能够在单一语言内构建和测试检索模型。通过将查询与相关文档映射至共享的语义空间,Mr. TyDi 成为衡量密集检索性能的标杆,尤其适用于对比不同语言下稠密表示学习的效果。
衍生相关工作
Mr. TyDi 数据集衍生了一系列经典工作,包括基于该基准提出的多语言密集检索模型(如 ColBERT 的多语言变体)以及跨语言表示学习方法的改进。研究者利用该数据集验证了多语言预训练语言模型(如 mBERT 和 XLM-R)在检索任务中的迁移能力,并催生了针对低资源语言的检索增强生成技术。此外,该数据集还推动了多语言检索评估框架的标准化,为后续如 XOR-TyDi 等跨语言检索研究的开展奠定了基准。
数据集最近研究
最新研究方向
Mr. TyDi语料库作为多语言稠密检索领域的标杆性数据集,其前沿研究聚焦于跨语言语义匹配与低资源语言检索能力的突破。当前热点方向包括利用预训练语言模型(如mBERT、XLM-R)构建跨语言稠密向量表示,以解决传统稀疏检索在形态丰富语言中词汇不匹配的瓶颈。该数据集覆盖十一种类型学差异显著的语言(如斯瓦希里语、泰卢固语等),为评估模型在零样本跨语言迁移、多语言知识蒸馏以及多任务联合训练中的泛化性能提供了关键基准。其影响力体现在推动了神经检索架构从单语向多语生态的演进,尤其在法律、医疗等对检索精度敏感的领域,为构建公平且高效的多语言信息获取系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务