遇见数据集

IndicRAGSuite

收藏
arXiv2025-06-03 更新2025-11-28 收录
官方服务:

资源简介:

IndicRAGSuite是一个针对印度语言RAG系统的数据集,包括IndicMSMarco,一个用于评估13种印度语言检索质量和响应生成的多语言基准。该数据集还包括从19种印度语言的维基百科中提取的约1400万个(问题、答案、相关段落)三元组。数据通过利用先进的语言模型生成,并包括MS MARCO数据集的翻译版本,以确保与现实世界的信息检索任务保持一致。

IndicRAGSuite is a dataset dedicated to Indian language Retrieval-Augmented Generation (RAG) systems. It includes IndicMSMarco, a multilingual benchmark for evaluating retrieval quality and response generation across 13 Indian languages. Additionally, the dataset contains approximately 14 million (question, answer, relevant passage) triples extracted from Wikipedia articles spanning 19 Indian languages. The data was generated using state-of-the-art language models, and incorporates translated versions of the MS MARCO dataset to ensure consistency with real-world information retrieval tasks.

创建时间:
2025-06-02
搜集汇总
数据集介绍
IndicRAGSuite 数据集图片
构建方式
IndicRAGSuite的构建源于对印度语言检索增强生成系统基础设施缺失的深刻洞察。其核心包含两个互补部分:其一,从MS MARCO开发集中精选1000条涵盖科学、历史等多元主题的查询,借助LLaMA 3.3 70B模型自动翻译为13种印度语言,再经母语专家逐条进行语义准确性、流畅性和命名实体保留的人工校验与修正,形成IndicMSMarco基准测试集。其二,利用19种印度语言的维基百科语料,通过WikiExtractor提取段落,剔除过短或过长的片段后,采用LLaMA 3.3 70B为每段生成三个包含问题、答案及推理解释的三元组,产出约1400万条训练数据。此外,还利用IndicTrans3-beta翻译模型将完整MS MARCO训练和验证集段落结构无损地转化为14种印度语言版本,进一步丰富训练语料。
特点
该数据集展现出卓越的多语言覆盖与规模优势,涵盖19种印度语言,训练数据总量达2600万条,远超现有资源。在质量层面,IndicMSMarco通过人工校验确保了翻译的语义保真度和文化适应性,而维基百科生成的三元组创新性地引入了推理解释成分,迫使模型超越浅层关键词匹配进行深层语义推理。翻译版MS MARCO则保留了原版真实搜索查询的意图和段落级连贯性,不同于此前按句子分割导致语义碎片化的方法。三种数据源互为补充:基准测试提供标准化评估尺度,维基百科数据确保主题多样性,翻译数据维持现实查询特征,共同构建起一个从训练到评测的完整生态。
使用方法
研究人员可直接利用此数据集进行多语言稠密检索模型的训练与评估。在训练阶段,可将维基百科生成的三元组与翻译版MS MARCO结合,用于微调mDPR、mContriever或mE5等现有架构,通过对比学习捕捉跨语言语义关系。在评测阶段,使用IndicMSMarco基准测试集,以平均倒数排名(MRR)作为指标,在13种语言上对标BGE-M3或多语言e5系列等前沿模型的表现。数据集以标准三元组格式存储,便于集成至Hugging Face Datasets等常用框架。针对低资源语言如阿萨姆语和奥里亚语,可优先采用更高比例的维基百科数据进行增强训练,以弥补领域覆盖不足。
背景与挑战
背景概述
在信息检索领域,检索增强生成(RAG)系统通过整合外部知识显著提升了语言模型在复杂问答任务中的表现。然而,印度次大陆拥有多达数十种官方语言及数百种方言,其语言体系的多样性与数字资源的匮乏形成了鲜明对比。由印度理工学院马德拉斯分校、AI4Bharat及微软联合研究团队于2024年发布的IndicRAGSuite数据集,正是为破解这一困局而诞生。该数据集涵盖19种印度语言,包含约2600万条数据,旨在解决低资源印度语言场景下RAG系统训练数据与评估基准的双重缺失问题。其构建不仅创造了大规模的多语言检索训练语料,还通过人工精校的IndicMSMarco基准(覆盖13种语言)为跨语言检索效果评估提供了标准化平台,对推动印度本土语言信息处理技术走向实用化具有重要意义。
当前挑战
IndicRAGSuite面临的核心挑战源于印度语言生态的内在复杂性与资源结构性短缺的叠加效应。首先,在领域问题层面,现有检索模型(如mDPR、mContriever)在印度语言上的表现远逊于英语,原因是缺乏高质量的多语言训练数据——英语数据集动辄百万级查询对,而印度语言数据集仅存千级规模。更严峻的是,印度语言在脚本多样性(如天城文、泰米尔文与孟加拉文系统迥异)、方言变体及领域术语标准化方面存在鸿沟。在数据集构建过程中,研究者遭遇了双重技术壁垒:一是从19种语言维基百科中利用大模型生成问答三元组时,需确保推理逻辑的语义保真度,避免上下文碎片化;二是对MSMARCO进行人工翻译校准时,需在13种语言中平衡查询意图保留与文化适应性的矛盾——例如印地语中'血型'的医学表述需同时兼顾本土习惯与术语精确性。此外,阿萨姆语、奥里亚语等低资源语言的数字语料极其稀缺,导致过滤后有效数据量不足原始语料的60%。
常用场景
经典使用场景
在信息检索与自然语言处理的交叉领域,IndicRAGSuite为面向印度语言的检索增强生成系统提供了不可或缺的基础设施。其经典使用场景聚焦于多语言稠密检索模型的训练与评估,研究者可借助其中包含的IndicMSMarco基准测试集,在13种主要印度语言上系统性地衡量检索质量与响应生成能力。该数据集通过人工翻译与校验,确保了语义保真度与语言自然性,使得在印地语、泰米尔语、泰卢固语等语言上的检索性能对比成为可能,为多语言信息检索研究树立了标准化标杆。
实际应用
在实际应用层面,IndicRAGSuite为印度多语言搜索引擎、数字图书馆、知识问答系统及政务信息平台提供了关键支撑。通过在13种语言上覆盖科学、历史、健康与技术等广泛主题,该数据集使构建能够理解并回应用户本地语言查询的检索系统成为现实。例如,在医疗领域,系统可准确检索并生成关于疾病症状的印地语回答;在教育领域,学生可用母语查询概念知识。这种能力显著提升了非英语用户获取信息的可达性与公平性,推动了印度数字包容性进程。
衍生相关工作
IndicRAGSuite的发布催生了一系列相关经典工作。首先,它启发了更大规模印度语言稠密检索模型的训练探索,如基于该数据集微调的mE5与BGE-M3系列模型在多项基准上取得领先。其次,其人工注释的IndicMSMarco基准刺激了跨语言检索的负样本挖掘与对比学习方法研究。此外,数据集中的维基百科推理三元组结构被后续工作借鉴,用于生成更具解释性的问答对,推动了可解释检索增强生成的发展。最后,该工作引出的混合数据集构建策略(合成数据与翻译数据结合)成为低资源语言检索研究的通用范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务