遇见数据集

PMIndiaData/PMIndiaSum

收藏
Hugging Face2023-11-09 更新2024-03-04 收录
官方服务:

资源简介:

PMIndiaSum是一个新的多语言和大规模并行的标题摘要语料库,专注于印度的语言。该语料库涵盖了四种语言家族、14种语言,以及迄今为止最大的196种语言对。它为所有跨语言对提供了测试平台。支持的任务包括印度的单语言、多语言和跨语言摘要。

PMIndiaSum is a new multilingual and massively parallel headline summarization corpus focused on languages in India. Our corpus covers four language families, 14 languages, and the largest to date, 196 language pairs. It provides a testing ground for all cross-lingual pairs. Supported tasks include monolingual, multilingual, and cross-lingual summarization for languages in India. The dataset includes training, testing, and validation data files for various languages. Data instances show examples of cross-lingual pairs, including source article URL, target article URL, article text, and article summary. The dataset can be sourced from the PMIndia website and is licensed under CC BY 4.0.

提供机构:
PMIndiaData
原始信息汇总

数据集卡片 for "PMIndiaSum"

数据集描述

概述

PMIndiaSum 是一个新的多语言和大规模并行标题摘要语料库,专注于印度语言。该语料库涵盖了四个语言家族,14种语言,以及迄今为止最大的196种语言对。它为所有跨语言对提供了测试平台。

支持的任务

支持印度语言的单语言、多语言和跨语言摘要。

语言

阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉地语、马拉雅拉姆语、曼尼普尔语、旁遮普语、奥里亚语、泰卢固语、泰米尔语、乌尔都语、英语

数据集结构

数据实例

我们展示了一个来自 PMIndiaSum 的泰卢固语-印地语跨语言对示例: json { "source_url": "https://www.pmindia.gov.in/te/news_updates/%E0%B0%8E%E0%B0%B2%E0%B0%95%E0%B1%8D%E0%B0%9F%E0%B1%8D%E0%B0%B0%E0%B0%BE%E0%B0%A8%E0%B0%BF%E0%B0%95%E0%B1%8D%E0%B0%B8%E0%B1%8D-%E0%B0%87%E0%B0%82%E0%B0%95%E0%B0%BE-%E0%B0%B8%E0%B0%AE%E0%B0%BE/", "target_url": "https://www.pmindia.gov.in/hi/news_updates/%E0%A4%AA%E0%A5%8D%E0%A4%B0%E0%A4%A7%E0%A4%BE%E0%A4%A8%E0%A4%AE%E0%A4%82%E0%A4%A4%E0%A5%8D%E0%A4%B0%E0%A5%80-%E0%A4%B6%E0%A5%8D%E0%A4%B0%E0%A5%80-%E0%A4%A8%E0%A4%B0%E0%A5%87%E0%A4%A8%E0%A5%8D-45/", "text": "ఎలక్ట్రానిక్స్, ఇంకా సమాచార సాంకేతిక విజ్ఞానం రంగంలో ద్వైపాక్షిక సహకారాన్ని పెంపొందింపచేయడంలో భారతదేశానికి మరియు అంగోలా కు మధ్య అవగాహనపూర్వక ఒప్పందాన్ని (ఎమ్ఒయు ను) గురించి ప్రధాన మంత్రి శ్రీ నరేంద్ర మోదీ అధ్యక్షతన జరిగిన కేంద్ర మంత్రివర్గ సమావేశం దృష్టి కి తీసుకువ‌చ్చారు. ఈ ఎమ్ఒయు ఇ-గవర్నెన్స్, సమాచార సాంకేతిక విజ్ఞాన సంబంధ విద్య కు అవసరమైన మానవ వనరుల వికాసం, సమాచార భద్రత, ఎలక్ట్రానిక్స్ హార్డ్ వేర్ తయారీ, ఐటి ఎంబెడెడ్ సాఫ్ట్ వేర్ ఇండస్ట్రీ, టెలిమెడిసిన్ తదితర రంగాలలో సన్నిహిత సహకారాన్ని పెంపొందింపచేయడానికి ఉద్దేశించినటువంటిది", "summary": "मंत्रिमंडल को इलेक्‍ट्रॉनिक्‍स एवं संचना प्रौद्योगिकी के क्षेत्र में द्विपक्षीय सहयोग के लिए भारत और अंगोला के बीच समझौता ज्ञापन से अवगत कराया गया" }

数据字段

  • source_url: 表示源文章URL的字符串
  • target_url: 表示目标文章URL的字符串
  • text: 包含文章文本的字符串
  • summary: 包含文章摘要的字符串

使用 hf-dataset 类加载数据集

python from datasets import load_dataset

dataset = load_dataset("PMIndiaData/PMIndiaSum", "hindi-telugu")

可以使用以下配置名称的任意组合作为第二个参数:

"assamese", "bengali", "english", "gujarati", "hindi", "kannada", "malayalm", "manipuri", "marathi", "punjabi", "odia", "telugu", "tamil", "urdu"

搜集汇总
数据集介绍
PMIndiaData/PMIndiaSum 数据集图片
构建方式
PMIndiaSum数据集源自印度政府官方网站PMIndia,通过系统化爬取与整理多语言新闻页面构建而成。研究者借鉴了PMIndia平行语料库的构建经验,针对14种印度语言(涵盖阿萨姆语、孟加拉语、古吉拉特语等)及其相互组合的196个语言对,提取新闻正文与对应标题作为摘要样本。数据以CSV格式组织,每条记录包含源链接、目标链接、文本内容及摘要字段,形成了迄今规模最大的跨语言摘要语料库之一,总量超过10万条。
使用方法
研究者可通过HuggingFace的datasets库便捷加载该数据集,指定语言对配置名称(如'hindi-telugu')即可获取对应子集。数据集预划分为训练、验证和测试三部分,支持直接用于单语摘要(如阿萨姆语-阿萨姆语)或跨语摘要(如泰卢固语-印地语)的模型训练。建议用户遵循CC BY 4.0许可协议,并在引用时注明原始论文,以促进印度语言自然语言处理领域的可复现研究。
背景与挑战
背景概述
在自然语言处理领域,多语言和跨语言摘要任务因语言资源分布不均而面临严峻挑战,尤其是对于印度这样拥有众多官方语言和方言的国家而言。PMIndiaSum数据集由Ashok Urlana、Pinzhen Chen、Zheng Zhao等研究人员于2023年提出,旨在填补印度语言摘要研究的空白。该数据集以印度总理官方网站(PMIndia)为数据源,覆盖阿萨姆语、孟加拉语、英语等14种语言,构建了迄今为止规模最大的196个跨语言摘要对,共计超过10万条样本。其核心研究问题聚焦于探索单语、多语及跨语言摘要模型在低资源印度语言上的表现,为相关领域提供了标准化的评测基准。该数据集的出现不仅推动了多语言摘要技术的发展,还促进了印度本土语言在信息处理领域的应用研究,对全球低资源语言摘要研究具有重要参考价值。
当前挑战
PMIndiaSum数据集所解决的核心领域挑战在于印度语言的多样性及其资源匮乏问题,包括14种语言间的语法结构差异、形态丰富性以及跨语言语义对齐的复杂性。在构建过程中,研究团队面临多重困难:首先,数据采集需从PMIndia网站爬取多语言平行新闻,但网站内容更新频率不一,导致部分语言对样本稀疏;其次,标题摘要的生成需确保跨语言一致性,例如泰卢固语到印地语的摘要需保留关键信息并符合目标语言表达习惯,人工校验成本高昂;此外,数据集划分需兼顾语言家族平衡(如印度-雅利安语系与达罗毗荼语系),避免模型偏见。这些挑战使得数据集在标注质量、语言覆盖度及跨语言泛化能力上仍需持续优化。
常用场景
经典使用场景
PMIndiaSum数据集为多语言与跨语言摘要研究提供了丰富的实验平台。其核心应用场景涵盖单语摘要、多语摘要及跨语言摘要三大任务,覆盖印度14种语言及196个语言对。研究者可通过该数据集训练模型,实现从源语言文本生成目标语言标题,例如将泰卢固语新闻摘要为印地语标题,从而在统一框架下评估不同语言组合下的摘要性能。该数据集的并行结构使其成为验证多语言预训练模型、零样本跨语言迁移能力以及低资源语言摘要效果的标准基准。
解决学术问题
PMIndiaSum解决了多语言与跨语言摘要研究中长期存在的语料匮乏问题,特别是在印度语言这一高复杂度语言区域。此前,跨语言摘要研究多聚焦于英语与其他高资源语言,而该数据集覆盖了四种语系与多种低资源语言,为探索语言多样性下的摘要泛化能力提供了关键支撑。它推动了学术研究从单语言摘要向多语言与跨语言场景的延伸,使研究者得以系统分析语言相似性、资源均衡性及模型结构对跨语言摘要质量的影响,进而促进了多语言自然语言处理理论的完善。
实际应用
在实际应用中,PMIndiaSum数据集可支撑新闻媒体平台的多语言内容生产,例如自动将政府新闻稿摘要并翻译为多种印度地区语言,提升信息传播效率。它还能辅助构建多语言问答系统与信息检索工具,帮助用户快速获取跨语言新闻要点。此外,该数据集对低资源语言的支持使其在电子政务、教育翻译及跨文化沟通等场景中具有重要价值,例如为偏远地区提供本地化新闻摘要服务,缩小数字鸿沟。
数据集最近研究
最新研究方向
PMIndiaSum数据集聚焦于印度次大陆多语言与跨语言摘要的前沿探索,其研究核心在于构建覆盖14种印度语言和196个语言对的大规模平行标题摘要语料库。该数据集顺应了自然语言处理领域对低资源语言多模态理解的迫切需求,尤其针对阿萨姆语、曼尼普尔语等代表性不足的语言,为多语言摘要模型提供了统一的评估基准。近期研究热点集中于利用该语料库训练跨语言生成式预训练模型,探索语言族间知识迁移的机制,并验证其在印度官方语言与英语间的零样本摘要能力。这一工作不仅推动了多语言信息压缩技术的边陲,更与印度政府推动的数字语言平等倡议紧密呼应,为弥合数字鸿沟、实现包容性语言技术提供了关键基础设施,其影响力已延伸至南亚多语言信息检索与新闻聚合等应用场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务