遇见数据集

SEACrowd/xl_sum

收藏
Hugging Face2024-06-24 更新2024-03-04 收录
官方服务:

资源简介:

XL-Sum是一个全面且多样化的数据集,包含来自BBC的100万篇专业注释的文章-摘要对。该数据集涵盖了从低资源到高资源的44种语言,包括东南亚地区的4种土著语言。

提供机构:
SEACrowd
原始信息汇总

数据集概述

XL-Sum是一个包含100万个专业注释的文章-摘要对的综合性和多样性数据集,源自BBC,通过精心设计的启发式方法提取。该数据集涵盖44种语言,包括4种东南亚地区的土著语言。

语言

  • 印尼语 (ind)
  • 缅甸语 (mya)
  • 泰语 (tha)
  • 越南语 (vie)
  • 英语 (eng)

支持的任务

  • 摘要生成 (Summarization)

数据集使用

使用 datasets

python from datasets import load_dataset dset = datasets.load_dataset("SEACrowd/xl_sum", trust_remote_code=True)

使用 seacrowd

python import seacrowd as sc

使用默认配置加载数据集

dset = sc.load_dataset("xl_sum", schema="seacrowd")

检查数据集的所有可用子集(配置名称)

print(sc.available_config_names("xl_sum"))

使用特定配置加载数据集

dset = sc.load_dataset_by_config_name(config_name="<config_name>")

数据集主页

https://github.com/csebuetnlp/xl-sum

数据集版本

  • 源版本: 2.0.0
  • SEACrowd版本: 2024.06.20

数据集许可证

Creative Commons Attribution Non Commercial Share Alike 4.0 (cc-by-nc-sa-4.0)

引用

如果您在使用XL-Sum数据集,请引用以下内容: bibtex @inproceedings{hasan2021xl, title={XL-Sum: Large-Scale Multilingual Abstractive Summarization for 44 Languages}, author={Hasan, Tahmid and Bhattacharjee, Abhik and Islam, Md Saiful and Mubasshir, Kazi and Li, Yuan-Fang and Kang, Yong-Bin and Rahman, M Sohel and Shahriyar, Rifat}, booktitle={Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021}, pages={4693--4703}, year={2021} }

@article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
构建方式
XL-Sum数据集由SEACrowd团队精心构建,其核心源自BBC新闻的百万级专业标注文章-摘要对。构建过程中,研究者设计了一套精细的启发式规则,从海量语料中筛选并提取高质量的长文本与对应摘要,确保了数据在跨语言场景下的多样性与鲁棒性。该数据集覆盖44种语言,涵盖从低资源到高资源的广泛谱系,尤其聚焦于东南亚地区的四种本土语言——印度尼西亚语、缅甸语、泰语和越南语,同时包含英语作为参照基准。通过系统化的标注流程与质量控制机制,每一对样本均经过专业验证,使得XL-Sum成为多语言抽象式摘要研究领域的重要基石。
使用方法
研究者可通过两种主要途径便捷地调用XL-Sum数据集。使用HuggingFace的datasets库时,仅需一行代码`datasets.load_dataset("SEACrowd/xl_sum", trust_remote_code=True)`即可完成加载,并自动获取多语言子集。若偏好SEACrowd生态,则可通过`seacrowd.load_dataset("xl_sum", schema="seacrowd")`实现集成式调用,并利用`available_config_names`方法查询所有可用配置名称,进而按需选择特定语言子集进行细粒度实验。两种方式均支持直接用于序列到序列模型的训练与评估,适配主流深度学习框架,显著降低了多语言摘要任务的研究门槛。
背景与挑战
背景概述
XL-Sum数据集由孟加拉国工程技术大学(CSEBUET)的研究团队于2021年创建,旨在应对多语言抽象式文本摘要领域资源分布不均的困境。该数据集从BBC新闻中精心提取了100万对经过专业标注的文章-摘要样本,覆盖44种语言,涵盖从低资源到高资源的广泛语种,尤其聚焦东南亚地区的四种本土语言(印尼语、缅甸语、泰语、越南语)及英语。其核心研究问题在于推动低资源语言的摘要技术发展,弥合语言鸿沟。自发布以来,XL-Sum已成为多语言摘要任务的重要基准,显著促进了跨语言自然语言处理研究的进步,并为后续如SEACrowd等区域性数据枢纽的构建提供了基础。
当前挑战
XL-Sum数据集面临的核心挑战在于多语言环境下摘要质量的评估与模型泛化能力的提升。领域问题上,低资源语言(如缅甸语)因缺乏充足的训练数据,导致抽象式摘要模型在语义保留和流畅性上表现欠佳,与高资源语言(如英语)存在显著差距。构建过程中,团队需设计复杂的启发式规则从BBC多语种文章中提取高质量摘要对,面临跨语言标注一致性、噪声过滤及版权合规等难题。此外,不同语言的语法结构与文化背景差异,使得自动评估指标(如ROUGE)难以准确反映摘要的真实质量,进一步加剧了模型优化的复杂性。
常用场景
经典使用场景
XL-Sum数据集为多语言抽象式文本摘要研究提供了大规模、高质量的基准资源。其囊括44种语言、百万级BBC新闻文章与专家摘要配对,尤其涵盖印尼语、缅甸语、泰语、越南语等东南亚低资源语言,使得跨语言摘要模型的训练与评估成为可能。研究者常借助该数据集构建统一的序列到序列框架,通过多任务学习或预训练语言模型微调,探究语言间语义表征的迁移与对齐,从而提升摘要生成在资源匮乏语言上的忠实度与流畅性。
解决学术问题
该数据集有效缓解了多语言摘要领域长期面临的数据稀缺与语言覆盖不均问题。在此之前,高资源语言如英语的摘要研究已臻成熟,而东南亚等低资源语言因缺乏标注语料而进展缓慢。XL-Sum通过系统化启发式抽取策略,确保了摘要的专业性与领域多样性,为跨语言泛化能力、零样本摘要以及语言间知识迁移等学术议题提供了实证基础,推动了多语言自然语言处理技术的公平性与包容性发展。
实际应用
在实际应用中,XL-Sum赋能了多语言新闻聚合与信息浓缩系统,使媒体平台能够自动生成不同语言版本的新闻摘要,极大提升了跨区域信息获取效率。例如,东南亚地区的多语种新闻报道可借助模型快速提炼核心内容,服务于国际舆情监测、多语言文档管理及智能问答助手等场景。此外,该数据集还支持低资源语言的机器翻译辅助摘要,助力缩小数字鸿沟,促进全球信息流通的便捷化与智能化。
数据集最近研究
最新研究方向
当前,多语言抽象摘要研究正从资源丰富语言向低资源语言拓展,尤其关注东南亚地区本土语言的表达与理解。XL-Sum作为覆盖44种语言、包含百万级BBC文章-摘要对的大规模数据集,为跨语言摘要模型的训练与评估提供了坚实基础。前沿方向聚焦于利用该数据集推动低资源语言(如印尼语、缅甸语、泰语、越南语)的摘要生成能力,探索语言间知识迁移与零样本学习的可行性。结合SEACrowd数据枢纽的整合,该数据集正被用于构建针对东南亚语言的统一基准,助力多模态、多任务模型的泛化性能提升。其意义在于弥合语言资源鸿沟,促进全球范围内的信息可及性与文化交流,为低资源自然语言处理应用开辟新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务