遇见数据集

SEACrowd/m3ls

收藏
Hugging Face2024-06-24 更新2024-06-29 收录
官方服务:

资源简介:

M3LS数据集是一个多语言多模态摘要数据集,包含超过一百万个文档-图像对,并为每对提供了专业注释的多模态摘要。该数据集来源于英国广播公司(BBC)过去十年发布的新闻文章,涵盖20种语言,其中印尼语是唯一可用的东南亚语言。数据集支持摘要生成和图像描述任务。

M3LS数据集是一个多语言多模态摘要数据集,包含超过一百万个文档-图像对,并为每对提供了专业注释的多模态摘要。该数据集来源于英国广播公司(BBC)过去十年发布的新闻文章,涵盖20种语言,其中印尼语是唯一可用的东南亚语言。数据集支持摘要生成和图像描述任务。

提供机构:
SEACrowd
原始信息汇总

M3Ls 数据集概述

数据集简介

M3Ls(多语言多模态摘要数据集)包含超过一百万个文档-图像对,每个对都附有专业注释的多模态摘要。该数据集源自英国广播公司(BBC)在过去十年中发布的文章,涵盖20种语言,其中印尼语是唯一包含的东南亚语言。

语言

  • 印尼语(ind)

支持的任务

  • 摘要生成
  • 图像描述

数据集使用

使用 datasets

python from datasets import load_dataset dset = datasets.load_dataset("SEACrowd/m3ls", trust_remote_code=True)

使用 seacrowd

python import seacrowd as sc

使用默认配置加载数据集

dset = sc.load_dataset("m3ls", schema="seacrowd")

查看数据集的所有可用子集(配置名称)

print(sc.available_config_names("m3ls"))

使用特定配置加载数据集

dset = sc.load_dataset_by_config_name(config_name="<config_name>")

数据集主页

https://github.com/anubhav-jangra/M3LS/tree/main

数据集版本

  • 源版本:1.0.0
  • SEACrowd版本:2024.06.20

数据集许可证

MIT (mit)

引用

plaintext @inproceedings{verma-etal-2023-large, title = "Large Scale Multi-Lingual Multi-Modal Summarization Dataset", author = "Verma, Yash and Jangra, Anubhav and Verma, Raghvendra and Saha, Sriparna", editor = "Vlachos, Andreas and Augenstein, Isabelle", booktitle = "Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics", month = may, year = "2023", address = "Dubrovnik, Croatia", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2023.eacl-main.263", doi = "10.18653/v1/2023.eacl-main.263", pages = "3620--3632", }

@article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
SEACrowd/m3ls 数据集图片
构建方式
多语言多模态摘要数据集(M3LS)的构建源于对英国广播公司(BBC)跨越十年间新闻文章的系统性采集与处理。该数据集包含超过一百万对文档-图像实例,每对实例均附有经过专业标注的多模态摘要。数据构建过程中,研究者从BBC发布的新闻内容中提取文本与图像,并组织专业标注人员为每一对生成高质量的摘要,从而确保数据在语义与视觉层面的一致性。数据集覆盖20种语言,其中印度尼西亚语是唯一纳入的东南亚语言,体现了其在多语言研究中的独特定位。
使用方法
M3LS数据集可通过两种方式便捷调用。用户可直接利用HuggingFace的datasets库,通过`load_dataset("SEACrowd/m3ls", trust_remote_code=True)`命令加载默认配置的完整数据集。亦可使用SEACrowd专用库,首先通过`sc.load_dataset("m3ls", schema="seacrowd")`加载数据,再借助`sc.available_config_names("m3ls")`查看所有可用子集,最后通过`sc.load_dataset_by_config_name(config_name="<config_name>")`按需获取特定配置的数据。两种方法均简化了数据加载流程,便于研究者快速开展实验。
背景与挑战
背景概述
多语言多模态摘要任务近年来受到广泛关注,其核心目标在于融合文本与视觉信息生成凝练且语义丰富的摘要。SEACrowd/m3ls数据集(M3LS)由Yash Verma、Anubhav Jangra等研究人员于2023年在欧洲计算语言学协会(EACL)会议上提出,旨在解决大规模多语言多模态摘要资源匮乏的问题。该数据集基于英国广播公司(BBC)十余年的新闻文章构建,包含超过百万个文档-图像对,每一对均配有专业标注的多模态摘要,覆盖20种语言,其中印度尼西亚语是唯一的东南亚语言代表。M3LS的发布为跨语言与跨模态摘要研究提供了高覆盖度、高质量的基础资源,有力推动了该领域在低资源语言场景下的发展。
当前挑战
M3LS数据集面临的核心挑战包括:其一,多语言多模态摘要任务本身具有高度复杂性,模型需同时理解文本与图像的语义关联,并生成在不同语言间保持信息一致性的摘要,这对跨模态对齐与跨语言迁移能力提出严苛要求。其二,在构建过程中,数据来源于BBC新闻的长期积累,尽管覆盖20种语言,但各语言样本分布极不均衡,东南亚语言仅包含印度尼西亚语,导致模型在低资源语言上的泛化能力受限。此外,大规模数据的手动标注成本高昂,且需确保摘要的专业性与多模态一致性,这对标注流程与质量控制构成了显著挑战。
常用场景
经典使用场景
M3LS(多语言多模态摘要数据集)以其庞大的规模与丰富的语言覆盖,成为跨语言与跨模态摘要研究的基准平台。该数据集囊括了英国广播公司(BBC)逾十年间发布的逾百万篇新闻文档-图像对,并为每一对提供了专业标注的多模态摘要。其中,印尼语作为唯一的东南亚语言代表,为区域语言处理研究提供了宝贵资源。经典应用场景包括多语言文本摘要、图像描述生成以及多模态信息融合,研究者可基于该数据集训练模型,使其同时理解文本与视觉内容,并生成凝练且语义完整的摘要,从而推动跨语言、跨模态的自然语言生成技术迈向新高度。
解决学术问题
M3LS数据集直面多语言多模态摘要领域长期存在的两大瓶颈:数据稀缺与语言覆盖不均。以往的多模态摘要研究多聚焦于英语,而M3LS通过涵盖20种语言,显著拓展了研究的语言边界,尤其是填补了印尼语等低资源语言在多模态摘要领域的空白。该数据集解决了如何在大规模、多语言场景下有效对齐文本与图像信息、并生成高质量摘要的学术难题。其发布激发了关于跨语言表征学习、多模态对齐机制以及低资源语言摘要模型泛化能力的深入探讨,为构建真正意义上全球化的多模态理解系统奠定了数据基础。
实际应用
在实际应用层面,M3LS推动了新闻聚合与智能信息分发系统的革新。基于该数据集训练的模型能够自动为多语言新闻文章生成图文并茂的摘要,极大提升了跨语种新闻简报的生成效率,助力媒体机构实现全球化内容快速编译。此外,该数据集还可服务于教育领域的多语言学习辅助工具,通过生成带图像的摘要帮助学生快速把握文章主旨。在商业场景中,企业可利用相关技术对多语种产品文档、市场报告进行自动化摘要与可视化呈现,优化信息检索与决策支持流程,从而降低人工处理成本。
数据集最近研究
最新研究方向
在跨语言多模态摘要生成领域,M3LS数据集的出现为低资源语言的研究注入了强劲动力。该数据集源自BBC长达十年的新闻档案,涵盖了包括印尼语在内的20种语言,提供了超过百万对文档-图像实例及其专业标注的多模态摘要。当前前沿研究聚焦于如何利用这一大规模语料,突破传统单语言或单模态模型的局限,探索视觉与文本信息的深度融合机制。相关热点事件包括东南亚语言在自然语言处理领域的崛起,以及多模态大模型在新闻摘要、图像描述等任务中的广泛应用。M3LS不仅为印尼语等东南亚语言提供了稀缺的高质量训练资源,更推动了多语言多模态摘要系统的性能跃升,对促进语言多样性和技术普惠具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务