遇见数据集

SEACrowd/globalwoz

收藏
Hugging Face2024-06-24 更新2024-06-29 收录
官方服务:

资源简介:

Globalwoz数据集是ACL 2022论文《GlobalWoZ: Globalizing MultiWoZ to Develop Multilingual Task-Oriented Dialogue Systems》的数据集,包含20种语言和3种方案(F&E, E&F, F&F)的子数据集,特别是印尼语、泰语和越南语。该数据集基于翻译对话模板并用目标语言国家的本地实体填充。

Globalwoz数据集是ACL 2022论文《GlobalWoZ: Globalizing MultiWoZ to Develop Multilingual Task-Oriented Dialogue Systems》的数据集,包含20种语言和3种方案(F&E, E&F, F&F)的子数据集,特别是印尼语、泰语和越南语。该数据集基于翻译对话模板并用目标语言国家的本地实体填充。

提供机构:
SEACrowd
原始信息汇总

Globalwoz 数据集概述

基本信息

  • 名称: Globalwoz
  • 语言:
    • 印尼语 (ind)
    • 泰语 (tha)
    • 越南语 (vie)
  • 任务类别: 端到端任务导向对话 (E2E Task Oriented Dialogue)
  • 标签: 端到端任务导向对话 (E2E-task-oriented-dialogue)
  • 许可证: 未知

数据集描述

  • 来源: 论文 “GlobalWoZ: Globalizing MultiWoZ to Develop Multilingual Task-Oriented Dialogue Systems”,被 ACL 2022 接受。
  • 内容: 包含多个子数据集,涵盖20种语言和3种模式(F&E, E&F, F&F),包括印尼语、泰语和越南语。
  • 方法: 基于翻译对话模板并填充目标语言国家的本地实体。

使用方法

使用 datasets

python from datasets import load_dataset dset = datasets.load_dataset("SEACrowd/globalwoz", trust_remote_code=True)

使用 seacrowd

python import seacrowd as sc

使用默认配置加载数据集

dset = sc.load_dataset("globalwoz", schema="seacrowd")

查看数据集的所有可用子集(配置名称)

print(sc.available_config_names("globalwoz"))

使用特定配置加载数据集

dset = sc.load_dataset_by_config_name(config_name="<config_name>")

数据集版本

  • 源版本: 2.0.0
  • SEACrowd 版本: 2024.06.20

引用

bibtex @inproceedings{ding-etal-2022-globalwoz, title = "{G}lobal{W}o{Z}: Globalizing {M}ulti{W}o{Z} to Develop Multilingual Task-Oriented Dialogue Systems", author = "Ding, Bosheng and Hu, Junjie and Bing, Lidong and Aljunied, Mahani and Joty, Shafiq and Si, Luo and Miao, Chunyan", editor = "Muresan, Smaranda and Nakov, Preslav and Villavicencio, Aline", booktitle = "Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)", month = may, year = "2022", }

@article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
SEACrowd/globalwoz 数据集图片
构建方式
GlobalWoZ数据集源自ACL 2022收录的研究工作,旨在将英文多领域任务导向对话数据集MultiWoZ全球化,以构建多语言任务导向对话系统。其构建策略别具匠心:首先对源对话模板进行跨语言翻译,随后将翻译后的模板与目标语言国家的本地化实体进行填充,从而生成自然且符合地域文化的对话样本。该数据集涵盖20种语言,其中包含印度尼西亚语、泰语和越南语等东南亚语言,并设计了F&E、E&F、F&F三种不同的方案模式,以支持多样化的跨语言对话研究需求。
特点
GlobalWoZ数据集的核心特色在于其多语言与本地化的深度融合。通过模板翻译与本地实体填充的双重机制,数据集不仅实现了语言的跨域迁移,还确保了对话内容在目标语言文化语境中的真实性与合理性。20种语言的覆盖范围使其成为多语言任务导向对话研究的重要资源。三种方案模式的并行设计,为研究者提供了灵活的实验框架,便于探索不同语言组合与实体映射策略对对话系统性能的影响。此外,该数据集严格遵循E2E任务导向对话的标注规范,保证了数据的高质量与一致性。
使用方法
GlobalWoZ数据集可通过HuggingFace的datasets库便捷加载,用户只需调用load_dataset函数并指定数据集名称'SEACrowd/globalwoz',同时设置trust_remote_code=True即可获取数据。对于采用SEACrowd库的用户,可先导入seacrowd模块,使用sc.load_dataset加载默认配置,或通过sc.available_config_names查看所有可用的子集配置名,进而利用sc.load_dataset_by_config_name选择特定配置进行加载。详细的使用指南可参考SEACrowd数据中心的官方文档,以获取更全面的加载与操作说明。
背景与挑战
背景概述
GlobalWoZ数据集由Bosheng Ding、Junjie Hu、Lidong Bing等研究人员于2022年ACL会议上提出,旨在突破任务导向型对话系统在非英语语言中的发展瓶颈。该数据集基于MultiWoZ的全球化改造,通过翻译对话模板并结合目标语言国家的本地实体填充,构建了涵盖20种语言、三种方案(F&E、E&F、F&F)的多语言对话资源。其核心研究问题在于如何高效地将大规模英文对话数据集迁移至低资源语言环境,从而推动多语言任务导向型对话系统的研究。GlobalWoZ的出现填补了东南亚语言(如印尼语、泰语、越南语)在端到端任务导向对话领域的空白,为跨语言对话理解与生成提供了重要基准,显著提升了相关领域的研究广度与深度。
当前挑战
GlobalWoZ所解决的领域挑战在于多语言任务导向对话系统的数据稀缺与领域迁移难题。现有英文对话数据集(如MultiWoZ)难以直接用于非英语语言,而人工构建多语言对话数据成本高昂且难以规模化。GlobalWoZ通过模板翻译与本地实体注入,实现了跨语言对话数据的自动生成,但该方法面临翻译质量波动、实体对齐误差以及文化适应性不足等挑战。在构建过程中,研究人员需处理模板翻译的语义保真度、目标语言实体库的完整性及多语言对话流程的一致性,同时还需应对低资源语言(如泰语、越南语)的形态复杂性与领域覆盖不全的问题,这对数据集的鲁棒性与泛化能力构成了严峻考验。
常用场景
经典使用场景
GlobalWoZ数据集的核心经典使用场景在于构建和评估多语言任务型对话系统。该数据集通过将英文MultiWoZ数据集进行全球化改造,利用翻译对话模板并填充目标语言国家的本地实体,生成了涵盖20种语言、三种不同方案(F&E、E&F、F&F)的子数据集。在学术研究中,研究者常利用GlobalWoZ训练端到端的任务型对话模型,尤其针对印尼语、泰语和越南语等低资源语言,以检验模型在跨语言场景下的对话状态追踪、策略学习与自然语言生成能力。该数据集为多语言对话系统的鲁棒性评估提供了标准化的基准,推动了任务型对话从单语言向多语言泛化的研究进程。
衍生相关工作
GlobalWoZ数据集衍生了一系列具有影响力的相关工作。其核心论文发表于ACL 2022,提出了对话模板翻译与本地实体填充相结合的创新方法论,为后续多语言对话数据集的构建树立了范式。基于GlobalWoZ,研究者进一步探索了多语言对话系统的跨语言迁移学习策略,如利用预训练的多语言模型(如mBERT、XLM-R)进行微调,并分析不同语言间的迁移效果。此外,该数据集催生了针对东南亚语言的对话系统评估基准,例如在SEACrowd数据枢纽中,GlobalWoZ作为核心组件被整合进多语言多模态评测套件,用于系统性地衡量模型在印尼语、泰语和越南语上的任务型对话能力。这些衍生工作不仅验证了GlobalWoZ的实用价值,也促进了低资源语言对话研究社区的壮大。
数据集最近研究
最新研究方向
GlobalWoZ数据集的研究前沿聚焦于多语言任务导向型对话系统的全球化构建,通过将英文MultiWoZ数据集翻译并填充本地化实体,覆盖印尼语、泰语、越南语等20种语言,突破单一语言对话系统的局限。该工作发表于ACL 2022,与当前多模态、多语言自然语言处理的热潮紧密相连,尤其在东南亚语言资源匮乏的背景下,为低资源语言的对话系统研究提供了关键基准。其影响在于推动了跨语言对话智能的公平性与可及性,为跨文化人机交互、多语言客服等实际应用奠定基础,并启发了后续如SEACrowd等更大规模多语言数据枢纽的建设,显著促进了东南亚地区NLP研究的生态发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务