遇见数据集

ConvLab/metalwoz

收藏
Hugging Face2022-11-25 更新2024-03-04 收录
官方服务:

资源简介:

--- language: - en license: [] multilinguality: - monolingual pretty_name: MetaLWOZ size_categories: - 10K<n<100K task_categories: - conversational --- # Dataset Card for MetaLWOZ - **Repository:** https://www.microsoft.com/en-us/research/project/metalwoz/ - **Paper:** https://www.microsoft.com/en-us/research/publication/results-of-the-multi-domain-task-completion-dialog-challenge/ - **Leaderboard:** None - **Who transforms the dataset:** Qi Zhu(zhuq96 at gmail dot com) To use this dataset, you need to install [ConvLab-3](https://github.com/ConvLab/ConvLab-3) platform first. Then you can load the dataset via: ``` from convlab.util import load_dataset, load_ontology, load_database dataset = load_dataset('metalwoz') ontology = load_ontology('metalwoz') database = load_database('metalwoz') ``` For more usage please refer to [here](https://github.com/ConvLab/ConvLab-3/tree/master/data/unified_datasets). ### Dataset Summary This large dataset was created by crowdsourcing 37,884 goal-oriented dialogs, covering 227 tasks in 47 domains. Domains include bus schedules, apartment search, alarm setting, banking, and event reservation. Each dialog was grounded in a scenario with roles, pairing a person acting as the bot and a person acting as the user. (This is the Wizard of Oz reference—using people behind the curtain who act as the machine). Each pair were given a domain and a task, and instructed to converse for 10 turns to satisfy the user’s queries. For example, if a user asked if a bus stop was operational, the bot would respond that the bus stop had been moved two blocks north, which starts a conversation that addresses the user’s actual need. - **How to get the transformed data from original data:** - Download [metalwoz-v1.zip](https://www.microsoft.com/en-us/download/58389) and [metalwoz-test-v1.zip](https://www.microsoft.com/en-us/download/100639). - Run `python preprocess.py` in the current directory. - **Main changes of the transformation:** - `CITI_INFO`, `HOME_BOT`, `NAME_SUGGESTER`, and `TIME_ZONE` are randomly selected as the valiation domains. - Remove the first utterance by the system since it is "Hello how may I help you?" in most case. - Add goal description according to the original task description: user_role+user_prompt+system_role+system_prompt. - **Annotations:** - domain, goal ### Supported Tasks and Leaderboards RG, User simulator ### Languages English ### Data Splits | split | dialogues | utterances | avg_utt | avg_tokens | avg_domains | cat slot match(state) | cat slot match(goal) | cat slot match(dialogue act) | non-cat slot span(dialogue act) | |------------|-------------|--------------|-----------|--------------|---------------|-------------------------|------------------------|--------------------------------|-----------------------------------| | train | 34261 | 357092 | 10.42 | 7.48 | 1 | - | - | - | - | | validation | 3623 | 37060 | 10.23 | 6.59 | 1 | - | - | - | - | | test | 2319 | 23882 | 10.3 | 7.96 | 1 | - | - | - | - | | all | 40203 | 418034 | 10.4 | 7.43 | 1 | - | - | - | - | 51 domains: ['AGREEMENT_BOT', 'ALARM_SET', 'APARTMENT_FINDER', 'APPOINTMENT_REMINDER', 'AUTO_SORT', 'BANK_BOT', 'BUS_SCHEDULE_BOT', 'CATALOGUE_BOT', 'CHECK_STATUS', 'CITY_INFO', 'CONTACT_MANAGER', 'DECIDER_BOT', 'EDIT_PLAYLIST', 'EVENT_RESERVE', 'GAME_RULES', 'GEOGRAPHY', 'GUINESS_CHECK', 'HOME_BOT', 'HOW_TO_BASIC', 'INSURANCE', 'LIBRARY_REQUEST', 'LOOK_UP_INFO', 'MAKE_RESTAURANT_RESERVATIONS', 'MOVIE_LISTINGS', 'MUSIC_SUGGESTER', 'NAME_SUGGESTER', 'ORDER_PIZZA', 'PET_ADVICE', 'PHONE_PLAN_BOT', 'PHONE_SETTINGS', 'PLAY_TIMES', 'POLICY_BOT', 'PRESENT_IDEAS', 'PROMPT_GENERATOR', 'QUOTE_OF_THE_DAY_BOT', 'RESTAURANT_PICKER', 'SCAM_LOOKUP', 'SHOPPING', 'SKI_BOT', 'SPORTS_INFO', 'STORE_DETAILS', 'TIME_ZONE', 'UPDATE_CALENDAR', 'UPDATE_CONTACT', 'WEATHER_CHECK', 'WEDDING_PLANNER', 'WHAT_IS_IT', 'BOOKING_FLIGHT', 'HOTEL_RESERVE', 'TOURISM', 'VACATION_IDEAS'] - **cat slot match**: how many values of categorical slots are in the possible values of ontology in percentage. - **non-cat slot span**: how many values of non-categorical slots have span annotation in percentage. ### Citation ``` @inproceedings{li2020results, author = {Li, Jinchao and Peng, Baolin and Lee, Sungjin and Gao, Jianfeng and Takanobu, Ryuichi and Zhu, Qi and Minlie Huang and Schulz, Hannes and Atkinson, Adam and Adada, Mahmoud}, title = {Results of the Multi-Domain Task-Completion Dialog Challenge}, booktitle = {Proceedings of the 34th AAAI Conference on Artificial Intelligence, Eighth Dialog System Technology Challenge Workshop}, year = {2020}, month = {February}, url = {https://www.microsoft.com/en-us/research/publication/results-of-the-multi-domain-task-completion-dialog-challenge/}, } ``` ### Licensing Information [Microsoft Research Data License Agreement](https://msropendata-web-api.azurewebsites.net/licenses/2f933be3-284d-500b-7ea3-2aa2fd0f1bb2/view)

--- 语言: - 英语 许可证: - 无 多语言属性: - 单语言 美观名称:MetaLWOZ 规模类别: - 10K < n < 100K 任务类别: - 对话式 --- # MetaLWOZ数据集卡片 - **仓库地址**:https://www.microsoft.com/en-us/research/project/metalwoz/ - **论文地址**:https://www.microsoft.com/en-us/research/publication/results-of-the-multi-domain-task-completion-dialog-challenge/ - **排行榜**:无 - **数据集转换者**:朱琪(邮箱:zhuq96@gmail.com) 如需使用本数据集,请先安装[ConvLab-3](https://github.com/ConvLab/ConvLab-3)平台,随后可通过以下代码加载数据集: from convlab.util import load_dataset, load_ontology, load_database dataset = load_dataset('metalwoz') ontology = load_ontology('metalwoz') database = load_database('metalwoz') 更多使用方法请参阅[此处](https://github.com/ConvLab/ConvLab-3/tree/master/data/unified_datasets)。 ### 数据集概述 本大规模数据集通过众包构建了37884条面向任务的对话,涵盖47个领域的227项任务,涉及公交时刻表查询、公寓搜索、闹钟设置、银行业务、活动预约等多个领域。每段对话均基于带有明确角色分工的场景搭建,由一名扮演机器人(bot)的参与者与一名扮演用户的参与者组成对话双方。(此处采用了绿野仙踪(Wizard of Oz)实验范式——即由幕后人类模拟机器行为)。每组参与者会被分配一个领域与一项任务,并被要求进行至多10轮对话以满足用户的查询需求。例如,若用户询问某公交站是否正常运营,机器人可回复该公交站已向北迁移两个街区,由此展开一段贴合用户实际需求的对话。 ### 如何从原始数据获取转换后的数据集 1. 下载[metalwoz-v1.zip](https://www.microsoft.com/en-us/download/58389)与[metalwoz-test-v1.zip](https://www.microsoft.com/en-us/download/100639) 2. 在当前目录下执行`python preprocess.py` ### 转换过程的主要改动 - 随机选取`CITI_INFO`、`HOME_BOT`、`NAME_SUGGESTER`与`TIME_ZONE`作为验证领域 - 移除系统发出的第一条话语,该语句在多数场景下为“Hello how may I help you?” - 根据原始任务描述添加目标说明:用户角色+用户提示词+系统角色+系统提示词 ### 标注信息 标注字段包含:领域(domain)、目标(goal) ### 支持的任务与排行榜 任务类型:RG、用户模拟器(User simulator) ### 语言 英语 ### 数据划分 | 数据集划分 | 对话数 | 话语总数 | 平均每对话轮数 | 平均每轮Token数 | 平均领域数 | 分类槽匹配(状态) | 分类槽匹配(目标) | 分类槽匹配(对话行为) | 非分类槽跨度(对话行为) | |------------|-------------|--------------|-----------|--------------|---------------|-------------------------|------------------------|--------------------------------|-----------------------------------| | 训练集 | 34261 | 357092 | 10.42 | 7.48 | 1 | - | - | - | - | | 验证集 | 3623 | 37060 | 10.23 | 6.59 | 1 | - | - | - | - | | 测试集 | 2319 | 23882 | 10.3 | 7.96 | 1 | - | - | - | - | | 全部 | 40203 | 418034 | 10.4 | 7.43 | 1 | - | - | - | - | 本数据集共包含51个领域:`['AGREEMENT_BOT', 'ALARM_SET', 'APARTMENT_FINDER', 'APPOINTMENT_REMINDER', 'AUTO_SORT', 'BANK_BOT', 'BUS_SCHEDULE_BOT', 'CATALOGUE_BOT', 'CHECK_STATUS', 'CITY_INFO', 'CONTACT_MANAGER', 'DECIDER_BOT', 'EDIT_PLAYLIST', 'EVENT_RESERVE', 'GAME_RULES', 'GEOGRAPHY', 'GUINESS_CHECK', 'HOME_BOT', 'HOW_TO_BASIC', 'INSURANCE', 'LIBRARY_REQUEST', 'LOOK_UP_INFO', 'MAKE_RESTAURANT_RESERVATIONS', 'MOVIE_LISTINGS', 'MUSIC_SUGGESTER', 'NAME_SUGGESTER', 'ORDER_PIZZA', 'PET_ADVICE', 'PHONE_PLAN_BOT', 'PHONE_SETTINGS', 'PLAY_TIMES', 'POLICY_BOT', 'PRESENT_IDEAS', 'PROMPT_GENERATOR', 'QUOTE_OF_THE_DAY_BOT', 'RESTAURANT_PICKER', 'SCAM_LOOKUP', 'SHOPPING', 'SKI_BOT', 'SPORTS_INFO', 'STORE_DETAILS', 'TIME_ZONE', 'UPDATE_CALENDAR', 'UPDATE_CONTACT', 'WEATHER_CHECK', 'WEDDING_PLANNER', 'WHAT_IS_IT', 'BOOKING_FLIGHT', 'HOTEL_RESERVE', 'TOURISM', 'VACATION_IDEAS']` - **分类槽匹配(cat slot match)**:指分类槽的取值落在本体预定义可选值范围内的百分比。 - **非分类槽跨度(non-cat slot span)**:指带有跨度标注的非分类槽取值占总非分类槽取值的百分比。 ### 引用文献 @inproceedings{li2020results, author = {Li, Jinchao and Peng, Baolin and Lee, Sungjin and Gao, Jianfeng and Takanobu, Ryuichi and Zhu, Qi and Minlie Huang and Schulz, Hannes and Atkinson, Adam and Adada, Mahmoud}, title = {Results of the Multi-Domain Task-Completion Dialog Challenge}, booktitle = {Proceedings of the 34th AAAI Conference on Artificial Intelligence, Eighth Dialog System Technology Challenge Workshop}, year = {2020}, month = {February}, url = {https://www.microsoft.com/en-us/research/publication/results-of-the-multi-domain-task-completion-dialog-challenge/}, } ### 许可信息 [微软研究院数据许可协议](https://msropendata-web-api.azurewebsites.net/licenses/2f933be3-284d-500b-7ea3-2aa2fd0f1bb2/view)

提供机构:
ConvLab
原始信息汇总

数据集概述

  • 名称: MetaLWOZ
  • 语言: 英语
  • 大小: 10K<n<100K
  • 任务类型: 对话式
  • 数据集创建方式: 通过众包方式创建,包含37,884个目标导向的对话,覆盖47个领域的227个任务。

数据集内容

  • 领域: 包括公交时刻表、公寓搜索、闹钟设置、银行业务、事件预订等47个领域。
  • 对话结构: 每个对话基于一个场景,由两个人扮演,一人扮演机器人,另一人扮演用户,进行10轮对话以满足用户查询。

数据处理

  • 原始数据转换:
    • 下载metalwoz-v1.zipmetalwoz-test-v1.zip
    • 运行python preprocess.py进行数据预处理。
  • 主要变化:
    • 随机选择CITI_INFO, HOME_BOT, NAME_SUGGESTER, TIME_ZONE作为验证域。
    • 移除系统的第一个发言,通常为“Hello how may I help you?”。
    • 根据原始任务描述添加目标描述。

数据集分割

分割 对话数 发言数 平均发言数 平均令牌数 平均领域数
训练 34261 357092 10.42 7.48 1
验证 3623 37060 10.23 6.59 1
测试 2319 23882 10.3 7.96 1
全部 40203 418034 10.4 7.43 1

引用信息

@inproceedings{li2020results, author = {Li, Jinchao and Peng, Baolin and Lee, Sungjin and Gao, Jianfeng and Takanobu, Ryuichi and Zhu, Qi and Minlie Huang and Schulz, Hannes and Atkinson, Adam and Adada, Mahmoud}, title = {Results of the Multi-Domain Task-Completion Dialog Challenge}, booktitle = {Proceedings of the 34th AAAI Conference on Artificial Intelligence, Eighth Dialog System Technology Challenge Workshop}, year = {2020}, month = {February}, url = {https://www.microsoft.com/en-us/research/publication/results-of-the-multi-domain-task-completion-dialog-challenge/}, }

许可信息

Microsoft Research Data License Agreement

搜集汇总
数据集介绍
ConvLab/metalwoz 数据集图片
构建方式
MetaLWOZ数据集由微软研究院通过众包方式构建,涵盖了47个领域的227项任务,共包含37,884个目标导向的对话。每段对话均基于特定场景,采用“绿野仙踪”(Wizard of Oz)范式,即由人类扮演机器角色,模拟用户与系统之间的交互。对话双方被赋予明确的领域和任务指令,并按要求进行至少10轮对话以达成用户目标。原始数据经过预处理,移除了系统首轮问候语等冗余内容,并根据任务描述补充了目标说明。此外,部分领域如CITI_INFO、HOME_BOT等被随机选取作为验证集,以增强数据分布的多样性。
特点
该数据集具有显著的多样性与规模优势,涵盖从公交查询、公寓搜索到闹钟设置、银行服务等广泛领域,共51个子领域。对话平均长度为10.4轮,平均每轮包含7.43个词元,结构紧凑且目标明确。数据集被划分为训练集(34,261段)、验证集(3,623段)和测试集(2,319段),支持对话系统的鲁棒性评估。其核心特点在于通过角色扮演与任务驱动生成自然对话,同时提供了领域和目标的标注信息,便于进行多领域任务完成对话的研究与评估。
使用方法
使用MetaLWOZ数据集需要先安装ConvLab-3平台。通过调用`load_dataset('metalwoz')`、`load_ontology('metalwoz')`和`load_database('metalwoz')`函数,可分别加载对话数据、本体定义与数据库资源。该数据集适用于对话系统中的响应生成(RG)任务与用户模拟器训练。研究者可基于其丰富的领域覆盖与任务类型,开发并测试跨领域对话管理模型,或构建具备泛化能力的用户模拟代理。详细使用指南可参考ConvLab-3仓库中统一数据集的说明文档。
背景与挑战
背景概述
MetaLWOZ数据集由微软研究院的研究团队于2020年创建,核心研究人员包括Jinchao Li、Baolin Peng等,旨在推动多领域任务型对话系统的研究。该数据集通过众包方式收集了37,884个目标导向对话,覆盖47个领域中的227个任务,如公交查询、公寓搜索、闹钟设置等。每个对话基于“ Wizard of Oz”范式,由人类扮演机器人与用户进行10轮交互,以模拟真实场景中的任务完成过程。该数据集的核心研究问题在于解决多领域对话系统的泛化能力与任务完成效率,其影响力体现在为对话系统挑战赛(DSTC8)提供了标准化基准,并推动了用户模拟器、对话生成等任务的发展。
当前挑战
MetaLWOZ面临的挑战首先体现在多领域任务完成对话的复杂性上,传统模型往往难以在跨领域场景中保持鲁棒性,例如从公交调度切换到银行服务时,对话状态追踪与策略学习易出现偏差。其次,数据构建过程中存在显著困难,包括众包对话质量参差不齐、任务描述(goal)需人工标注以统一语义、以及系统初始问候语(如“Hello how may I help you?”)的冗余处理。此外,数据集仅包含单领域对话(每个对话限定一个领域),未能覆盖真实场景中的跨领域交互,限制了模型在动态任务切换中的表现,而缺失的对话行为标注(如dialogue act)进一步增加了细粒度分析的门槛。
常用场景
经典使用场景
MetaLWOZ数据集凭借其覆盖47个领域、227项任务的37,884段目标导向对话,成为多领域任务型对话系统研究的基石。其经典使用场景在于训练和评估对话策略管理模块,尤其是在跨领域迁移学习和零样本泛化场景中。研究者常利用该数据集构建端到端的对话模型,模拟用户与系统在多轮交互中完成诸如公交查询、银行交易、餐厅预订等具体任务,从而检验模型对复杂意图理解与状态追踪的能力。
解决学术问题
该数据集解决了多领域任务型对话中数据稀疏性与领域迁移难题。传统单领域对话数据集难以支撑跨领域知识共享的研究,而MetaLWOZ通过涵盖47个领域的丰富任务场景,为学术研究提供了探索对话系统在未见领域上泛化性能的基准。它推动了对话状态追踪、策略优化和用户模拟器等核心问题的突破,其挑战赛结果揭示了当前模型在跨领域对话中的局限性,催生了诸如元学习、多任务联合训练等新型方法论。
衍生相关工作
MetaLWOZ衍生了多项经典工作,包括基于元学习的跨领域对话策略迁移方法、多领域对话状态追踪的统一框架,以及用户模拟器的对抗训练技术。其发布推动了ConvLab-3平台的发展,该平台整合了数据预处理、模型评估与基线系统,成为多领域对话研究的标准工具。此外,该数据集启发了后续的MultiWOZ和SGD等更大规模多领域数据集的构建,进一步拓展了任务型对话系统的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务