遇见数据集

ConvLab/sgd4

收藏
Hugging Face2022-11-25 更新2024-03-04 收录
官方服务:

资源简介:

Schema-Guided Dialogue (SGD)数据集包含超过20,000条注释的多领域、任务导向的人机对话,涉及20个领域的服务和API交互,如银行、事件、媒体、日历、旅行和天气等。该数据集包含多个不同API,许多API具有重叠功能但接口不同,反映了现实世界的常见场景。SGD-X数据集包含原始SGD数据集中每个模式的五个语言变体,这些变体由数百名付费众包工作者编写。SGD-X目录中,v1代表最接近原始模式的变体,v5代表语言距离最远的变体。该数据集可用于意图预测、槽填充、对话状态跟踪、策略模仿学习、语言生成和用户模拟学习等任务。

The Schema-Guided Dialogue (SGD) dataset consists of over 20,000 annotated multi-domain task-oriented human-machine dialogues involving services and API interactions across 20 domains, such as banking, events, media, calendar, travel, weather, and others. This dataset features multiple distinct APIs, many of which have overlapping functionalities but differing interfaces, mirroring common real-world scenarios. The SGD-X dataset includes five linguistic variants for every schema in the original SGD dataset, which were created by hundreds of paid crowd workers. Within the SGD-X collection, v1 denotes the variant closest to the original schema, while v5 represents the variant with the greatest linguistic divergence from the original. This dataset can be applied to tasks including intent prediction, slot filling, dialogue state tracking, policy imitation learning, language generation, and user simulation learning, among others.

提供机构:
ConvLab
原始信息汇总

数据集概述

数据集名称: SGD-X v4

语言: 英语

许可: CC BY-SA 4.0

数据集大小: 10K<n<100K

任务类别: 对话式

数据集内容

Schema-Guided Dialogue (SGD) 数据集: 包含超过20,000个多领域、任务导向的人机对话,涉及20个领域,如银行、事件、媒体、日历、旅行和天气等。

SGD-X 数据集: 包含原始SGD数据集中每个模式的5种语言变体,由数百名付费众包工作者编写。SGD-X目录中,v1代表最接近原始模式,v5代表语言距离最远。

数据集使用

数据转换: 使用generate_sgdx_dialogues.py脚本将对话转换为SGD-X模式。

主要转换变更:

  • 将原始act更改为intent
  • 为每个领域添加count槽,非分类,通过文本匹配查找范围。
  • 根据intent对话行为进行分类。
  • 使用|连接多个值。
  • 保留active_intentrequested_slotsservice_call

支持的任务

  • NLU(自然语言理解)
  • DST(对话状态跟踪)
  • Policy(策略)
  • NLG(自然语言生成)
  • E2E(端到端)

数据分割

分割 对话数 话语数 平均话语数 平均令牌数 平均领域数 分类槽匹配(状态) 分类槽匹配(目标) 分类槽匹配(对话行为) 非分类槽范围(对话行为)
训练 16142 329964 20.44 9.75 1.84 100 - 100 100
验证 2482 48726 19.63 9.66 1.84 100 - 100 100
测试 4201 84594 20.14 10.4 2.02 100 - 100 100
全部 22825 463284 20.3 9.86 1.87 100 - 100 100

引用信息

@inproceedings{lee2022sgd, title={SGD-X: A Benchmark for Robust Generalization in Schema-Guided Dialogue Systems}, author={Lee, Harrison and Gupta, Raghav and Rastogi, Abhinav and Cao, Yuan and Zhang, Bin and Wu, Yonghui}, booktitle={Proceedings of the AAAI Conference on Artificial Intelligence}, volume={36}, number={10}, pages={10938--10946}, year={2022} }

搜集汇总
数据集介绍
ConvLab/sgd4 数据集图片
构建方式
Schema-Guided Dialogue (SGD) 数据集由 Google Research 构建,包含超过 20,000 条多领域、面向任务的对话,覆盖银行、旅行、天气等 20 个领域,每个领域对应多个功能重叠但接口各异的 API,模拟真实场景的复杂性。SGD-X v4 进一步扩展,为原始数据集中的每个模式生成五种语言变体,由数百名众包工作者撰写,按语言距离从 v1(最接近原始模式)到 v5(最远)排序。构建时需下载原始数据,修改生成脚本并运行 `generate_sgdx_dialogues.py`,随后执行预处理,最终整合为统一格式,保留 `active_intent`、`requested_slots` 和 `service_call` 等关键注释。
特点
该数据集的核心特点在于其规模与多样性,训练集包含 16,142 条对话,验证集 2,482 条,测试集 4,201 条,总计 22,825 条对话,涉及 45 个领域变体,平均对话轮次约 20 句,每个对话平均涉及 1.87 个领域。注释涵盖对话行为、状态、数据库结果、服务调用等,支持意图预测、槽填充、对话状态追踪、策略学习、语言生成及用户模拟等任务。特别地,评估集包含未见领域和服务,支持零样本或小样本场景下的性能量化,而语言变体设计则旨在测试模型对自然语言多样性的鲁棒性。
使用方法
使用 SGD-X v4 数据集需先安装 ConvLab-3 平台,通过 `from convlab.util import load_dataset, load_ontology, load_database` 加载数据,具体调用 `dataset = load_dataset('sgd4')` 即可获取对话、本体和数据库。数据以统一格式存储,支持自然语言理解、对话状态追踪、策略优化和自然语言生成等端到端任务。用户可参考 ConvLab-3 仓库中的文档进行进一步处理,如拆分训练、验证和测试集,或利用注释进行模型训练与评估。建议在使用前熟悉平台接口,以确保高效集成与实验复现。
背景与挑战
背景概述
在任务导向型对话系统的研究中,跨领域泛化能力与语言鲁棒性始终是核心挑战。为应对这一需求,谷歌研究团队于2021年发布了Schema-Guided Dialogue (SGD)数据集,涵盖20余个领域的逾2万条多领域对话,并在此基础上于2022年推出其变体SGD-X v4。该数据集由Harrison Lee、Raghav Gupta等学者主导,依托ConvLab-3平台整合,旨在评估对话系统在零样本或少样本场景下的表现。SGD-X通过引入人工编写的语言变体,模拟真实世界中用户表达的多样性,为意图预测、槽位填充及对话状态追踪等任务提供了严苛的测试基准。其发布不仅推动了虚拟助手对未见领域与服务的适应能力研究,更成为评估模型语言理解鲁棒性的重要标杆。
当前挑战
SGD-X v4数据集所面临的挑战主要体现在两个层面。其一,领域问题层面,任务导向型对话系统需应对跨领域知识迁移的难题,即当面对训练中未出现的服务或API接口时,模型需凭借有限的上下文实现零样本泛化,这对意图识别与状态追踪的准确性提出了极高要求。其二,构建过程中,为生成5个语言学距离递增的变体,研究团队需协调数百名众包工作者,确保变体在保留语义一致性的同时覆盖自然语言中的句法替换、词汇同义及表达多样性,这一过程面临标注质量控制与歧义消解的显著困难。此外,原始SGD数据与SGD-X变体之间的对话转换依赖特定脚本,技术实现的兼容性亦构成潜在障碍。
常用场景
经典使用场景
在任务型对话系统研究中,ConvLab/sgd4数据集以其丰富的多领域、多轮对话标注而著称,涵盖银行业务、航班预订、酒店服务等20余个真实服务领域。其经典使用场景聚焦于端到端对话模型的训练与评估,尤其适用于意图预测、槽位填充、对话状态追踪、策略模仿学习以及自然语言生成等子任务。研究者可借助该数据集构建具备跨领域泛化能力的虚拟助手,并利用其内置的未见领域和服务的评估集,检验模型在零样本或小样本场景下的鲁棒性。
解决学术问题
该数据集精准回应了任务型对话系统中两大核心学术挑战:多领域知识迁移与语言变体泛化。通过提供覆盖45个细分服务接口的对话样本,它解决了模型在异构API间的状态追踪与策略适应难题。其次,SGD-X变体的引入使得研究者能够系统评估对话系统在面对同义表达、句法重构等语言多样性时的表现,从而推动鲁棒性增强与过拟合缓解。这一设计为跨领域零样本对话理解奠定了标准化基准。
衍生相关工作
该数据集衍生了一系列标杆性研究工作,如Lee等人提出的SGD-X基准,系统量化了语言变体对对话系统泛化性能的影响。此外,基于该数据集的对话状态追踪模型(如SST、TripPy)和端到端架构(如SOLOIST、MinTL)在跨领域迁移能力上取得了突破。ConvLab-3平台将其整合为统一接口,进一步催生了多任务联合训练与知识蒸馏等优化策略的研究,推动了对话系统在低资源场景下的实用化进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务