遇见数据集

SpokenTOD

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

SpokenTOD是一个英文口语任务型对话数据集,由SpokenTOD增强流水线创建,用于训练SpokenUS(一种任务型对话的口语用户模拟器)。该流水线在任务型对话中引入跨轮槽位、打断、不流畅和情感标签等自然口语现象,并基于参考音频进行语音合成,语音合成采用Qwen3-TTS的“Voice Design then Clone”流程。数据集包含来自多个源数据集(SpokenWOZ、EmoWOZ、Schema-Guided Dialogue、ABCD、Taskmaster-2)的对话记录,并划分为训练集、验证集和测试集。每个对话记录包含对话ID、来源、目标(文本和结构化表示)以及对话轮次列表。每个轮次包含角色(用户/助手)、文本、槽位标注(槽名、值、起始位置)、可选的标注(不流畅标签)、情感(标签和名称)、不流畅结构化标注、跨轮段信息、状态、打断信息以及音频路径(如果数据集包含原生音频)。该数据集适用于口语对话系统、任务型对话建模、语音合成、情感识别、不流畅检测等研究任务。

SpokenTOD is an English spoken task-oriented dialogue dataset created by the SpokenTOD augmentation pipeline for training SpokenUS, a spoken user simulator for task-oriented dialogue. The pipeline introduces natural spoken phenomena such as cross-turn slots, interruptions, disfluencies, and emotion labels into task-oriented dialogues, and performs speech synthesis based on reference audio using the Qwen3-TTS Voice Design then Clone process. The dataset contains dialogues from multiple source datasets (SpokenWOZ, EmoWOZ, Schema-Guided Dialogue, ABCD, Taskmaster-2) and is split into training, validation, and test sets. Each dialogue includes a dialogue ID, source, goal (text and structured representation), and a list of turns. Each turn contains role (user/assistant), text, slot annotations (slot name, value, start position), optional annotations (disfluency label), emotion (label and name), disfluency structural annotation, cross-turn segment information, state, interruption information, and audio path (if the dataset includes native audio). The dataset is suitable for research on spoken dialogue systems, task-oriented dialogue modeling, speech synthesis, emotion recognition, and disfluency detection.

创建时间:
2026-08-22
原始信息汇总

SpokenTOD数据集概述

基本信息

  • 数据集名称:SpokenTOD
  • 许可协议:CC-BY-4.0
  • 任务类型:音频到音频(audio-to-audio)
  • 语言:英语
  • 标签:口语对话、任务型对话、语音合成

数据集简介

SpokenTOD是一个英文口语任务型对话数据集,通过SpokenTOD增强流水线构建,用于训练SpokenUS(口语用户模拟器)。该流水线为任务型对话增加了跨轮槽位、打断、不流畅和情感标签等现象,并基于参考音频进行语音合成(使用Qwen3-TTS的Voice Design then Clone工作流)。

数据集结构

数据集分为以下三个目录:

  • train/(训练集)
  • validation/(验证集)
  • test/(测试集)

每条对话记录包含以下字段:

  • dialogue_id:对话ID
  • source:数据来源(emowoz、sgd、abcd、tm2、spokenwoz)
  • goal:对话目标(文本和结构化形式)
  • turns:对话轮次列表,每轮包含:
    • role:发言角色(用户或助手)
    • text:文本内容
    • slots:槽位信息
    • tagged:不流畅标签(可选)
    • emotion:情感标注
    • disfluency:结构化不流畅注释
    • segment:跨轮段信息
    • state:状态信息
    • bargein:打断类型及子类型
    • audio_path:音频路径(适用于含原生音频的数据集)
  • speaker:发言者信息
  • assistant_speaker:助手发言者信息
  • metadata:元数据

数据来源与许可

SpokenTOD由多个源数据集派生而来,各源数据集的具体许可如下:

源数据集 许可证 要求
SpokenWOZ CC BY-NC 4.0 仅限非商业使用,需注明出处
EmoWOZ CC BY-NC 4.0 仅限非商业使用,需注明出处
Schema-Guided Dialogue (SGD) CC BY-SA 4.0 需保留署名并遵守相同方式共享
ABCD MIT License 需保留版权和许可声明
Taskmaster-2 CC BY 4.0 需注明出处

另外,语音合成中使用了Speech Accent Archive的参考音频,但该档案的原始录音、转录和元数据不包含在本发布中。

数据集维护者

由Jongguen Lee、Junseong Pyo、Jeongmin Park和Yohan Jo创建。

引用信息

引用该数据集时,请引用以下论文:

@misc{lee2026spokenusspokenusersimulator, title={SpokenUS: A Spoken User Simulator for Task-Oriented Dialogue}, author={Jonggeun Lee and Junseong Pyo and Jeongmin Park and Yohan Jo}, year={2026}, eprint={2603.16783}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2603.16783}, }

搜集汇总
数据集介绍
SpokenTOD 数据集图片
构建方式
在任务型对话系统由文本向语音模态演进的过程中,高质量的口语对话数据长期匮乏,SpokenTOD正是为弥合这一鸿沟而构建。该数据集依托一套系统化的口语增强流水线,对既有任务型对话语料进行多维度改造:在对话结构层面注入跨轮槽位、打断与不流畅现象,并附加情感标签;在语音合成环节采用Qwen3-TTS的Voice Design then Clone工作流,以参考音频为条件生成具有说话人特征的语音,最终形成音频与文本严格对齐的口语对话实例。
使用方法
使用该数据集时可借助WebDataset接口直接流式读取TAR分片,从而在不完整下载的前提下高效载入音频与文本。每行样本的wav字段可直接播放或送入语音模型,text字段提供转写文本,json字段则携带原始路径、样本大小与划分信息,便于数据过滤与溯源分析。研究者亦可结合metadata目录下的原始jsonl文件进行元数据层面的检索。由于数据派生自多个源数据集,使用者须遵守各来源的许可条款,非商业性使用SpokenWOZ与EmoWOZ派生部分,并保留相应署名。
背景与挑战
背景概述
口语任务型对话系统长期受限于真实语音交互数据的匮乏,既有资源多依赖朗读式合成或书面语料,难以反映自然对话中的动态特征。SpokenTOD由Jonggeun Lee、Junseong Pyo、Jeongmin Park与Yohan Jo等研究者构建,通过增强管线将SpokenWOZ、EmoWOZ、ABCD、Taskmaster-2等文本对话语料转化为英语口语对话数据,并引入跨轮槽位、打断、不流畅现象与情感标签等口语现象,进而以Qwen3-TTS的Voice Design then Clone工作流合成语音。该数据集为训练SpokenUS口语用户模拟器提供了关键数据基础,推动了任务型对话研究从文本范式向语音范式的迁移。
当前挑战
在领域问题层面,口语任务型对话需同时处理语音识别不确定性、副语言现象与对话状态追踪的耦合难题,传统文本对话模型难以直接迁移。在构建过程中,数据来源的异构性带来显著挑战:各源数据集在许可协议、对话结构与标注体系上差异较大,SGD衍生样本因版权约束被排除于公开版本之外,需逐源保留署名与许可条款。语音合成环节需在参考音频条件下保持说话人一致性与情感表达的连贯性,同时确保合成语音与文本转录的精确对齐;跨轮槽位、打断与不流畅现象的注入亦要求增强管线在语义合理性与口语自然度之间取得平衡。
常用场景
经典使用场景
在任务型口语对话系统的研究中,SpokenTOD的经典使用场景集中于训练与评估口语用户模拟器及端到端语音对话策略。该数据集通过增强流水线注入跨轮槽位、打断、不流畅现象与情感标签,并借助Qwen3-TTS的“先设计后克隆”流程合成条件语音,从而构建出贴近真实人机交互的语音对话样本。研究者常利用其音频与文本配对数据,开展语音理解、对话状态追踪与回复生成的联合建模,推动口语对话系统从纯文本范式向语音原生范式的迁移。
解决学术问题
该数据集着力解决口语任务型对话研究中长期存在的数据稀缺与现象单一问题。传统文本对话语料缺乏语音韵律、打断与情感等副语言信息,而真实口语对话的标注成本高昂。SpokenTOD通过系统化增强与语音合成,为跨轮槽位、不流畅与情感建模提供了可控的实验平台,使研究者得以在统一基准上检验口语理解与对话管理的鲁棒性。其意义在于降低口语对话研究的门槛,并为可复现的语音对话实验提供标准化资源。
实际应用
在实际应用层面,SpokenTOD可服务于智能客服、语音助手与车载交互等需要自然口语交互的场景。基于该数据集训练的语音用户模拟器能够生成带有打断、犹豫与情感波动的用户行为,用于压力测试对话系统的鲁棒性;同时,其音频与转写文本可用于语音识别、对话状态追踪与回复生成的联合优化。企业可借助该资源在低成本的仿真环境中迭代口语对话策略,减少对真实用户数据的依赖,加速产品原型的验证与部署。
数据集最近研究
最新研究方向
在任务型对话系统由纯文本向多模态语音交互演进的浪潮中,SpokenTOD凭借其增强流水线所合成的跨轮槽位、插话、不流畅表达与情感标注语音数据,正推动语音用户模拟器与端到端语音对话建模这一前沿方向的发展。围绕该数据集展开的最新研究聚焦于构建具备自然打断、情感感知与口语鲁棒性的语音用户模拟器,进而提升任务型对话系统在真实口语交互场景下的适应能力。相关成果与SpokenWOZ、EmoWOZ等语音对话资源的兴起形成呼应,为弥合书面文本与自然口语之间的鸿沟提供了关键数据支撑,对推动语音交互系统走向实用化具有重要的学术价值与工程意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务