遇见数据集

sarulab-speech/DuplexChat

收藏
Hugging Face2026-07-05 更新2026-07-22 收录
官方服务:

资源简介:

DuplexChat是一个大规模、双说话人、全双工的口语对话语料库,基于公共播客源构建。该存储库不包含音频文件,仅提供元数据信息,用于支持语音分离和恢复任务。数据集包含英语和日语两个版本,分别对应不同的配置文件。

DuplexChat is a large-scale, two-speaker, full-duplex spoken-dialogue corpus built from public podcast feeds. This repository distributes no audio, only metadata for supporting speech separation and restoration tasks. The dataset includes English and Japanese versions, corresponding to different configurations.

提供机构:
sarulab-speech
搜集汇总
数据集介绍
sarulab-speech/DuplexChat 数据集图片
构建方式
DuplexChat数据集通过聚合公开播客订阅源中的双人对话片段构建而成。构建流程首先从海量播客中提取双说话人交互音频段,随后进行说话人日志化标注以区分两个发言角色。为确保数据纯净性,系统对每个片段执行全局去重操作,基于音频链接与对话索引的唯一组合消除冗余。最终生成的元数据清单以JSONL格式存储,每条记录包含源播客RSS链接、音频URL、对话在节目中的起止时间及说话人标签,为下游任务提供清晰的检索与切割依据。
特点
该数据集以大规模、全双工口语对话为核心特色,覆盖英语与日语两种语言,总计时长超过415,000小时(英语约282,634小时,日语约132,723小时)。每个样本均为天然的双人对话片段,完整保留了自然交流中的重叠语音、交互节奏与副语言特征,为全双工语音建模提供了真实场景数据。数据来源的多元播客生态保障了主题与口音的多样性,且不包含任何受版权保护的原始音频,仅分发元数据与构建方法。
使用方法
使用者需首先根据元数据中的音频URL下载对应播客剧集,然后按照指定的起止时间切割对话片段。为恢复双通道音频,研究人员应运行配套的语音分离与修复流程,将混合语音分解为每个说话者独立的单声道信号。建议基于此数据训练全双工语音对话模型或说话人日志系统,使用前需自行处理音频版权合规性问题,并严格遵循MIT许可证条款。
背景与挑战
背景概述
随着语音交互技术的迅速发展,全双工口语对话系统在智能助手、实时翻译和远程通信等领域展现出巨大潜力。然而,现有口语对话数据集多集中于单通道或模拟场景,难以支撑真实复杂环境下的全双工对话研究。在此背景下,DuplexChat数据集应运而生,由国际研究团队于近期构建,旨在弥补大规模、真实、全双工口语对话数据的缺失。该数据集基于公开播客源,提供了超过280,000小时的英语和130,000小时的日语双人对话片段,涵盖丰富的自然交互模式。通过提供完整的对话元数据和重建流程,DuplexChat推动了全双工语音处理技术的研究,为语音分离、说话人识别和对话系统建模等任务提供了宝贵的资源,对语音领域具有重要影响力。
当前挑战
DuplexChat数据集主要解决了全双工口语对话研究中的数据稀缺挑战,这一领域的问题在于传统数据集仅提供单通道或合成对话,无法真实反映多人同时说话、重叠语音和自然打断等复杂交互现象,限制了全双工系统在噪声抑制、说话人分离和对话理解等关键任务上的性能提升。在构建过程中,研究人员面临了双重挑战:首先,从海量播客音频中自动检测并裁剪出高质量的双人对话片段,需要精确的说话人日志和语音活动检测技术;其次,由于数据版权限制,数据集不直接分发音频,仅提供元数据,这为用户重建音频带来了额外的技术门槛,需依赖外部工具进行语音分离和修复,增加了数据使用的复杂性。
常用场景
经典使用场景
DuplexChat作为大规模、双说话人、全双工口语对话语料库,其经典使用场景在于为全双工对话系统提供训练与评估基础。该数据集从公开播客源中提取对话片段,每个条目包含两个说话人的语音交互,时长跨越数分钟,且经过说话人日志化处理。研究者可基于此数据重建单声道分离后的立体声音频,从而模拟真实场景中同时说话、打断与重叠等复杂语音交互模式。这一特性使其成为推动全双工语音理解与生成技术发展的关键资源。
解决学术问题
在学术研究层面,DuplexChat解决了长期以来全双工口语对话语料稀缺的难题。传统对话数据集多采用单声道或半双工设计,难以捕捉自然交流中的重叠语音与瞬时反馈。该数据集通过提供大规模、时序精准的双人对话片段,使研究者能够攻克说话人分离、语音活动检测、对话状态追踪以及全双工语音合成等核心挑战。其意义在于打破数据瓶颈,推动语音对话系统从串行应答向并行交互演进,为人机自然交流研究奠定了数据基础。
衍生相关工作
围绕DuplexChat衍生的经典工作主要集中在全双工对话模型、说话人分离网络与重叠语音处理技术。例如,基于此语料开发的端到端双工语音生成模型可学习同时编码与解码两路语音流;在前端信号处理方向,涌现出融合注意力机制的语音分离架构以应对复杂重音场景。此外,部分研究将其作为评估基准,对比不同全双工系统在自然打断率、响应时机等指标上的表现,这些工作共同推动了语音交互从半双工迈向全双工时代的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务