遇见数据集

SmoothConv and DuplexConv

收藏
github2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

SmoothConv和DuplexConv是两个大规模中文全双工会话语音数据集,用于对话AI。SmoothConv包含100小时的多方自然中文对话,涵盖辅导和社交聊天场景,提供专家人工标注,包括对齐的转录、时间戳、说话人转换、重叠、暂停和声音事件等细粒度标签。DuplexConv包含2000小时的相同领域数据,采用LLM辅助标注,为大规模语音LLM预训练和数据驱动建模提供支持。这两个数据集共同填补了开源中文语音语料中多通道、自发全双工会话数据的空白。

SmoothConv and DuplexConv are two large-scale Chinese full-duplex conversational speech datasets designed for conversational AI systems. SmoothConv contains 100 hours of multi-party natural Chinese conversations covering tutoring and social chat scenarios, with expert manual annotations including fine-grained labels such as aligned transcripts, timestamps, speaker turn changes, overlapping speech, pauses, and sound events. DuplexConv includes 2000 hours of data from the same domains, adopting LLM-aided annotation to support large-scale speech LLM pre-training and data-driven modeling. Collectively, these two datasets fill the gap in open-source Chinese speech corpora for multi-channel, spontaneous full-duplex conversational data.

创建时间:
2026-06-08
原始信息汇总

数据集概述:SmoothConv & DuplexConv

基本信息

  • 发布机构:ASLP@NPU(西北工业大学)与 QualiaLabs 联合开发
  • 许可证:CC BY-NC 4.0(仅限学术与研究用途)
  • 下载地址
    • SmoothConv:https://huggingface.co/datasets/qualialabsAI/SmoothConv
    • DuplexConv:https://huggingface.co/datasets/qualialabsAI/DuplexConv
    • FastTurn 测试集:https://huggingface.co/datasets/ASLP-lab/FastTurn-Testset
  • 演示页面:https://qualialabsai.github.io/SmoothConv-DuplexConv

数据集构成

SmoothConv 和 DuplexConv 源于相同的底层对话源,互为补充,总计提供 2,100 小时的自然中文对话数据,涵盖 辅导(Tutoring)社交聊天(Social Chat) 两个领域。目录中,辅导数据位于以 eduEdu 为前缀的文件夹下;社交聊天数据位于以 none_Edu 为前缀的文件夹下。

SmoothConv(100 小时 — 专家人工标注)

  • 时长:100.53 小时
  • 音频文件数:2,503 个
  • 平均片段长度:144.6 秒
  • 片段长度范围:60.0 – 634.7 秒
  • 标注内容:由训练有素的专家提供精细化标注,包括:
    • 毫秒级时间戳对齐的转录文本
    • 话轮转换与重叠(说话人切换、重叠、话轮保持)
    • 停顿与声音事件(笑声、咳嗽、呼吸、静音等)
    • 说话人属性(性别、年龄、情绪及相关交互标签)

DuplexConv(2,000 小时 — LLM 辅助标注)

  • 时长:2,000.21 小时
  • 音频文件数:93,709 个
  • 平均片段长度:76.8 秒
  • 片段长度范围:8.0 – 618.3 秒
  • 标注方式:采用 LLM 辅助流水线生成转录文本、说话人感知的对话结构、话轮级交互信息及场景级上下文标签,适用于大规模语音大模型预训练和对话语音系统的数据驱动建模。

FastTurn 测试集

从 SmoothConv 数据子集中构建的话轮状态评估基准,用于话轮状态预测评估。结合真实对话片段与 1,000 个合成的 wait 样本(文本来源:DeepSeek V3;音频来源:IndexTTS2),以补充自然对话中罕见的 wait 类别。

话轮状态 来源 样本数 时长(小时)
Complete 真实 14,709 9.64
Incomplete 真实 3,643 2.15
Backchannel 真实 3,080 0.42
Wait 合成 1,000 0.71

道德声明要点

  • 知情同意:对话在参与者知情并同意的情况下录制,发布前已去除或匿名化个人标识。
  • 隐私保护:仅限学术研究用途,禁止重新识别说话人或重建私人信息。
  • 预期用途:用于口语对话、话轮转换和语音理解研究,禁止用于未经授权的监控、冒充或生成欺骗性内容。
  • 局限性:标注可能存在错误;DuplexConv 标签为机器辅助生成。研究人员在训练或评估模型时应考虑领域、人口统计和标注偏差。
搜集汇总
数据集介绍
SmoothConv and DuplexConv 数据集图片
构建方式
为解决中文语音语料库多为单人朗读或脚本化数据、缺乏多通道自发全双工多人对话的现实困境,SmoothConv与DuplexConv数据集应运而生。二者源自相同的底层对话源,覆盖辅导与社交闲聊两大领域,总计提供2100小时的自然中文对话资源。其中,SmoothConv包含100小时的高保真专家人工标注,训练有素的标注者对多通道录音中的重叠语音、反馈、打断、停顿及话轮转换等全双工动态进行精细标记,提供毫秒级对齐文本、话轮交叠信息、停顿与声音事件以及说话人属性等标签。DuplexConv则扩展至2000小时,采用大语言模型辅助的标注流程,自动化转录语音、识别说话人结构与话轮级交互信息,并生成场景级上下文标签,从而在大规模数据上实现高效且风格统一的标注。
使用方法
用户可通过HuggingFace平台直接下载这两个数据集,其中SmoothConv与DuplexConv分别位于独立的仓库中。下载后,可通过目录前缀区分领域:以“edu”或“Edu”开头的文件夹对应辅导场景,以“none_Edu”开头的则代表社交闲聊场景。数据集以音频文件及其对应标注组成,适用于语音对话系统、话轮状态预测、语音理解及全双工对话建模等研究任务。此外,研究团队还从SmoothConv子集中衍生出FastTurn测试集,专注于话轮状态评估,该测试集混合了真实对话片段与合成的等待样本,便于全面测试模型在完整、不完整、反馈与等待等状态上的表现。用户应遵守CC BY-NC 4.0许可协议,仅将数据用于学术研究,并尊重隐私与伦理准则。
背景与挑战
背景概述
在对话式人工智能领域,全双工口语交互——即多说话人自发、重叠、包含反馈与打断的自然对话——是迈向类人智能对话系统的关键挑战。然而,现有的中文语音语料库大多由单说话人、朗读或脚本化数据主导,难以捕捉真实对话中的动态结构。为此,西北工业大学音频语音与语言处理(ASLP)实验室与QualiaLabs于2026年联合推出了SmoothConv与DuplexConv数据集,旨在填补大规模中文全双工对话资源的空白。该数据集包含2100小时的自然对话,涵盖辅导与社交聊天两大领域,其中SmoothConv提供100小时专家精细标注,用于基准测试与监督学习;DuplexConv提供2000小时大规模大语言模型辅助标注,服务于语音大模型的预训练与数据驱动建模。该工作为对话状态预测、话轮转换分析等研究方向奠定了坚实的数据基础,显著推动了中文会话智能研究的发展。
当前挑战
SmoothConv与DuplexConv所解决的领域核心挑战在于:现有语音语料库严重缺乏对全双工对语复杂性的捕捉,如重叠语音、反馈信号、中断、停顿和话轮转换,这些要素对于构建能够自然交互的会话AI至关重要。在构建过程中,面临的挑战包括:一是如何从真实辅导和社交聊天场景中采集多通道、自发性对话,并确保参与者知情同意与隐私保护;二是如何设计标注体系以毫秒级精度对齐转录、话轮重叠、声学事件及说话人属性,这对专家人力与一致性要求极高;三是如何构建可扩展的LLM辅助标注流水线,在保持与专家标注兼容性的同时实现2000小时的大规模数据处理;四是如何合成稀有话轮状态类别(如“等待”)以平衡数据分布,避免模型偏见。这些挑战的克服为全双工对话数据的构建与使用提供了重要实践参考。
常用场景
经典使用场景
在对话式人工智能研究中,SmoothConv与DuplexConv数据集被广泛用于训练和评估全双工语音交互系统。其经典用途聚焦于自然对话中的精细结构建模,包括话轮转换检测、重叠语音识别、打断与反馈行为分析,以及基于副语言特征(如笑声、咳嗽、呼吸)的会话动态捕捉。研究者可借助SmoothConv的高精度专家标注进行监督学习,或利用DuplexConv的大规模语料进行语音大模型的预训练,从而提升系统在真实多说话人场景中的鲁棒性和流畅性。
解决学术问题
该数据集填补了中文全双工多说话人自然对话语料的长期空白。传统语料多基于朗读或脚本化数据,缺乏对真实对话中重叠语音、话轮交替、停顿与反馈等复杂动态的刻画。SmoothConv与DuplexConv通过提供精细的时间对齐标注和丰富的交互标签,使得研究者能够系统性地探讨话轮管理机制、语音打断的声学模式、副语言信号在会话中的功能,以及多通道语音分离与说话人日志等关键科学问题,显著推动了对话语音理解的理论进展。
实际应用
在实际应用层面,该数据集为构建更自然、流畅的人机对话系统提供了核心支撑。例如,智能语音助手可通过学习数据集中的话轮转换模式,实现更精准的打断与等待策略,避免生硬的交互体验。在线教育平台可利用其辅导场景数据,分析师生对话中的停顿与反馈行为,优化实时教学辅助系统。此外,社交机器人、客服语音系统及语音驱动的虚拟角色均能基于数据集中的副语言标注,生成更富有表情和互动感的语音输出。
数据集最近研究
最新研究方向
随着对话式人工智能的迅猛发展,全双工多模态对话系统的研究逐渐成为学术界与工业界共同关注的焦点。传统中文语音语料库多局限于单说话人、朗读或脚本式数据,难以捕捉自然对话中重叠语音、反馈语、打断、停顿及话轮转换等复杂动态现象。SmoothConv与DuplexConv数据集的提出,填补了这一空白,分别提供100小时专家人工标注与2000小时大语言模型辅助标注的高质量中文全双工对话数据,覆盖辅导与社交闲聊两大场景。该数据集不仅为话轮状态预测、语音理解与生成等前沿任务提供了标准化评测基准(如FastTurn测试集),更助力大规模语音大模型的预训练与数据驱动建模,推动了从单通道到多通道、从半双工到全双工对话研究范式的演进,对实现类人交互体验具有重要里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务