SmoothConv and DuplexConv
收藏资源简介:
SmoothConv和DuplexConv是两个大规模中文全双工会话语音数据集,用于对话AI。SmoothConv包含100小时的多方自然中文对话,涵盖辅导和社交聊天场景,提供专家人工标注,包括对齐的转录、时间戳、说话人转换、重叠、暂停和声音事件等细粒度标签。DuplexConv包含2000小时的相同领域数据,采用LLM辅助标注,为大规模语音LLM预训练和数据驱动建模提供支持。这两个数据集共同填补了开源中文语音语料中多通道、自发全双工会话数据的空白。
SmoothConv and DuplexConv are two large-scale Chinese full-duplex conversational speech datasets designed for conversational AI systems. SmoothConv contains 100 hours of multi-party natural Chinese conversations covering tutoring and social chat scenarios, with expert manual annotations including fine-grained labels such as aligned transcripts, timestamps, speaker turn changes, overlapping speech, pauses, and sound events. DuplexConv includes 2000 hours of data from the same domains, adopting LLM-aided annotation to support large-scale speech LLM pre-training and data-driven modeling. Collectively, these two datasets fill the gap in open-source Chinese speech corpora for multi-channel, spontaneous full-duplex conversational data.
数据集概述:SmoothConv & DuplexConv
基本信息
- 发布机构:ASLP@NPU(西北工业大学)与 QualiaLabs 联合开发
- 许可证:CC BY-NC 4.0(仅限学术与研究用途)
- 下载地址:
- SmoothConv:https://huggingface.co/datasets/qualialabsAI/SmoothConv
- DuplexConv:https://huggingface.co/datasets/qualialabsAI/DuplexConv
- FastTurn 测试集:https://huggingface.co/datasets/ASLP-lab/FastTurn-Testset
- 演示页面:https://qualialabsai.github.io/SmoothConv-DuplexConv
数据集构成
SmoothConv 和 DuplexConv 源于相同的底层对话源,互为补充,总计提供 2,100 小时的自然中文对话数据,涵盖 辅导(Tutoring) 和 社交聊天(Social Chat) 两个领域。目录中,辅导数据位于以 edu 或 Edu 为前缀的文件夹下;社交聊天数据位于以 none_Edu 为前缀的文件夹下。
SmoothConv(100 小时 — 专家人工标注)
- 时长:100.53 小时
- 音频文件数:2,503 个
- 平均片段长度:144.6 秒
- 片段长度范围:60.0 – 634.7 秒
- 标注内容:由训练有素的专家提供精细化标注,包括:
- 毫秒级时间戳对齐的转录文本
- 话轮转换与重叠(说话人切换、重叠、话轮保持)
- 停顿与声音事件(笑声、咳嗽、呼吸、静音等)
- 说话人属性(性别、年龄、情绪及相关交互标签)
DuplexConv(2,000 小时 — LLM 辅助标注)
- 时长:2,000.21 小时
- 音频文件数:93,709 个
- 平均片段长度:76.8 秒
- 片段长度范围:8.0 – 618.3 秒
- 标注方式:采用 LLM 辅助流水线生成转录文本、说话人感知的对话结构、话轮级交互信息及场景级上下文标签,适用于大规模语音大模型预训练和对话语音系统的数据驱动建模。
FastTurn 测试集
从 SmoothConv 数据子集中构建的话轮状态评估基准,用于话轮状态预测评估。结合真实对话片段与 1,000 个合成的 wait 样本(文本来源:DeepSeek V3;音频来源:IndexTTS2),以补充自然对话中罕见的 wait 类别。
| 话轮状态 | 来源 | 样本数 | 时长(小时) |
|---|---|---|---|
| Complete | 真实 | 14,709 | 9.64 |
| Incomplete | 真实 | 3,643 | 2.15 |
| Backchannel | 真实 | 3,080 | 0.42 |
| Wait | 合成 | 1,000 | 0.71 |
道德声明要点
- 知情同意:对话在参与者知情并同意的情况下录制,发布前已去除或匿名化个人标识。
- 隐私保护:仅限学术研究用途,禁止重新识别说话人或重建私人信息。
- 预期用途:用于口语对话、话轮转换和语音理解研究,禁止用于未经授权的监控、冒充或生成欺骗性内容。
- 局限性:标注可能存在错误;DuplexConv 标签为机器辅助生成。研究人员在训练或评估模型时应考虑领域、人口统计和标注偏差。





