NVSpeech170k
收藏资源简介:
NVSpeech170k是一个大规模、开源的数据集,包含174,179个自动标注的语音片段,总计约573小时。数据集涵盖了18种细粒度的副语言类别,如笑声、呼吸、哭泣等,这些在传统的ASR和TTS系统中常被忽略。该数据集支持副语言感知的ASR和可控的语音合成,具有普通话优先设计,并展示了跨语言(如英语)的适用性。
NVSpeech170k is a large-scale, open-source dataset containing 174,179 automatically annotated speech segments with a total duration of approximately 573 hours. It covers 18 fine-grained paralinguistic categories including laughter, breathing, crying and other similar paralinguistic cues, which are frequently overlooked in traditional Automatic Speech Recognition (ASR) and Text-to-Speech (TTS) systems. This dataset supports paralinguistics-aware ASR and controllable speech synthesis, is designed with Mandarin as the priority language, and demonstrates cross-language applicability (e.g., English).
NVSpeech数据集概述
1. 数据集简介
- 名称:NVSpeech
- 特点:首个大规模开源管道,联合识别和合成副语言发声(如笑声、呼吸、哭泣等)
- 核心价值:建模人类说话方式(不仅关注内容,更关注表达方式)
2. 关键数据指标
- 标注数据量:48,430条人工标注语音 + 174,179条自动标注语音
- 总时长:约573小时
- 语言:以中文为主设计,已证明可跨语言应用于英语
3. 副语言标签体系
- 类别数量:18种细粒度分类
- 主要类别:
- 生理发声(呼吸/咳嗽/叹息)
- 情感表达(笑声/哭泣)
- 填充词(uhm/oh等)
- 疑问/确认语气标记
4. 技术功能
ASR系统
- 特性:内联解码副语言标记
- 示例:将音频转换为含非语言标记的文本(如"Youre so funny [Laughter]")
TTS系统
- 特性:支持任意位置插入副语言标记
- 控制粒度:位置感知的精细控制
5. 资源获取
- 论文:https://arxiv.org/abs/2508.04195
- 演示页面:https://nvspeech170k.github.io/
- 数据集地址:https://huggingface.co/datasets/Hannie0813/NVSpeech170k
6. 发布计划
- 已完成:自动标注数据集、ASR/TTS演示系统
- 待发布:副语言感知ASR模型推理代码、预训练模型(中英文)
7. 许可信息
- 许可证类型:CC BY-NC-SA 4.0




