WenetSpeech-Wu
收藏资源简介:
WenetSpeech-Wu 是首个大规模吴语方言语音语料库,具有多维度的标注信息。该数据集包含约8,000小时的语音数据,覆盖八个吴语子方言和多种领域。数据标注包括带置信度的转录文本、吴语到普通话的翻译、领域和子方言标签、说话人属性、情感标注以及音频质量评估。数据集采用任务特定的数据质量分级策略,支持多种语音处理任务。WenetSpeech-Wu-Bench 是首个公开的吴语方言语音处理基准,涵盖自动语音识别(ASR)、吴语到普通话的语音翻译(AST)、说话人属性识别、情感识别、文本到语音(TTS)和指令跟随的TTS等任务,为公平评估提供了统一平台。
WenetSpeech-Wu is the first large-scale Wu dialect speech corpus with multi-dimensional annotations. This dataset contains approximately 8,000 hours of speech data, covering eight Wu dialect sub-varieties and multiple domains. Its annotations include confidence-aware transcriptions, Wu-to-Mandarin translations, domain and sub-variety labels, speaker attributes, emotion annotations, and audio quality assessments. The dataset adopts a task-specific data quality grading strategy and supports a wide range of speech processing tasks. WenetSpeech-Wu-Bench is the first publicly available Wu dialect speech processing benchmark, covering tasks such as automatic speech recognition (ASR), Wu-to-Mandarin speech translation (AST), speaker attribute recognition, emotion recognition, text-to-speech (TTS), and instruction-following TTS, providing a unified platform for fair evaluation.
WenetSpeech-Wu 数据集概述
数据集基本信息
- 名称: WenetSpeech-Wu
- 语言: 中文 (zh)
- 主要任务类别: 自动语音识别 (automatic-speech-recognition)
- 许可证: Apache 2.0 (apache-2.0)
数据集描述
WenetSpeech-Wu 是首个大规模、多维度标注的吴语方言语音语料库。它旨在为统一的汉语吴方言语音处理生态系统提供数据集、基准和模型。
数据规模与内容
- 总时长: 约 8,000 小时语音。
- 方言覆盖: 涵盖八种吴语次方言。
- 数据来源: 从多样化的领域收集。
- 标注维度: 包含丰富的元数据和标注,具体包括:
- 带有置信度得分的转录文本。
- 吴语到普通话的翻译。
- 领域和次方言标签。
- 说话人属性。
- 情感标注。
- 音频质量度量。
- 数据分级: 采用面向特定任务的数据质量分级策略,以支持具有不同质量要求的广泛语音处理任务。
相关资源
- 数据集地址: https://huggingface.co/datasets/ASLP-lab/WenetSpeech-Wu
- 基准测试集 (WenetSpeech-Wu-Bench): https://huggingface.co/datasets/ASLP-lab/WenetSpeech-Wu-Bench
- 语音识别与理解模型: https://huggingface.co/ASLP-lab/WenetSpeech-Wu-Speech-Understanding
- 语音合成与生成模型: https://huggingface.co/ASLP-lab/WenetSpeech-Wu-Speech-Generation
- 论文: https://arxiv.org/abs/2601.11027
- GitHub 仓库: https://github.com/ASLP-lab/WenetSpeech-Wu-Repo
- HuggingFace 集合: https://huggingface.co/collections/ASLP-lab/wenetspeech-wu
- 演示页面: https://hujingbin1.github.io/WenetSpeechWu-Demo-Page-Public/
基准测试 (WenetSpeech-Wu-Bench)
WenetSpeech-Wu-Bench 是首个公开的、人工精心策划的吴语方言语音处理基准,涵盖了以下任务,并提供了一个公平评估的统一平台:
- 自动语音识别 (ASR): 吴方言 ASR(9.75小时,上海话、苏州话和普通话混合语音)。以字错误率 (CER) 评估。
- 吴语到普通话语音翻译 (AST): 从吴方言到普通话的语音翻译(3千条话语,4.4小时)。以 BLEU 分数评估。
- 说话人与情感: 吴语语音的说话人性别/年龄预测和情感识别。以分类准确率评估。
- 语音合成 (TTS): 带有说话人提示的吴方言 TTS(242个句子,12位说话人)。以说话人相似度、CER 和平均意见得分 (MOS) 评估。
- 指令语音合成 (Instruct TTS): 具有韵律和情感控制的指令跟随 TTS。以自动准确率和主观 MOS 评估。
数据构建流程
该项目提出了一个自动化、可扩展的流程,用于构建具有多维度标注的大规模吴语方言语音数据集。该流程旨在实现高效的数据收集、鲁棒的自动转录和多样化的下游标注。
备注
相关团队还发布了其他方言的大规模语音数据:
- WenetSpeech-Yue: 21,800 小时多标签粤语语音数据。
- WenetSpeech-Chuan: 10,000 小时多标签川渝方言语音数据。





