SS-JDSC
收藏资源简介:
SS-JDSC是一个单说话者日语构音障碍语音语料库,专为自动语音识别及相关任务研究设计。它包含约15小时的语音数据,来自一名患有鼻咽腔闭锁不全的日本男性说话者,涵盖三个子集:basic(与正常语音平行)、hard(包含难以辨别的音素)和daily(日常用语短语),总共有11,502个话语,音频格式为44.1 kHz采样率、16位RIFF WAV。
SS-JDSC is a single-speaker Japanese dysarthric speech corpus developed exclusively for research on automatic speech recognition and related tasks. It contains approximately 15 hours of speech data collected from a Japanese male speaker diagnosed with nasopharyngeal atresia. The corpus includes three subsets: basic (parallel to normal speech), hard (consisting of difficult-to-discriminate phonemes), and daily (comprising everyday conversational phrases). In total, it encompasses 11,502 utterances. All audio files are formatted as 16-bit RIFF WAV with a sampling rate of 44.1 kHz.
SS-JDSC: 単一話者による日本語構音障害音声コーパス / Single-speaker Japanese dysarthric speech corpus
数据集概述
- 本数据集是为日语构音障碍语音识别及相关任务设计的单说话人朗读语音语料库
- 包含约15小时的鼻咽腔闭锁不全伴随构音障碍语音数据
- 说话人为单一日语男性说话人
语料设计
数据集由3个子集构成:
Basic子集
- 与正常语音(JSUT语料库BASIC5000)相同的语句
- 语句数量:4,701条
- 时长:6.89小时
Hard子集
包含难以听辨的音素发音:
- CF类别:包含难以听辨音素的语句(2,094条,1.84小时)
- PCS类别:语音上容易混淆的语句(75条,0.07小时)
- SUS类别:合语法无意义语句(73条,0.09小时)
Daily子集
包含日常使用短语:
- Everyday类别:与家人朋友的对话(2,098条,2.62小时)
- Research类别:与研究人员的讨论(927条,1.39小时)
- Work类别:公共设施中的对话(721条,1.06小时)
- Emotion类别:情感表达和陈述(414条,0.54小时)
- Others类别:紧急情况、季节或爱好相关(399条,0.63小时)
总计
- 总语句数:11,502条
- 总时长:15.12小时
技术规格
- 音频格式:44.1 kHz采样频率,16位编码RIFF WAV格式
- 包含各子集的测试集列表(test_basic.txt、test_hard.txt、test_daily.txt)
语音识别基准
| 模型 | 单词错误率(WER) | BERTScore | 人工评估 |
|---|---|---|---|
| Whisper large v3(无微调) | 0.934 | 0.654 | 1.217 |
| + 微调(13.0小时) | 0.283 | 0.915 | 3.748 |
| + 微调 + LLM | 0.257 | 0.917 | 4.198 |
许可信息
- 许可证:CC BY-NC-SA 4.0
- 引用信息:待公布




