遇见数据集

kingp12/TORGO-database

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

TORGO数据库是一个包含构音障碍说话者的声学和发音语音数据集,专注于自动语音识别和音频分类任务。数据集仅包含TORGO数据集中的短词和受限句子部分,不包括非单词和自由句子。转录文本已标准化去除标点但保留大小写,部分无效转录(如xxx)已被移除。总语音数据包括约5.5小时的构音障碍语音和8小时的健康语音。短词部分包括英语数字重复、命令词(如yes、no、方向词)、国际无线电字母表、来自Frenchay构音障碍评估和Yorkston-Beukelman构音障碍语音可懂度评估的单词,以及英国国家语料库中的常见词。受限句子部分包括预选的音素丰富句子(如The quick brown fox jumps over the lazy dog)、Grandfather段落、来自Yorkston-Beukelman评估的句子,以及MOCHA-TIMIT数据库中的TIMIT衍生句子。数据集结构包含音频文件路径、转录文本、性别(男性/女性)、语音状态(构音障碍/健康)和持续时间字段,未提供标准开发/测试分割。数据文件命名格式为speakerNumber_sessionNumber_micType_utteranceNumber.wav,其中说话者编号表示性别和语音状态(例如FC01表示女性健康说话者1)。数据集主要用于学术非营利研究,使用时需引用相关论文。

数据集信息: 特征: - 名称:audio(音频),数据类型:audio(音频) - 名称:transcription(转录文本),数据类型:string(字符串) - 名称:speech_status(语音状态),数据类型:string(字符串) - 名称:gender(性别),数据类型:string(字符串) - 名称:duration(时长),数据类型:float64(64位浮点数) 划分集: - 名称:train(训练集),字节数:1741001462.72,样本数:16552 下载大小:1564871166,数据集总大小:1741001462.72 配置: - 配置名称:default(默认配置),数据文件: - 划分集:train(训练集),路径:data/train-* 任务类别: - 自动语音识别(automatic-speech-recognition) - 音频分类(audio-classification) 语言: - 英语(en) 标签: - 医疗(medical) - 构音障碍(dysarthria) - TORGO数据库(TORGO) - 构音障碍语音(dysarthric speech) 样本规模: - 10亿<样本量<100亿 # TORGO数据库(TORGO Database):构音障碍患者的声学与发音语音语料库 ## 数据集概述 - 本语料库仅包含TORGO数据集的短词与受限句子部分。 - 如需包含非词与无限制句子的完整数据集,请访问:https://www.cs.toronto.edu/~complingweb/data/TORGO/torgo.html。 - 转录文本已进行归一化处理,移除了标点符号,但保留了大小写格式。部分仅包含"xxx"的转录文本已被移除。 - 本数据集包含约5.5小时的构音障碍(dysarthria)语音数据与8小时的健康人语音数据。 <b>短词</b><br> 此类语料可用于研究语音声学特性,无需进行词边界检测。该类别包含以下内容: - 英语数字重复、"yes"(是)、"no"(否)、"up"(上)、"down"(下)、"left"(左)、"right"(右)、"forward"(前)、"back"(后)、"select"(选择)、"menu"(菜单),以及国际无线电通话拼写字母(例如"alpha"(阿尔法)、"bravo"(布拉沃)、"charlie"(查理))。此类词汇可用于辅助无障碍交互的命令软件研究。 - 来自弗雷西构音障碍评估量表(Frenchay Dysarthria Assessment, Enderby, 1983)可懂度部分的50个词汇。 - 来自约克斯顿-伯克曼构音障碍语音可懂度评估量表(Yorkston-Beukelman Assessment of Intelligibility of Dysarthric Speech, Yorkston和Beukelman, 1981)可懂度部分的360个词汇。 - 英国国家语料库(British National Corpus)中出现频率最高的10个词汇。 <b>受限句子</b><br> 为了在自动语音识别(ASR, automatic-speech-recognition)中利用词汇、句法与语义处理能力,我们录制了完整且句法正确的句子。此类句子包含以下内容: - 预选择的富含音素的句子,例如"The quick brown fox jumps over the lazy dog"(敏捷的棕毛狐狸跃过懒狗)、"She had your dark suit in greasy wash water all year"(她一整年都把你的深色西装放在油腻的洗衣水里)以及"Don't ask me to carry an oily rag like that"(别让我拿那种油腻的破布)。 - 祖父段落(Grandfather passage)。 - 来自约克斯顿-伯克曼构音障碍语音可懂度评估量表(Yorkston-Beukelman Assessment of Intelligibility of Dysarthric Speech, Yorkston和Beukelman, 1981)可懂度部分的162个句子。 - 来自MOCHA-TIMIT语料库(MOCHA-TIMIT database, Wrench, 1999; Zue et al, 1989)中用作提示的460个源自TIMIT语料库(TIMIT-derived)的句子。 ## 数据集结构 - 数据样本包含音频文件路径与其转录文本。 - 额外字段包括性别、语音状态(构音障碍或健康)以及时长。 - 本数据集未提供开发集/测试集划分,因为该语料库尚无标准划分方案。 - 文件名格式如下: - speakerNumber_sessionNumber_micType_utteranceNumber.wav - 说话者编号格式为:gender-speechStatus-speakerNumber(例如,FC01代表女性健康对照者1号,M04代表男性构音障碍患者4号) python from datasets import load_dataset dataset = load_dataset("abnerh/TORGO-database") print(dataset) DatasetDict({ train: Dataset({ features: ['audio', 'transcription', 'speech_status', 'gender', 'duration'], num_rows: 16552 }) }) python dataset = load_dataset("abnerh/TORGO-database") print(dataset['train'][0]) {'audio': {'path': 'FC01_1_arrayMic_0066.wav', 'array': array([ 0.00125122, 0.00387573, 0.00115967, ..., 0.00149536, -0.00326538, 0.00027466]), 'sampling_rate': 16000}, 'transcription': 'alpha', 'speech_status': 'healthy', 'gender': 'female', 'duration': 3.3} python print(dataset['train'][12200]) {'audio': {'path': 'M02_1_headMic_0066.wav', 'array': array([ 0.00115967, 0.00106812, 0.00091553, ..., -0.00073242, -0.00082397, -0.00054932]), 'sampling_rate': 16000}, 'transcription': 'yet he still thinks as swiftly as ever', 'speech_status': 'dysarthria', 'gender': 'male', 'duration': 7.605} <b>本数据库仅可用于学术(非盈利)用途。</b>若您在任何出版物中使用本数据集,请至少引用以下论文之一: - Rudzicz, F., Hirst, G., Van Lieshout, P. (2012) 脑性瘫痪语音识别中的声道表征。《语音、语言与听力研究杂志》,55(4):1190-1207,8月。 - Rudzicz, F., Namasivayam, A.K., Wolff, T. (2012) TORGO构音障碍声学与发音语音语料库。《语言资源与评价》,46(4), 523--541页。<b>此文献最贴合本数据集本身。</b> - Rudzicz, F.(2012) 构音障碍语音识别中的发音似然性应用。《语音通信》,54(3), 3月,430--444页。

提供机构:
kingp12
搜集汇总
数据集介绍
kingp12/TORGO-database 数据集图片
构建方式
TORGO-database致力于收录构音障碍患者的声学与发音言语数据,由多伦多大学团队精心构建。数据集聚焦于短词汇与受限语句的语料,包括英语数字、方向指令、国际无线电字母表等基础词汇,以及来自Frenchay Dysarthria Assessment和Yorkston-Beukelman Assessment的单词与句子。语音内容涵盖音素丰富的预设句、经典段落及MOCHA-TIMIT衍生句,总计约5.5小时构音障碍语音与8小时健康对照语音。数据以16kHz采样率的WAV格式存储,文件命名规范(如FC01_1_arrayMic_0066.wav)明确标识说话者性别、健康状态、话筒类型与编号,确保后续研究的可追溯性。
使用方法
数据集的访问与使用极为便捷,用户可通过HuggingFace的datasets库一键加载:使用`load_dataset('abnerh/TORGO-database')`初始化,返回包含16552条样本的`DatasetDict`对象。每条样本以字典形式呈现,字段包括音频路径、波形数组(`array`)、采样率(16000 Hz)、转录文本、言语状态及时长。使用者可直接索引训练集,如`dataset['train'][0]`获取单个样本详情。此数据集仅限于学术(非营利)目的,引用时需注明相关文献,适用于构音障碍语音识别、音频分类及可懂度分析等研究领域。
背景与挑战
背景概述
TORGO数据库由多伦多大学的Rudzicz、Hirst和Van Lieshout等人于2012年创建,旨在系统研究构音障碍(dysarthria)患者的声学与发音特征。该数据库聚焦于脑性瘫痪等疾病引起的言语障碍,收录了约5.5小时构音障碍语音与8小时健康语音,涵盖短词、受限句子等结构化语料,并提供了性别、语音状态等元数据。作为构音障碍语音处理领域的基准资源,TORGO极大推动了自动语音识别(ASR)在医疗辅助技术中的应用,尤其在语音分类与无障碍人机交互研究中具有里程碑意义。
当前挑战
该数据集面临的核心挑战在于构音障碍语音的高度异质性:患者因肌肉控制异常导致发音变异极大,使得传统ASR模型难以捕捉稳定的声学模式。此外,数据集在构建过程中需克服多个难点:一是语料收集需平衡词表覆盖度与患者认知负荷,仅采用短词与受限句子以降低参与难度;二是音频录制需同步捕捉高保真声学信号与发音动作数据,对实验设备与流程要求严苛;三是转录标准化时需剔除无效语音(如仅含‘xxx’的样本),并统一标注规范以避免人工误差。
常用场景
经典使用场景
TORGO数据库作为构音障碍语音研究的基石,其经典使用场景聚焦于面向言语障碍的自动语音识别(ASR)任务。该数据集涵盖约5.5小时构音障碍语音与8小时健康对照语音,包含短词汇与受限语句两大模块,其中精心设计的词表源自英语数字、国际无线电字母表以及Frenchay和Yorkston-Beukelman评估工具中的词汇,而受限语句则选取了音素丰富句子、祖父段落及TIMIT衍生句。研究者通常利用这些精心标注的音频数据来训练和评估针对构音障碍者的ASR系统,尤其是在词汇边界模糊或发音变异性大的情境下,考察模型对非典型言语模式的鲁棒性。
解决学术问题
该数据集解决了构音障碍语音识别研究中的核心学术挑战,即如何应对由运动性言语障碍引起的音系变异、发音不连贯及音素混淆等问题。通过提供标准化的构音障碍与健康对照语音,TORGO使研究人员能够量化构音障碍对声学特征的影响,探索声学-发音关联分析,并推动适应个性化语音模式的模型设计。其意义在于打破了传统ASR仅适用于规范语音的局限,为言语病理学与计算语言学交叉领域提供了可复现的实验平台,深刻影响了言语障碍评估、辅助沟通技术及康复效果量化等方向的理论发展与实践推进。
实际应用
TORGO数据库的实际应用场景深度嵌入医疗与人机交互领域,尤其在开发面向构音障碍患者的智能辅助沟通系统中扮演关键角色。基于该数据集训练的语音识别模型可集成至无障碍控制软件,如通过语音指令实现轮椅导航、环境控制或电子设备操作,其中包含的指令性词汇(如‘上’、‘下’、‘左’、‘右’)直接针对此类应用设计。此外,在临床言语评估中,数据集的标注信息为自动化构音障碍严重程度分级提供了基准,助力远程康复监测与个性化治疗方案的制定,极大地提升了言语障碍者的生活自主性与社会参与度。
数据集最近研究
最新研究方向
TORGO数据库作为构音障碍语音研究的基石,正被广泛应用于前沿的端到端自动语音识别(ASR)模型优化与多模态声学-发音关联分析。当前研究热点聚焦于利用该数据集中约5.5小时的构音障碍语音与8小时健康语音样本,探索针对言语障碍人群的鲁棒性特征提取方法,如结合注意力机制的声学建模和预训练语言模型的微调策略。此外,该数据库在辅助无障碍人机交互技术开发中具有重要价值,尤其是为脑瘫等神经运动障碍患者的语音命令系统提供了标准化评测基准。随着深度学习在医疗语音领域的深入,TORGO数据集正推动从传统声学特征向发音运动参数融合的转型,其提供的词汇和受限语句子集为解析构音障碍的声学变异性和语音可懂度评估提供了关键数据支撑,对临床言语病理学评估与康复辅助技术的进步具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务