kingp12/TORGO-database
收藏资源简介:
TORGO数据库是一个包含构音障碍说话者的声学和发音语音数据集,专注于自动语音识别和音频分类任务。数据集仅包含TORGO数据集中的短词和受限句子部分,不包括非单词和自由句子。转录文本已标准化去除标点但保留大小写,部分无效转录(如xxx)已被移除。总语音数据包括约5.5小时的构音障碍语音和8小时的健康语音。短词部分包括英语数字重复、命令词(如yes、no、方向词)、国际无线电字母表、来自Frenchay构音障碍评估和Yorkston-Beukelman构音障碍语音可懂度评估的单词,以及英国国家语料库中的常见词。受限句子部分包括预选的音素丰富句子(如The quick brown fox jumps over the lazy dog)、Grandfather段落、来自Yorkston-Beukelman评估的句子,以及MOCHA-TIMIT数据库中的TIMIT衍生句子。数据集结构包含音频文件路径、转录文本、性别(男性/女性)、语音状态(构音障碍/健康)和持续时间字段,未提供标准开发/测试分割。数据文件命名格式为speakerNumber_sessionNumber_micType_utteranceNumber.wav,其中说话者编号表示性别和语音状态(例如FC01表示女性健康说话者1)。数据集主要用于学术非营利研究,使用时需引用相关论文。
数据集信息: 特征: - 名称:audio(音频),数据类型:audio(音频) - 名称:transcription(转录文本),数据类型:string(字符串) - 名称:speech_status(语音状态),数据类型:string(字符串) - 名称:gender(性别),数据类型:string(字符串) - 名称:duration(时长),数据类型:float64(64位浮点数) 划分集: - 名称:train(训练集),字节数:1741001462.72,样本数:16552 下载大小:1564871166,数据集总大小:1741001462.72 配置: - 配置名称:default(默认配置),数据文件: - 划分集:train(训练集),路径:data/train-* 任务类别: - 自动语音识别(automatic-speech-recognition) - 音频分类(audio-classification) 语言: - 英语(en) 标签: - 医疗(medical) - 构音障碍(dysarthria) - TORGO数据库(TORGO) - 构音障碍语音(dysarthric speech) 样本规模: - 10亿<样本量<100亿 # TORGO数据库(TORGO Database):构音障碍患者的声学与发音语音语料库 ## 数据集概述 - 本语料库仅包含TORGO数据集的短词与受限句子部分。 - 如需包含非词与无限制句子的完整数据集,请访问:https://www.cs.toronto.edu/~complingweb/data/TORGO/torgo.html。 - 转录文本已进行归一化处理,移除了标点符号,但保留了大小写格式。部分仅包含"xxx"的转录文本已被移除。 - 本数据集包含约5.5小时的构音障碍(dysarthria)语音数据与8小时的健康人语音数据。 <b>短词</b><br> 此类语料可用于研究语音声学特性,无需进行词边界检测。该类别包含以下内容: - 英语数字重复、"yes"(是)、"no"(否)、"up"(上)、"down"(下)、"left"(左)、"right"(右)、"forward"(前)、"back"(后)、"select"(选择)、"menu"(菜单),以及国际无线电通话拼写字母(例如"alpha"(阿尔法)、"bravo"(布拉沃)、"charlie"(查理))。此类词汇可用于辅助无障碍交互的命令软件研究。 - 来自弗雷西构音障碍评估量表(Frenchay Dysarthria Assessment, Enderby, 1983)可懂度部分的50个词汇。 - 来自约克斯顿-伯克曼构音障碍语音可懂度评估量表(Yorkston-Beukelman Assessment of Intelligibility of Dysarthric Speech, Yorkston和Beukelman, 1981)可懂度部分的360个词汇。 - 英国国家语料库(British National Corpus)中出现频率最高的10个词汇。 <b>受限句子</b><br> 为了在自动语音识别(ASR, automatic-speech-recognition)中利用词汇、句法与语义处理能力,我们录制了完整且句法正确的句子。此类句子包含以下内容: - 预选择的富含音素的句子,例如"The quick brown fox jumps over the lazy dog"(敏捷的棕毛狐狸跃过懒狗)、"She had your dark suit in greasy wash water all year"(她一整年都把你的深色西装放在油腻的洗衣水里)以及"Don't ask me to carry an oily rag like that"(别让我拿那种油腻的破布)。 - 祖父段落(Grandfather passage)。 - 来自约克斯顿-伯克曼构音障碍语音可懂度评估量表(Yorkston-Beukelman Assessment of Intelligibility of Dysarthric Speech, Yorkston和Beukelman, 1981)可懂度部分的162个句子。 - 来自MOCHA-TIMIT语料库(MOCHA-TIMIT database, Wrench, 1999; Zue et al, 1989)中用作提示的460个源自TIMIT语料库(TIMIT-derived)的句子。 ## 数据集结构 - 数据样本包含音频文件路径与其转录文本。 - 额外字段包括性别、语音状态(构音障碍或健康)以及时长。 - 本数据集未提供开发集/测试集划分,因为该语料库尚无标准划分方案。 - 文件名格式如下: - speakerNumber_sessionNumber_micType_utteranceNumber.wav - 说话者编号格式为:gender-speechStatus-speakerNumber(例如,FC01代表女性健康对照者1号,M04代表男性构音障碍患者4号) python from datasets import load_dataset dataset = load_dataset("abnerh/TORGO-database") print(dataset) DatasetDict({ train: Dataset({ features: ['audio', 'transcription', 'speech_status', 'gender', 'duration'], num_rows: 16552 }) }) python dataset = load_dataset("abnerh/TORGO-database") print(dataset['train'][0]) {'audio': {'path': 'FC01_1_arrayMic_0066.wav', 'array': array([ 0.00125122, 0.00387573, 0.00115967, ..., 0.00149536, -0.00326538, 0.00027466]), 'sampling_rate': 16000}, 'transcription': 'alpha', 'speech_status': 'healthy', 'gender': 'female', 'duration': 3.3} python print(dataset['train'][12200]) {'audio': {'path': 'M02_1_headMic_0066.wav', 'array': array([ 0.00115967, 0.00106812, 0.00091553, ..., -0.00073242, -0.00082397, -0.00054932]), 'sampling_rate': 16000}, 'transcription': 'yet he still thinks as swiftly as ever', 'speech_status': 'dysarthria', 'gender': 'male', 'duration': 7.605} <b>本数据库仅可用于学术(非盈利)用途。</b>若您在任何出版物中使用本数据集,请至少引用以下论文之一: - Rudzicz, F., Hirst, G., Van Lieshout, P. (2012) 脑性瘫痪语音识别中的声道表征。《语音、语言与听力研究杂志》,55(4):1190-1207,8月。 - Rudzicz, F., Namasivayam, A.K., Wolff, T. (2012) TORGO构音障碍声学与发音语音语料库。《语言资源与评价》,46(4), 523--541页。<b>此文献最贴合本数据集本身。</b> - Rudzicz, F.(2012) 构音障碍语音识别中的发音似然性应用。《语音通信》,54(3), 3月,430--444页。




