相关数据集
1,796小时德语手机采集语音数据
德国德语语音数据_朗读(手机),基于给定的脚本朗读并模拟录制,涵盖通用、交互、车载、家居等多类别,内容丰富。此数据集标注了文本内容等多种属性,由3,442名来自不同地域和文化背景的德国本土人参与录制,口音正宗,文本经过人工校对,准确率高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储
数据堂140
D346_Brazilian_Portuguese_Conversational_Speech_Data_by_Mobile_P
巴西葡萄牙语语音数据_对话(手机),基于约三十个常见主题来模拟录制。此数据集标注了文本内容、句时间戳、说话人身份、性别等多种属性,由142名来自不同地域和文化背景的巴西本土人录制,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据
OpenCSG2026-03-04 更新80
A Novel Coronavirus Speech Dataset: CoSDa
Turkish speech dataset of healthy and sick (COVID-19) individuals.
kaggle2021-09-10 更新60
atgarcia/voicedParallelData3
该数据集包含文本、音频和肌电图三种类型的数据。文本数据为字符串格式,音频数据包括浮点数数组、文件路径和采样率,肌电图数据为浮点数序列。数据集分为训练集,包含500个样本,总大小为974033436字节。数据集的下载大小为363775854字节。
Hugging Face2024-07-02 更新110
D083_French_Canada_Spontaneous_Dialogue_Smartphone_speech_datase
加拿大法语音数据_对话(手机),基于约三十个常见主题来模拟录制。此数据集标注了文本内容、句时间戳、说话人身份、性别等多种属性,由238名来自不同地域和文化背景的加拿大魁北克省本土人录制,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所
OpenCSG2026-03-04 更新80



