aesdd-dataspeech-tags-v1
收藏资源简介:
该数据集包含605个训练样本,每个样本由多个字段组成,涵盖了语音相关的文本、说话人信息和声学特征。具体字段包括:文本内容(text)、说话人ID(speaker_id)、性别(gender)、情感状态(emotion)、音高及其统计量(pitch, pitch_std, utterance_pitch_mean, utterance_pitch_std)、信噪比(snr)、清晰度指标(c50)、语速(speaking_rate)、音素信息(phonemes)、语音质量评估指标(pesq, pesq_speech_quality)、信号失真比(si_sdr, si-sdr)、语音可懂度指标(stoi)、环境噪声(noise)、混响条件(reverberation)、语音单调性(speech_monotony)和噪声下的信噪比(sdr_noise)。数据集适用于语音分析、语音质量评估、情感识别、说话人特征研究等任务,尤其关注在噪声和混响环境下的语音特性。
This dataset contains 605 training samples, each consisting of multiple fields covering speech-related text, speaker information, and acoustic features. Specific fields include: text content (text), speaker ID (speaker_id), gender (gender), emotional state (emotion), pitch and its statistics (pitch, pitch_std, utterance_pitch_mean, utterance_pitch_std), signal-to-noise ratio (snr), clarity metric (c50), speaking rate (speaking_rate), phoneme information (phonemes), speech quality assessment metrics (pesq, pesq_speech_quality), signal-to-distortion ratio (si_sdr, si-sdr), speech intelligibility metric (stoi), environmental noise (noise), reverberation conditions (reverberation), speech monotony (speech_monotony), and signal-to-noise ratio under noise (sdr_noise). The dataset is suitable for tasks such as speech analysis, speech quality assessment, emotion recognition, and speaker characteristic research, with a particular focus on speech characteristics in noisy and reverberant environments.
数据集概述:AESDD DataSpeech Tags v1
数据集名称:AESDD DataSpeech Tags v1
数据集地址:https://huggingface.co/datasets/nvlachak/aesdd-dataspeech-tags-v1
数据集特征
该数据集包含以下字段(共21列):
text(字符串):语音对应的文本内容speaker_id(字符串):说话人标识gender(字符串):说话人性别emotion(字符串):语音情感标签pitch(浮点数):基频(pitch)值pitch_std(浮点数):基频标准差snr(浮点数):信噪比c50(浮点数):清晰度指数(C50)speaking_rate(字符串):语速phonemes(浮点数):音素数量pesq(浮点数):语音质量感知评估(PESQ)得分si_sdr(浮点数):尺度不变信噪比(SI-SDR)stoi(浮点数):短时客观可懂度(STOI)utterance_pitch_std(浮点数):语句基频标准差utterance_pitch_mean(浮点数):语句基频均值si-sdr(浮点数):尺度不变信噪比(重复字段,与si_sdr内容一致)noise(字符串):噪声类型标签reverberation(字符串):混响类型标签speech_monotony(字符串):语音单调性标签sdr_noise(字符串):噪声SDR标签pesq_speech_quality(字符串):PESQ语音质量标签
数据划分
- 训练集(train):共605个样本,占用存储147,511字节
数据大小
- 总下载大小:11,847字节
- 数据集总大小:147,511字节
配置文件
- 默认配置(config_name:
default) - 训练数据文件路径:
data/train-*(通配符匹配)




