SpeechPPL/SALMon_TASLM-normalized2
收藏资源简介:
--- dataset_info: - config_name: bg_alignment features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 87024318 num_examples: 200 download_size: 87024318 dataset_size: 87024318 - config_name: bg_all_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: prompt_asr_text dtype: string - name: prompt_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: prompt_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 22050 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: prompt_asr_text_old dtype: string - name: prompt_sample_wordlevel_loss_old sequence: float64 - name: positive_continuation_wordlevel_loss sequence: float32 - name: negative_continuation_wordlevel_loss sequence: float32 - name: continuation_asr_text dtype: string - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 270240761 num_examples: 200 download_size: 270240761 dataset_size: 270240761 - config_name: bg_domain_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: prompt_asr_text dtype: string - name: prompt_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: prompt_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 22050 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: prompt_asr_text_old dtype: string - name: prompt_sample_wordlevel_loss_old sequence: float64 - name: positive_continuation_wordlevel_loss sequence: float32 - name: negative_continuation_wordlevel_loss sequence: float32 - name: continuation_asr_text dtype: string - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 270011718 num_examples: 200 download_size: 270011718 dataset_size: 270011718 - config_name: gender_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: prompt_asr_text dtype: string - name: prompt_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: prompt_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 22050 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: prompt_asr_text_old dtype: string - name: prompt_sample_wordlevel_loss_old sequence: float64 - name: positive_continuation_wordlevel_loss sequence: float32 - name: negative_continuation_wordlevel_loss sequence: float32 - name: continuation_asr_text dtype: string - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 278743927 num_examples: 200 download_size: 278743927 dataset_size: 278743927 - config_name: rir_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: prompt_asr_text dtype: string - name: prompt_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: prompt_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 22050 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: prompt_asr_text_old dtype: string - name: prompt_sample_wordlevel_loss_old sequence: float64 - name: positive_continuation_wordlevel_loss sequence: float32 - name: negative_continuation_wordlevel_loss sequence: float32 - name: continuation_asr_text dtype: string - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 259091116 num_examples: 200 download_size: 259091116 dataset_size: 259091116 - config_name: sentiment_alignment features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 46920619 num_examples: 200 download_size: 46920619 dataset_size: 46920619 - config_name: sentiment_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: prompt_asr_text dtype: string - name: prompt_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: prompt_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 22050 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: prompt_asr_text_old dtype: string - name: prompt_sample_wordlevel_loss_old sequence: float64 - name: positive_continuation_wordlevel_loss sequence: float32 - name: negative_continuation_wordlevel_loss sequence: float32 - name: continuation_asr_text dtype: string - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 272654768 num_examples: 200 download_size: 272654768 dataset_size: 272654768 - config_name: speaker_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_asr_text dtype: string - name: positive_spk_embed sequence: float32 - name: negative_asr_text dtype: string - name: negative_spk_embed sequence: float32 - name: prompt_asr_text dtype: string - name: prompt_spk_embed sequence: float32 - name: positive_sample_wordlevel_loss sequence: float32 - name: negative_sample_wordlevel_loss sequence: float32 - name: prompt_sample_wordlevel_loss sequence: float32 - name: code_frame_rate dtype: string - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 22050 - name: positive_asr_text_old dtype: string - name: negative_asr_text_old dtype: string - name: negative_sample_wordlevel_loss_old sequence: float64 - name: positive_sample_wordlevel_loss_old sequence: float64 - name: positive_asr_chunks list: - name: text dtype: string - name: timestamp sequence: float64 - name: prompt_asr_text_old dtype: string - name: prompt_sample_wordlevel_loss_old sequence: float64 - name: positive_continuation_wordlevel_loss sequence: float32 - name: negative_continuation_wordlevel_loss sequence: float32 - name: continuation_asr_text dtype: string - name: ppl_sanity_aligned dtype: int64 splits: - name: train num_bytes: 283506280 num_examples: 200 download_size: 283506280 dataset_size: 283506280 --- # SALMon Normalized Dataset This repo preserves the SALMon per-config folder layout while normalizing mismatched schema details across model families.
数据集信息: - 配置名称:bg_alignment(bg_alignment) 特征字段: - 字段名:task,数据类型:字符串(string) - 字段名:ind,数据类型:64位整数(int64) - 字段名:positive_audio,含义:正样本音频(audio),数据类型:音频(audio) - 字段名:negative_audio,含义:负样本音频(audio),数据类型:音频(audio) - 字段名:prompt_audio,含义:提示音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:continuation_audio_positive,含义:正样本续接音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:continuation_audio_negative,含义:负样本续接音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:negative_audio_sanity,含义:验证负样本音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:positive_asr_text,含义:正样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:positive_spk_embed,含义:正样本说话人嵌入(speaker embedding),数据类型:32位浮点型(float32)序列 - 字段名:negative_asr_text,含义:负样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:negative_spk_embed,含义:负样本说话人嵌入(speaker embedding),数据类型:32位浮点型(float32)序列 - 字段名:positive_sample_wordlevel_loss,含义:正样本词级损失,数据类型:32位浮点型(float32)序列 - 字段名:negative_sample_wordlevel_loss,含义:负样本词级损失,数据类型:32位浮点型(float32)序列 - 字段名:code_frame_rate,数据类型:字符串(string) - 字段名:code_depth,数据类型:64位整数(int64) - 字段名:model_sampling_rate,含义:模型采样率,数据类型:64位整数(int64) - 字段名:ppl_sanity,含义:验证困惑度,数据类型:64位整数(int64) - 字段名:positive_asr_text_old,含义:旧版正样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:negative_asr_text_old,含义:旧版负样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:negative_sample_wordlevel_loss_old,含义:旧版负样本词级损失,数据类型:64位浮点型(float64)序列 - 字段名:positive_sample_wordlevel_loss_old,含义:旧版正样本词级损失,数据类型:64位浮点型(float64)序列 - 字段名:positive_asr_chunks,含义:正样本语音分块,数据类型:列表,包含: - 字段名:text,含义:分块文本,数据类型:字符串(string) - 字段名:timestamp,含义:时间戳,数据类型:64位浮点型(float64)序列 - 字段名:ppl_sanity_aligned,含义:对齐验证困惑度,数据类型:64位整数(int64) 数据划分: - 划分名称:train(训练集),字节数:87024318,样本数量:200 下载大小:87024318,数据集大小:87024318 - 配置名称:bg_all_consistency(bg_all_consistency) 特征字段: - 字段名:task,数据类型:字符串(string) - 字段名:ind,数据类型:64位整数(int64) - 字段名:positive_audio,含义:正样本音频(audio),数据类型:音频(audio) - 字段名:negative_audio,含义:负样本音频(audio),数据类型:音频(audio) - 字段名:audio_transition_s,含义:音频过渡时长(秒),数据类型:64位整数(int64) - 字段名:prompt_audio,含义:提示音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:continuation_audio_positive,含义:正样本续接音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:continuation_audio_negative,含义:负样本续接音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:negative_audio_sanity,含义:验证负样本音频(audio),数据类型:音频(audio),采样率:16000 - 字段名:positive_asr_text,含义:正样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:positive_spk_embed,含义:正样本说话人嵌入(speaker embedding),数据类型:32位浮点型(float32)序列 - 字段名:negative_asr_text,含义:负样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:negative_spk_embed,含义:负样本说话人嵌入(speaker embedding),数据类型:32位浮点型(float32)序列 - 字段名:prompt_asr_text,含义:提示自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:prompt_spk_embed,含义:提示说话人嵌入(speaker embedding),数据类型:32位浮点型(float32)序列 - 字段名:positive_sample_wordlevel_loss,含义:正样本词级损失,数据类型:32位浮点型(float32)序列 - 字段名:negative_sample_wordlevel_loss,含义:负样本词级损失,数据类型:32位浮点型(float32)序列 - 字段名:prompt_sample_wordlevel_loss,含义:提示样本词级损失,数据类型:32位浮点型(float32)序列 - 字段名:code_frame_rate,数据类型:字符串(string) - 字段名:code_depth,数据类型:64位整数(int64) - 字段名:model_sampling_rate,含义:模型采样率,数据类型:64位整数(int64) - 字段名:ppl_sanity,含义:验证困惑度,数据类型:64位整数(int64) - 字段名:model_generated_continuation,含义:模型生成续接音频(audio),数据类型:音频(audio),采样率:22050 - 字段名:positive_asr_text_old,含义:旧版正样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:negative_asr_text_old,含义:旧版负样本自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:negative_sample_wordlevel_loss_old,含义:旧版负样本词级损失,数据类型:64位浮点型(float64)序列 - 字段名:positive_sample_wordlevel_loss_old,含义:旧版正样本词级损失,数据类型:64位浮点型(float64)序列 - 字段名:positive_asr_chunks,含义:正样本语音分块,数据类型:列表,包含: - 字段名:text,含义:分块文本,数据类型:字符串(string) - 字段名:timestamp,含义:时间戳,数据类型:64位浮点型(float64)序列 - 字段名:prompt_asr_text_old,含义:旧版提示自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:prompt_sample_wordlevel_loss_old,含义:旧版提示样本词级损失,数据类型:64位浮点型(float64)序列 - 字段名:positive_continuation_wordlevel_loss,含义:正样本续接词级损失,数据类型:32位浮点型(float32)序列 - 字段名:negative_continuation_wordlevel_loss,含义:负样本续接词级损失,数据类型:32位浮点型(float32)序列 - 字段名:continuation_asr_text,含义:续接自动语音识别(Automatic Speech Recognition, ASR)文本,数据类型:字符串(string) - 字段名:ppl_sanity_aligned,含义:对齐验证困惑度,数据类型:64位整数(int64) 数据划分: - 划分名称:train(训练集),字节数:270240761,样本数量:200 下载大小:270240761,数据集大小:270240761 - 配置名称:bg_domain_consistency(bg_domain_consistency) 特征字段与bg_all_consistency一致,数据划分: - 划分名称:train(训练集),字节数:270011718,样本数量:200 下载大小:270011718,数据集大小:270011718 - 配置名称:gender_consistency(gender_consistency) 特征字段与bg_all_consistency一致,数据划分: - 划分名称:train(训练集),字节数:278743927,样本数量:200 下载大小:278743927,数据集大小:278743927 - 配置名称:rir_consistency(房间脉冲响应一致性,Room Impulse Response, RIR) 特征字段与bg_all_consistency一致,数据划分: - 划分名称:train(训练集),字节数:259091116,样本数量:200 下载大小:259091116,数据集大小:259091116 - 配置名称:sentiment_alignment(sentiment_alignment) 特征字段与bg_alignment一致,数据划分: - 划分名称:train(训练集),字节数:46920619,样本数量:200 下载大小:46920619,数据集大小:46920619 - 配置名称:sentiment_consistency(sentiment_consistency) 特征字段与bg_all_consistency一致,数据划分: - 划分名称:train(训练集),字节数:272654768,样本数量:200 下载大小:272654768,数据集大小:272654768 - 配置名称:speaker_consistency(speaker_consistency) 特征字段与bg_all_consistency一致,数据划分: - 划分名称:train(训练集),字节数:283506280,样本数量:200 下载大小:283506280,数据集大小:283506280 # SALMon 标准化数据集 本仓库保留了SALMon按配置划分的文件夹结构,同时对不同模型家族间不匹配的数据集模式细节进行了标准化处理。




