SpeechPPL/SALMon_Llama-Mimi1.3B-normalized2
收藏资源简介:
--- dataset_info: - config_name: bg_alignment features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate sequence: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 splits: - name: train num_bytes: 86750711 num_examples: 200 download_size: 86750711 dataset_size: 86750711 - config_name: bg_all_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: positive_continuation_tokenwise_loss sequence: float32 - name: negative_continuation_tokenwise_loss sequence: float32 - name: prompt_sample_tokenwise_loss sequence: float32 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 splits: - name: train num_bytes: 234883788 num_examples: 200 download_size: 234883788 dataset_size: 234883788 - config_name: bg_domain_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: positive_continuation_tokenwise_loss sequence: float32 - name: negative_continuation_tokenwise_loss sequence: float32 - name: prompt_sample_tokenwise_loss sequence: float32 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 splits: - name: train num_bytes: 237747052 num_examples: 200 download_size: 237747052 dataset_size: 237747052 - config_name: gender_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: positive_continuation_tokenwise_loss sequence: float32 - name: negative_continuation_tokenwise_loss sequence: float32 - name: prompt_sample_tokenwise_loss sequence: float32 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 splits: - name: train num_bytes: 238663168 num_examples: 200 download_size: 238663168 dataset_size: 238663168 - config_name: rir_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: positive_continuation_tokenwise_loss sequence: float32 - name: negative_continuation_tokenwise_loss sequence: float32 - name: prompt_sample_tokenwise_loss sequence: float32 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 splits: - name: train num_bytes: 218836796 num_examples: 200 download_size: 218836796 dataset_size: 218836796 - config_name: sentiment_alignment features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate sequence: int64 - name: ppl_sanity dtype: int64 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 splits: - name: train num_bytes: 46529917 num_examples: 200 download_size: 46529917 dataset_size: 46529917 - config_name: sentiment_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: positive_continuation_tokenwise_loss sequence: float32 - name: negative_continuation_tokenwise_loss sequence: float32 - name: prompt_sample_tokenwise_loss sequence: float32 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 splits: - name: train num_bytes: 232197295 num_examples: 200 download_size: 232197295 dataset_size: 232197295 - config_name: speaker_consistency features: - name: task dtype: string - name: ind dtype: int64 - name: positive_audio dtype: audio - name: negative_audio dtype: audio - name: audio_transition_s dtype: int64 - name: prompt_audio dtype: audio: sampling_rate: 16000 - name: continuation_audio_positive dtype: audio: sampling_rate: 16000 - name: continuation_audio_negative dtype: audio: sampling_rate: 16000 - name: negative_audio_sanity dtype: audio: sampling_rate: 16000 - name: positive_sample_tokenwise_loss sequence: float32 - name: negative_sample_tokenwise_loss sequence: float32 - name: positive_continuation_tokenwise_loss sequence: float32 - name: negative_continuation_tokenwise_loss sequence: float32 - name: prompt_sample_tokenwise_loss sequence: float32 - name: model_generated_continuation dtype: audio: sampling_rate: 24000 - name: code_frame_rate dtype: int64 - name: code_depth dtype: int64 - name: model_sampling_rate dtype: int64 - name: ppl_sanity dtype: int64 splits: - name: train num_bytes: 239774488 num_examples: 200 download_size: 239774488 dataset_size: 239774488 --- # SALMon Normalized Dataset This repo preserves the SALMon per-config folder layout while normalizing mismatched schema details across model families.
数据集信息(dataset_info)包含以下8个配置项: 1. 配置名称(config_name):bg_alignment 特征(features)列表如下: - task:任务,数据类型为字符串(string) - ind:索引,数据类型为64位整数(int64) - positive_audio:正样本音频,数据类型为音频(audio) - negative_audio:负样本音频,数据类型为音频(audio) - prompt_audio:提示音频,数据类型为音频(audio),采样率(sampling_rate)为16000Hz - continuation_audio_positive:正样本续接音频,数据类型为音频(audio),采样率为16000Hz - continuation_audio_negative:负样本续接音频,数据类型为音频(audio),采样率为16000Hz - negative_audio_sanity:校验用负样本音频,数据类型为音频(audio),采样率为16000Hz - positive_sample_tokenwise_loss:正样本逐Token损失,数据类型为单精度浮点数(float32)序列(sequence) - negative_sample_tokenwise_loss:负样本逐Token损失,数据类型为float32序列 - code_frame_rate:编码帧率,数据类型为int64 - code_depth:编码位深,数据类型为int64 - model_sampling_rate:模型采样率,数据类型为int64序列 - ppl_sanity:困惑度校验值,数据类型为int64 - model_generated_continuation:模型生成的续接音频,数据类型为音频(audio),采样率为24000Hz 数据集划分(splits): - 训练集(train):字节数为86750711,样本数为200 下载大小:86750711,数据集总大小:86750711 2. 配置名称:bg_all_consistency 特征列表新增以下字段: - audio_transition_s:音频过渡时长,单位为秒,数据类型为int64 - positive_continuation_tokenwise_loss:正续接样本逐Token损失,数据类型为float32序列 - negative_continuation_tokenwise_loss:负续接样本逐Token损失,数据类型为float32序列 - prompt_sample_tokenwise_loss:提示样本逐Token损失,数据类型为float32序列 且model_sampling_rate数据类型为int64(非序列类型),其余特征与bg_alignment配置一致。 数据集划分:训练集字节数为234883788,样本数为200;下载大小234883788,数据集总大小234883788 3. 配置名称:bg_domain_consistency 特征与bg_all_consistency配置完全一致。数据集划分:训练集字节数为237747052,样本数为200;下载大小237747052,数据集总大小237747052 4. 配置名称:gender_consistency 特征与bg_all_consistency配置完全一致。数据集划分:训练集字节数为238663168,样本数为200;下载大小238663168,数据集总大小238663168 5. 配置名称:rir_consistency 特征与bg_all_consistency配置完全一致。数据集划分:训练集字节数为218836796,样本数为200;下载大小218836796,数据集总大小218836796 注:rir为Room Impulse Response(房间冲激响应)的缩写 6. 配置名称:sentiment_alignment 特征与bg_alignment配置完全一致。数据集划分:训练集字节数为46529917,样本数为200;下载大小46529917,数据集总大小46529917 7. 配置名称:sentiment_consistency 特征与bg_all_consistency配置完全一致。数据集划分:训练集字节数为232197295,样本数为200;下载大小232197295,数据集总大小232197295 8. 配置名称:speaker_consistency 特征与bg_all_consistency配置完全一致。数据集划分:训练集字节数为239774488,样本数为200;下载大小239774488,数据集总大小239774488 --- ## SALMon标准化数据集 本仓库保留了SALMon按配置划分的文件夹结构,同时针对不同模型家族间不匹配的数据模式(schema)细节进行了标准化处理。




