humanify/real_dia_dataset
收藏资源简介:
--- dataset_info: - config_name: CHiME6 features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 4695519672 num_examples: 16 download_size: 4728426870 dataset_size: 4695519672 - config_name: Dipco features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 316726142 num_examples: 5 download_size: 318962486 dataset_size: 316726142 - config_name: Dipco_test features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 301726535 num_examples: 5 download_size: 303858084 dataset_size: 301726535 - config_name: ICSI features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 8326846018 num_examples: 75 download_size: 8439896806 dataset_size: 8326846018 - config_name: NOTSOFAR features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 334050347 num_examples: 28 download_size: 336568165 dataset_size: 334050347 - config_name: aishell4 features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 99182770420 num_examples: 191 download_size: 99295119799 dataset_size: 99182770420 - config_name: aishell4_test features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 11738893290 num_examples: 20 download_size: 11755959799 dataset_size: 11738893290 - config_name: aishell5 features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 12434302815 num_examples: 568 download_size: 12466722299 dataset_size: 12434302815 - config_name: alimeeting features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 102700641574 num_examples: 209 download_size: 102767567345 dataset_size: 102700641574 - config_name: ami_ihm features: - name: session_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 9382939945 num_examples: 136 download_size: 9448752470 dataset_size: 9382939945 - config_name: ami_ihm_test features: - name: session_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 1050447703 num_examples: 16 download_size: 1057588350 dataset_size: 1050447703 - config_name: ami_sdm features: - name: session_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 9264815339 num_examples: 134 download_size: 9329797855 dataset_size: 9264815339 - config_name: ami_sdm_test features: - name: session_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 1050471619 num_examples: 16 download_size: 1057612366 dataset_size: 1050471619 - config_name: callhome features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 4697040686 num_examples: 280 download_size: 4712743291 dataset_size: 4697040686 - config_name: msdwild features: - name: session_id dtype: string - name: audio dtype: audio - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 5931033171 num_examples: 608 download_size: 5954296497 dataset_size: 5931033171 - config_name: voxconverse features: - name: session_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 2234495902 num_examples: 179 download_size: 2258083984 dataset_size: 2234495902 - config_name: voxconverse_test features: - name: session_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: targets list: list: int8 - name: speaker_ids list: string - name: duration dtype: float64 - name: num_speakers dtype: int32 - name: valid_offsets list: float64 splits: - name: train num_bytes: 4950892052 num_examples: 206 download_size: 5028729077 dataset_size: 4950892052 configs: - config_name: CHiME6 data_files: - split: train path: CHiME6/train-* - config_name: Dipco data_files: - split: train path: Dipco/train-* - config_name: Dipco_test data_files: - split: train path: Dipco_test/train-* - config_name: ICSI data_files: - split: train path: ICSI/train-* - config_name: NOTSOFAR data_files: - split: train path: NOTSOFAR/train-* - config_name: aishell4 data_files: - split: train path: aishell4/train-* - config_name: aishell4_test data_files: - split: train path: aishell4_test/train-* - config_name: aishell5 data_files: - split: train path: aishell5/train-* - config_name: alimeeting data_files: - split: train path: alimeeting/train-* - config_name: ami_ihm data_files: - split: train path: ami_ihm/train-* - config_name: ami_ihm_test data_files: - split: train path: ami_ihm_test/train-* - config_name: ami_sdm data_files: - split: train path: ami_sdm/train-* - config_name: ami_sdm_test data_files: - split: train path: ami_sdm_test/train-* - config_name: callhome data_files: - split: train path: callhome/train-* - config_name: msdwild data_files: - split: train path: msdwild/train-* - config_name: voxconverse data_files: - split: train path: voxconverse/train-* - config_name: voxconverse_test data_files: - split: train path: voxconverse_test/train-* ---
数据集信息如下: - 配置名称:CHiME6 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为4695519672,样本数量为16 下载大小:4728426870,数据集总大小:4695519672 - 配置名称:Dipco 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为316726142,样本数量为5 下载大小:318962486,数据集总大小:316726142 - 配置名称:Dipco_test 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为301726535,样本数量为5 下载大小:303858084,数据集总大小:301726535 - 配置名称:ICSI 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为8326846018,样本数量为75 下载大小:8439896806,数据集总大小:8326846018 - 配置名称:NOTSOFAR 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为334050347,样本数量为28 下载大小:336568165,数据集总大小:334050347 - 配置名称:aishell4 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为99182770420,样本数量为191 下载大小:99295119799,数据集总大小:99182770420 - 配置名称:aishell4_test 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为11738893290,样本数量为20 下载大小:11755959799,数据集总大小:11738893290 - 配置名称:aishell5 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为12434302815,样本数量为568 下载大小:12466722299,数据集总大小:12434302815 - 配置名称:alimeeting 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为102700641574,样本数量为209 下载大小:102767567345,数据集总大小:102700641574 - 配置名称:ami_ihm 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):采样率为16000的音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为9382939945,样本数量为136 下载大小:9448752470,数据集总大小:9382939945 - 配置名称:ami_ihm_test 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):采样率为16000的音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为1050447703,样本数量为16 下载大小:1057588350,数据集总大小:1050447703 - 配置名称:ami_sdm 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):采样率为16000的音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为9264815339,样本数量为134 下载大小:9329797855,数据集总大小:9264815339 - 配置名称:ami_sdm_test 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):采样率为16000的音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为1050471619,样本数量为16 下载大小:1057612366,数据集总大小:1050471619 - 配置名称:callhome 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为4697040686,样本数量为280 下载大小:4712743291,数据集总大小:4697040686 - 配置名称:msdwild 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为5931033171,样本数量为608 下载大小:5954296497,数据集总大小:5931033171 - 配置名称:voxconverse 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):采样率为16000的音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为2234495902,样本数量为179 下载大小:2258083984,数据集总大小:2234495902 - 配置名称:voxconverse_test 特征字段: - 会话ID(session_id):数据类型为字符串 - 音频(audio):采样率为16000的音频数据类型 - 目标(targets):二维8位有符号整数列表 - 说话人ID(speaker_ids):字符串列表 - 时长(duration):数据类型为64位浮点数 - 说话人数量(num_speakers):数据类型为32位有符号整数 - 有效偏移量(valid_offsets):64位浮点数列表 划分集: - 训练集:字节数为4950892052,样本数量为206 下载大小:5028729077,数据集总大小:4950892052 数据集配置如下: - 配置名称:CHiME6:数据文件划分训练集,路径为CHiME6/train-* - 配置名称:Dipco:数据文件划分训练集,路径为Dipco/train-* - 配置名称:Dipco_test:数据文件划分训练集,路径为Dipco_test/train-* - 配置名称:ICSI:数据文件划分训练集,路径为ICSI/train-* - 配置名称:NOTSOFAR:数据文件划分训练集,路径为NOTSOFAR/train-* - 配置名称:aishell4:数据文件划分训练集,路径为aishell4/train-* - 配置名称:aishell4_test:数据文件划分训练集,路径为aishell4_test/train-* - 配置名称:aishell5:数据文件划分训练集,路径为aishell5/train-* - 配置名称:alimeeting:数据文件划分训练集,路径为alimeeting/train-* - 配置名称:ami_ihm:数据文件划分训练集,路径为ami_ihm/train-* - 配置名称:ami_ihm_test:数据文件划分训练集,路径为ami_ihm_test/train-* - 配置名称:ami_sdm:数据文件划分训练集,路径为ami_sdm/train-* - 配置名称:ami_sdm_test:数据文件划分训练集,路径为ami_sdm_test/train-* - 配置名称:callhome:数据文件划分训练集,路径为callhome/train-* - 配置名称:msdwild:数据文件划分训练集,路径为msdwild/train-* - 配置名称:voxconverse:数据文件划分训练集,路径为voxconverse/train-* - 配置名称:voxconverse_test:数据文件划分训练集,路径为voxconverse_test/train-*




