tsw0411/si_next
收藏资源简介:
该数据集是一个多说话人音频数据集,包含多个配置(si_1, si_10, si_11, si_12, si_13, si_6, si_7, si_8, si_9),每个配置具有相同的特征:会话ID、音频数据、目标序列(可能用于语音活动检测或说话人识别)、说话人ID序列、音频时长、说话人数量和有效偏移序列。数据集仅提供训练分割,总规模从约783GB到119GB不等,示例数从4447到4950个。它可能用于多说话人语音处理任务,如说话人分割或识别,但具体应用未在README中说明。
This dataset is a multi-speaker audio dataset with multiple configurations (si_1, si_10, si_11, si_12, si_13, si_6, si_7, si_8, si_9), each sharing the same features: session ID, audio data, target sequences (likely for speech activity detection or speaker recognition), speaker ID sequences, audio duration, number of speakers, and valid offset sequences. The dataset only includes a training split, with total sizes ranging from approximately 783GB to 119GB, and example counts from 4447 to 4950. It may be intended for multi-speaker speech processing tasks such as speaker segmentation or recognition, but specific applications are not detailed in the README.




