相关数据集
2006 NIST Speaker Recognition Evaluation Training Set
Introduction 2006 NIST Speaker Recognition Evaluation Training Set was developed by LDC and NIST (National Institute of Standards and Technology). It contains 595 hours of conversational telephone spe
Mendeley Data2024-01-31 更新120
pratikk-003/rasa_prepro_with_audio
该数据集包含了音频文件的相关信息,如文件名、文本内容、语言、性别、风格等,并且提供了音频文件的时长、路径以及一些声学特征,如音高均值、音高标准差、信噪比等。数据集分为训练集和测试集,可用于音频处理和语音识别等任务。
Hugging Face2025-10-08 更新100
Intelligent-Internet/II-Thought-RL-v0
II-Thought RL v0是一个大规模、多任务的强化学习数据集,包含了经过严格多步骤筛选的高质量问题-答案对。数据集涵盖了数学、编程、科学等多个领域,旨在为强化学习模型提供多样化的训练材料。
Hugging Face2025-03-28 更新60
westbrook/gigaspeech-tiny-4
该数据集包含多个音频片段,每个片段具有唯一的segment_id、说话者信息、文本内容、音频数据、开始和结束时间、音频ID、标题、来源URL、来源类别(如audiobook、podcast、youtube)、类别(如People and Blogs、Business、Nonprofits and Activism等)以及原始文件路径。数据集仅包含一个训练集分割,包含2个样本,数据大小为206153
Hugging Face2024-07-21 更新100
mirianfsilva/multi_prompt_mmlu
该数据集包含多个配置(abstract_algebra_0到abstract_algebra_38),每个配置包含以下特征:question(问题)、subject(主题)、choices(选项)、answer(答案)、template(模板)和model_prompt(模型提示)。数据集被分为test(测试集)、validation(验证集)、dev(开发集)和auxiliary_train(辅
Hugging Face2024-11-22 更新80



