遇见数据集

Speaker-Diarization-Instructions

收藏
魔搭社区2025-12-05 更新2025-12-06 收录
官方服务:

资源简介:

# Speaker-Diarization-Instructions Convert diarization dataset from https://huggingface.co/diarizers-community into speech instructions dataset and chunk max to 30 seconds because most of speech encoder use for LLM come from Whisper Encoder. **We highly recommend to not include AMI test set from both AMI-IHM and AMI-SDM in training set to prevent contamination. This dataset supposely to become a speech diarization benchmark**. ## how to prepare the dataset ```bash huggingface-cli download \ mesolitica/Speaker-Diarization-Instructions \ --include "*.zip" \ --repo-type "dataset" \ --local-dir './' unzip 0-0.zip ``` ## Acknowledgement Special thanks to https://www.sns.com.my and Nvidia for 8x H100 node!

# 说话人 diarization(Speaker-Diarization)指令数据集 将来自https://huggingface.co/diarizers-community 的说话人 diarization 数据集转换为语音指令数据集,并将音频片段最大长度限定为30秒,这是因为当前适配大语言模型(LLM)的主流语音编码器均源自Whisper编码器。 **我们强烈建议请勿将AMI-IHM与AMI-SDM中的AMI测试集纳入训练集,以避免数据污染。本数据集旨在成为语音说话人 diarization 基准测试集。** ## 数据集制备流程 bash huggingface-cli download mesolitica/Speaker-Diarization-Instructions --include "*.zip" --repo-type "dataset" --local-dir './' unzip 0-0.zip ## 致谢 特别感谢https://www.sns.com.my 与英伟达(Nvidia)提供的8节点H100算力集群!

提供机构:
maas
创建时间:
2025-10-02
搜集汇总
数据集介绍
Speaker-Diarization-Instructions 数据集图片
背景与挑战
背景概述
该数据集基于开源说话人日志数据转换而成,专为语音编码器(如Whisper Encoder)设计,将音频分块为最长30秒的片段。它旨在作为语音说话人日志的基准测试集,建议在训练时排除AMI测试集以避免数据污染。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务