arda-argmax/simchoir-parquet
收藏资源简介:
FastMSS合成的多说话人会议数据集(parquet版)是一个流式友好的parquet分片数据集,包含合成的多说话人对话语料库。每行数据包含内联嵌入的音频字节(16 kHz单声道WAV)、每个片段的说话人日志时间戳、逐字转录以及完整的lhotse cut JSON blob。数据集适用于自动语音识别(ASR)、语音活动检测(VAD)和说话人日志(diarization)任务。数据集包含多个子集(debug、v0.1、v0.2),每个子集有不同的训练和验证分割。数据集的详细字段包括音频、时间戳、说话人标签、转录文本等。
FastMSS synthetic multi-speaker meetings (parquet edition) is a streaming-friendly parquet shards dataset containing synthetic multi-speaker conversational corpus. Each row includes inline embedded audio bytes (16 kHz mono WAV), per-segment diarization timestamps, per-word transcript, and the full lhotse cut as a JSON blob. The dataset is suitable for automatic speech recognition (ASR), voice activity detection (VAD), and speaker diarization tasks. It includes multiple subsets (debug, v0.1, v0.2) with different train and validation splits. Detailed fields in the dataset include audio, timestamps, speaker labels, transcript text, etc.




