semantic-vad-eot
收藏资源简介:
Semantic-VAD EOT是一个多语言数据集,专为语音活动检测(VAD)和话语轮次结束(EOT)检测设计。它基于词级强制对齐技术构建,与livekit/eot-bench-data基准数据集兼容。每个数据样本代表一个用户的话语轮次,包含16 kHz采样率的MP3格式音频片段、对应的词序列(words)以及按顺序排列的静音时间段(silence_spans)。遵循eot-bench通用约定,列表中的最后一个静音段被标记为真正的轮次结束点(EOT),而此前的静音段则代表话语中的停顿(hold)。数据集覆盖多种语言,包括英语、法语、德语、意大利语、日语、韩语、中文、波兰语、葡萄牙语、俄语、西班牙语、泰语、土耳其语,并包含多个马来西亚语言子集(如方言、IMDA、马来西亚语、议会和科学英语)。数据来源于AAdonis/multilingual_audio_alignments和malaysia-ai/Malaysian-STT两个公开数据集。数据已预先划分为训练集、验证集和测试集,支持通过不同配置加载特定语言或全部数据。该数据集适用于训练和评估语义感知的语音活动检测及对话系统中的轮次检测模型。
Semantic-VAD EOT is a multilingual dataset designed for voice activity detection (VAD) and end-of-turn (EOT) detection. It is constructed based on word-level forced alignment technology and is compatible with the livekit/eot-bench-data benchmark dataset. Each data sample represents a users turn, containing an audio segment in MP3 format with a 16 kHz sampling rate, corresponding word sequences (words), and sequentially arranged silence spans (silence_spans). Following the general convention of eot-bench, the last silence span in the list is marked as the true end-of-turn point (EOT), while the previous silence spans represent pauses (hold) within the speech. The dataset covers multiple languages, including English, French, German, Italian, Japanese, Korean, Chinese, Polish, Portuguese, Russian, Spanish, Thai, Turkish, and includes several Malaysian language subsets (such as dialects, IMDA, Malaysian, parliamentary, and scientific English). The data is sourced from two public datasets: AAdonis/multilingual_audio_alignments and malaysia-ai/Malaysian-STT. The data has been pre-divided into training, validation, and test sets, supporting loading of specific languages or all data through different configurations. This dataset is suitable for training and evaluating semantic-aware voice activity detection and turn detection models in dialogue systems.
数据集概述:Semantic-VAD EOT
数据集卡片摘要
- 许可证: Creative Commons Attribution 4.0 International (CC-BY-4.0)
- 任务类别: 语音活动检测 (Voice Activity Detection)
- 语言: 英语 (en)、法语 (fr)、德语 (de)、意大利语 (it)、日语 (ja)、韩语 (ko)、中文 (zh)、波兰语 (pl)、葡萄牙语 (pt)、俄语 (ru)、西班牙语 (es)、泰语 (th)、土耳其语 (tr)、马来语 (ms)
- 标签: end-of-turn、semantic-vad、eot、turn-detection
- 正式名称: Semantic-VAD EOT
1. 数据集内容与构建
- 定义: 该数据集包含基于词级强制对齐构建的“话轮结束”(End-of-Turn)数据,属于语义级别的语音活动检测(Semantic VAD)。
- 数据格式: 每一行代表一个用户话轮(turn),包含一个16 kHz 的 MP3 音频片段、对应的词序列 (words) 以及有序的静默间隔 (silence_spans)。
- 标注约定:
- 根据 eot-bench 约定,最后一个静默间隔被标记为真正的话轮结束点(
eot)。 - 之前的静默间隔则被视为话轮中间的“保持”停顿(
hold),其标签通过位置(而非显式存储)来定义。
- 根据 eot-bench 约定,最后一个静默间隔被标记为真正的话轮结束点(
- 兼容性: 该数据集在模式(schema)上与
livekit/eot-bench-data兼容。 - 数据来源: 主要来自
AAdonis/multilingual_audio_alignments和malaysia-ai/Malaysian-STT。
2. 数据集划分与配置(Configs)
- 划分策略: 对于每一种数据类型,除最后一个分片(shard)外的所有分片作为训练集(train)。该类型的最后一个分片会按 50/25/25 的比例被划分为额外的训练集、验证集(validation)和测试集(test)。划分时采用 shuffle 操作,随机种子为 42。
- 数据存储格式: Parquet 文件。
配置列表
| 配置名称 | 描述 | 数据文件路径 (基于首页根目录) |
|---|---|---|
| all (默认) | 包含所有语言及马来西亚子集 | data/*.parquet, data/train/*-*.parquet (训练集), data/validation/*-*.parquet (验证集), data/test/*-*.parquet (测试集) |
| 13 种语言配置 | 每种语言独立的配置 | 例如 en 配置对应 data/ml-english-*.parquet 及 data/train/、data/validation/、data/test/ 子目录下的相应文件。语言代码:en, fr, de, it, ja, ko, zh, pl, pt, ru, es, th, tr |
| 5 种马来西亚子集配置 | 基于词级对齐的纯数据(无合成数据)集中子集 | 例如 ms_dialects 配置对应 data/ms-dialects-*.parquet 及相关子目录文件。子集:ms_dialects, ms_imda, ms_malaysian, ms_parliament, ms_science_english |
3. 使用建议
-
加载数据: 建议使用 Hugging Face
datasets库进行加载。 -
音频处理: 加载后,建议将音频列转换为
Audio类型,并设置decode=False以按需解码。python from datasets import load_dataset, Audio ds = load_dataset("Scicom-intl/semantic-vad-eot", "en") # 返回 (train, validation, test) 分割 te = load_dataset("Scicom-intl/semantic-vad-eot", "ms_imda", split="test") ds = ds.cast_column("audio", Audio(decode=False))




