遇见数据集

semantic-vad-eot

收藏
Hugging Face2026-07-05 更新2026-07-06 收录
官方服务:

资源简介:

Semantic-VAD EOT是一个多语言数据集,专为语音活动检测(VAD)和话语轮次结束(EOT)检测设计。它基于词级强制对齐技术构建,与livekit/eot-bench-data基准数据集兼容。每个数据样本代表一个用户的话语轮次,包含16 kHz采样率的MP3格式音频片段、对应的词序列(words)以及按顺序排列的静音时间段(silence_spans)。遵循eot-bench通用约定,列表中的最后一个静音段被标记为真正的轮次结束点(EOT),而此前的静音段则代表话语中的停顿(hold)。数据集覆盖多种语言,包括英语、法语、德语、意大利语、日语、韩语、中文、波兰语、葡萄牙语、俄语、西班牙语、泰语、土耳其语,并包含多个马来西亚语言子集(如方言、IMDA、马来西亚语、议会和科学英语)。数据来源于AAdonis/multilingual_audio_alignments和malaysia-ai/Malaysian-STT两个公开数据集。数据已预先划分为训练集、验证集和测试集,支持通过不同配置加载特定语言或全部数据。该数据集适用于训练和评估语义感知的语音活动检测及对话系统中的轮次检测模型。

Semantic-VAD EOT is a multilingual dataset designed for voice activity detection (VAD) and end-of-turn (EOT) detection. It is constructed based on word-level forced alignment technology and is compatible with the livekit/eot-bench-data benchmark dataset. Each data sample represents a users turn, containing an audio segment in MP3 format with a 16 kHz sampling rate, corresponding word sequences (words), and sequentially arranged silence spans (silence_spans). Following the general convention of eot-bench, the last silence span in the list is marked as the true end-of-turn point (EOT), while the previous silence spans represent pauses (hold) within the speech. The dataset covers multiple languages, including English, French, German, Italian, Japanese, Korean, Chinese, Polish, Portuguese, Russian, Spanish, Thai, Turkish, and includes several Malaysian language subsets (such as dialects, IMDA, Malaysian, parliamentary, and scientific English). The data is sourced from two public datasets: AAdonis/multilingual_audio_alignments and malaysia-ai/Malaysian-STT. The data has been pre-divided into training, validation, and test sets, supporting loading of specific languages or all data through different configurations. This dataset is suitable for training and evaluating semantic-aware voice activity detection and turn detection models in dialogue systems.

创建时间:
2026-07-04
原始信息汇总

数据集概述:Semantic-VAD EOT

数据集卡片摘要

  • 许可证: Creative Commons Attribution 4.0 International (CC-BY-4.0)
  • 任务类别: 语音活动检测 (Voice Activity Detection)
  • 语言: 英语 (en)、法语 (fr)、德语 (de)、意大利语 (it)、日语 (ja)、韩语 (ko)、中文 (zh)、波兰语 (pl)、葡萄牙语 (pt)、俄语 (ru)、西班牙语 (es)、泰语 (th)、土耳其语 (tr)、马来语 (ms)
  • 标签: end-of-turn、semantic-vad、eot、turn-detection
  • 正式名称: Semantic-VAD EOT

1. 数据集内容与构建

  • 定义: 该数据集包含基于词级强制对齐构建的“话轮结束”(End-of-Turn)数据,属于语义级别的语音活动检测(Semantic VAD)。
  • 数据格式: 每一行代表一个用户话轮(turn),包含一个16 kHz 的 MP3 音频片段、对应的词序列 (words) 以及有序的静默间隔 (silence_spans)。
  • 标注约定:
    • 根据 eot-bench 约定,最后一个静默间隔被标记为真正的话轮结束点(eot)。
    • 之前的静默间隔则被视为话轮中间的“保持”停顿(hold),其标签通过位置(而非显式存储)来定义。
  • 兼容性: 该数据集在模式(schema)上与 livekit/eot-bench-data 兼容。
  • 数据来源: 主要来自 AAdonis/multilingual_audio_alignmentsmalaysia-ai/Malaysian-STT

2. 数据集划分与配置(Configs)

  • 划分策略: 对于每一种数据类型,除最后一个分片(shard)外的所有分片作为训练集(train)。该类型的最后一个分片会按 50/25/25 的比例被划分为额外的训练集、验证集(validation)和测试集(test)。划分时采用 shuffle 操作,随机种子为 42。
  • 数据存储格式: Parquet 文件。

配置列表

配置名称 描述 数据文件路径 (基于首页根目录)
all (默认) 包含所有语言及马来西亚子集 data/*.parquet, data/train/*-*.parquet (训练集), data/validation/*-*.parquet (验证集), data/test/*-*.parquet (测试集)
13 种语言配置 每种语言独立的配置 例如 en 配置对应 data/ml-english-*.parquetdata/train/data/validation/data/test/ 子目录下的相应文件。语言代码:en, fr, de, it, ja, ko, zh, pl, pt, ru, es, th, tr
5 种马来西亚子集配置 基于词级对齐的纯数据(无合成数据)集中子集 例如 ms_dialects 配置对应 data/ms-dialects-*.parquet 及相关子目录文件。子集:ms_dialects, ms_imda, ms_malaysian, ms_parliament, ms_science_english

3. 使用建议

  • 加载数据: 建议使用 Hugging Face datasets 库进行加载。

  • 音频处理: 加载后,建议将音频列转换为 Audio 类型,并设置 decode=False 以按需解码。

    python from datasets import load_dataset, Audio ds = load_dataset("Scicom-intl/semantic-vad-eot", "en") # 返回 (train, validation, test) 分割 te = load_dataset("Scicom-intl/semantic-vad-eot", "ms_imda", split="test") ds = ds.cast_column("audio", Audio(decode=False))

搜集汇总
数据集介绍
semantic-vad-eot 数据集图片
构建方式
该数据集基于词级别的强制对齐技术构建,从多语言音频对齐数据与马来西亚语音识别数据中提取用户话语的结束点(end-of-turn)。每个样本包含一个16kHz的MP3音频片段、对应的词汇序列以及有序的静默间隔。根据eot-bench基准约定,每个样本的最后一个静默间隔被标记为真实的结束点(eot),而之前的静默间隔则被视为话轮中的停顿(hold)。数据集的每个子集均划分为训练、验证与测试三个部分,划分方式为除去最后一个分片作为基座,最后一个分片按50/25/25比例随机分配,以确保数据分布的均衡性。
特点
数据集具备显著的多语言与多领域覆盖特性,涵盖英语、法语、德语、意大利语、日语、韩语、中文、波兰语、葡萄牙语、俄语、西班牙语、泰语、土耳其语以及马来西亚语族的多个子集。马来西亚语部分进一步细分为方言、IMDA、马来西亚语、议会以及科学英语五种特定领域,均由真实语音数据构成。数据集架构与livekit/eot-bench-data保持兼容,便于直接用于端到端的语义语音活性检测任务,其静默间隔的标注方式尤为独特,为话轮转换研究提供了精准的监督信号。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集。使用load_dataset函数,指定配置名称即可获取对应语言或子集的训练、验证与测试分片。例如,调用load_dataset('Scicom-intl/semantic-vad-eot', 'en')可获取英语数据。针对音频列,建议通过cast_column方法将其设置为Audio类型并保留原始编码(decode=False),以避免音频解码带来的开销。该数据集适用于训练和评估端到端的语音活动检测模型,尤其是在需要识别话轮结束点的复杂对话场景中表现出色。
背景与挑战
背景概述
在智能语音交互系统迅速发展的今天,准确检测用户话语的结束点(End-of-Turn, EOT)成为提升对话流畅性和自然度的关键环节。传统的语音活动检测(VAD)多依赖于声学特征,难以捕捉语义层面的语轮转换信号,限制了多轮对话系统的性能。为此,Semantic-VAD EOT数据集应运而生,由Scicom-intl机构于近期创建,旨在通过语义层面的强制对齐构建精确的语轮标注数据。该数据集覆盖了英语、法语、德语、日语、韩语、中文等13种主要语言以及5种马来语方言子集,并遵循LiveKit的EOT基准规范,为跨语言语轮检测研究提供了标准化的训练与评估平台。其发布对语音对话系统、虚拟助手以及自动语音识别后处理等领域具有重要的推动作用,填补了语义级VAD标注数据在语言多样性和标注精度的空白。
当前挑战
Semantic-VAD EOT数据集所解决的核心领域问题在于如何从语义层面精准识别用户话语的真实结束点,以克服传统声学VAD在复杂对话场景(如短暂停顿、犹豫或打断)中的误判。构建过程中面临的主要挑战包括:第一,多语言条件下强制对齐的准确性,需在13种语言及多种方言中实现词级别的时间戳标注,对声学模型和语言资源的鲁棒性要求极高;第二,语轮结束与话语内静默段的区分难题,需从长音频中精确标记语轮切换时刻,同时避免将内部停顿错误标注为结束点;第三,异构数据源的整合与标准化,数据集融合了多来源的对齐音频与转录,需统一采样率(16 kHz)、压缩格式(MP3)及标注模式,以构建兼容EOT基准的可靠训练集。
常用场景
经典使用场景
在语音交互系统与对话式人工智能的研发浪潮中,精准判别用户何时完成话语轮次、何时仅短暂停顿,始终是构建流畅人机对话体验的核心挑战。Semantic-VAD EOT数据集正是为攻克这一难题而生的标杆性资源,它通过深度融合语义活性检测(semantic VAD)与话轮结束判定(end-of-turn),为研究者提供了一套大规模、多语种、精细标注的语音-文本对齐数据。该数据集最经典的用途在于训练和评估能够区分‘话轮内停顿’与‘话轮结束静默’的深度学习模型,从而赋予语音助手在实时对话中无缝切换听与说状态的智慧。
解决学术问题
长久以来,语音活动检测(VAD)领域的研究者面临一个深层次困境:传统基于能量或过零率的算法仅能识别有无语音,却无法理解静默段的语义价值。Semantic-VAD EOT数据集的问世,优雅地弥合了这一鸿沟,它使得从声学信号中语义化地推断话轮边界成为可能。该数据集解决了两个关键学术问题:其一,它提供了跨13种语言及多种方言的高质量标注,为多语言话轮检测提供了统一基准;其二,它通过精心设计的‘停顿片段’标签体系,揭示了话语内部逻辑停顿与话轮转让之间的微妙差异,极大推动了对话系统从机械响应向自然交互的进化。
衍生相关工作
基于Semantic-VAD EOT数据集,学术界与工业界相继衍生出一系列影响深远的后续工作。一方面,研究者利用其多语言特性,探索了跨语言话轮检测的迁移学习方法,推动了语义VAD模型在低资源语种上的泛化能力。另一方面,该数据集的时空标注结构启发了诸多端到端对话状态追踪框架,它们将话轮边界信息作为关键特征融入Transformer架构中,显著提升了多轮对话的上下文理解精度。此外,实时语音处理社区还基于该数据集的评测协议,构建了标准化的‘话轮结束基准测试(EOT Bench)’,使得不同模型在公平条件下的性能对比成为可能,加速了整个领域的迭代周期。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务