遇见数据集

livekit/eot-bench-data

收藏
Hugging Face2026-06-09 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是LiveKit端到端转捩检测基准测试的一个最小公共子集,从完整发布就绪数据集中采样而来。采样是确定性的:使用种子20260603对每种语言最多采样400个turn(无放回)。如果某种语言的可用行数少于请求的样本大小,则包含所有可用行(例如:阿拉伯语381行、印尼语396行、日语356行、韩语377行、中文344行)。数据集包含多种语言配置(如英语、德语、日语等)和一个all配置(所有可用采样语言)。所有配置使用相同的数据模式:包括全局唯一的turn ID(id)、16 kHz单声道WAV音频(audio)、标准化语言代码(language)、音频持续时间(duration)、候选沉默时间跨度(silence_spans)、词级转录时间戳(words)和先前的对话消息(messages)。数据集中排除了最终沉默间隔短于0.2秒的turn(以便在0.2秒评分点进行评估),也排除了任何沉默间隔长于5.0秒的turn(以使基准测试专注于普通的端点检测停顿)。数据集支持多种语言,包括英语、阿拉伯语、德语、西班牙语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、土耳其语和中文,总行数为5454。

This dataset contains a minimal public subset of the LiveKit end-of-turn benchmark. It is sampled from the full release-ready dataset preserved on the full revision. The sample is deterministic: up to 400 turns per language were sampled without replacement using seed 20260603. Languages with fewer than the requested sample size include all available rows: ar (381 available), id (396 available), ja (356 available), ko (377 available), zh (344 available). Configs include all (all available sampled languages) and language-specific configs (e.g., en, de, ja). All configs use the same schema: id (globally unique turn id), audio (16 kHz mono WAV audio), language (normalized language code), duration (audio duration in seconds), silence_spans (candidate silence spans with start and end), words (word-level transcript timings), messages (prior conversation messages). Rows whose final end-of-turn silence span is shorter than 0.2s are excluded so every turn can be evaluated at a 0.2s score point, and rows with any silence span longer than 5.0s are excluded to focus on ordinary endpointing pauses. Languages supported: English, Arabic, German, Spanish, French, Hindi, Indonesian, Italian, Japanese, Korean, Dutch, Portuguese, Turkish, and Chinese, with a total of 5454 rows.

提供机构:
livekit
搜集汇总
数据集介绍
livekit/eot-bench-data 数据集图片
构建方式
eot-bench-data数据集源自LiveKit平台,旨在为端到端语音对话中的话轮转换检测提供标准化评测基准。该数据集从完整的发布候选版本中采用确定性抽样的方式提取,以种子值20260603进行无放回抽样,每个语言子集最多保留400个话轮。对于样本量不足的语言(如阿拉伯语、印尼语、日语、韩语、中文),则纳入全部可用数据。所有数据以Parquet格式存储,并提供多个语言配置选项,支持单语与多语混合评估。数据集确保了每一条语料的最后一帧静音段短于5秒且不低于0.2秒,以聚焦于常规端点停顿场景,剔除异常时长样本,从而保证评测的合理性与可复现性。
特点
该数据集具备多语言覆盖与结构化丰富的特点。支持包括英语、阿拉伯语、德语、西班牙语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、土耳其语和中文在内的14种语言,涵盖总计5454个话轮。每条数据包含16kHz单声道WAV音频、标准化的语言标签、语轮全局唯一标识符与持续时间。此外,提供候选静音段(含起止时间)、词级时间戳转录以及历史对话消息,使得数据不仅可用于端点检测,还可支撑上下文感知模型的研究。由于去除了过长或过短的静音段,数据更贴近真实对话的停顿分布特征。
使用方法
用户可通过HuggingFace Datasets库加载该数据集的多个配置版本。选用配置名`all`可获取全部语言混合数据,而指定语言代码(如`en`、`de`、`ja`等)则加载对应单语子集。数据以Parquet格式提供,支持高效的分批读取。结合基准评测代码库(位于GitHub仓库`livekit/eot-bench`),研究人员可直接利用这里的字段(如`audio`和`silence_spans`)进行端到端的话轮转换检测模型训练与评估,尤其适合在0.2秒精度下的性能衡量。建议用户在加载数据时指定`split='validation'`,并借助`audio`列进行后续的语音处理与建模。
背景与挑战
背景概述
在实时语音交互系统中,准确检测说话者的结束讲话时刻(end-of-turn detection)是决定对话流畅性与自然度的关键技术瓶颈。针对这一挑战,LiveKit团队于2024年发布了EoT-Bench数据集,旨在为多语言环境下的对话端点检测提供标准化评测基准。该数据集由LiveKit研究机构创建,涵盖英语、阿拉伯语、德语等14种语言,共计5454条高质量对话片段,每条样本均包含16kHz单声道音频、词级时间戳及历史对话上下文信息。作为业界首个面向多语言端到端检测的开源基准,EoT-Bench填补了该领域长期缺乏多样化语言覆盖的空白,推动了对话系统从实验室场景向真实多语言部署的跨越。
当前挑战
EoT-Bench数据集的核心挑战体现在双重维度。在领域问题层面,它聚焦于解决语音端点检测在真实对话中面临的长短沉默变异、语言间韵律差异及上下文依赖性难题,传统基于固定静音阈值的方案在此类场景下鲁棒性显著不足。在构建过程中,该数据集需在去除单次静音短于0.2秒和长于5.0秒的极端样例以聚焦常规停顿的同时,确保14种语言中各语种样本量的均衡性——部分小语种(如阿拉伯语仅381条)因原始语料稀缺不得不采用全部可用数据。此外,经种子20260603的确定性采样策略虽保证了可复现性,但非英语语言中最多仅400条样本的规模对基于深度学习的模型训练构成了数据量过小的严峻挑战。
常用场景
经典使用场景
在会话式人工智能的蓬勃发展中,端到端语音交互的流畅性高度依赖于系统对用户话轮结束时刻的精准感知。eot-bench-data数据集专为评估“话轮结束检测”(End-of-Turn Detection)这一核心任务而设计,其经典使用场景聚焦于训练和量化模型在多语言、多轮对话中识别语音停顿与语义边界的能力。通过提供多语种、标准化采样的音频片段及其对应的静默间隔、词级时间戳和历史对话上下文,该数据集能够系统地检验模型在0.2至5.0秒关键静默区间内的决策性能,从而成为推动语音端点检测技术标准化评估的基石。
实际应用
在实际应用中,eot-bench-data数据集直接服务于各类需要实时语音交互的智能系统,其价值体现在多个关键场景。在智能语音助手(如手机助手、智能音箱)中,高精度的端点检测能使用户的指令被无缝衔接,避免在用户思考时被草率打断或延迟响应。在实时语音翻译系统里,精准的话轮识别确保了翻译输出的完整性和时机恰当性。此外,在客服语音机器人、智能车载交互系统以及多模态会议转写工具中,该数据集训练出的模型能够显著提升系统对自然对话节奏的适应能力,从而大幅改善用户体验,降低对话中的人机摩擦,成为构建“类人”交互体验不可或缺的数据基石。
衍生相关工作
围绕eot-bench-data数据集,学术界与工业界已经衍生出一系列具有影响力的经典工作。其在博客文章“Solving end-of-turn detection”及相关开源基准代码库中的应用,奠定了端点检测领域标准化评估的范式,催生了对静默时长分布统计、语义完整性编码以及多模态融合策略的深入探讨。基于该数据集,研究者们开发了如分层时序模型与跨语言特征迁移学习等创新方法,用以克服低资源语言的端点检测难题。这些衍生工作不仅深化了对话系统中“话轮管理”理论研究,也推动了从单点检测到全局对话流畅性优化的思维转变,使得eot-bench-data成为连接语音信号处理与自然语言理解两个传统领域的纽带性资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务