遇见数据集

livekit/eot-bench-data

收藏
github2026-06-18 更新2026-06-19 收录
数据链接:
官方服务:

资源简介:

首个用于端到端检测的开放数据集,包含真实人类与代理对话的用户轮次,音频和文本上下文对齐,涵盖14种语言:阿拉伯语、中文、荷兰语、英语、法语、德语、印地语、印度尼西亚语、意大利语、日语、韩语、葡萄牙语、西班牙语和土耳其语。每个行是一个任务导向对话中的完整用户轮次,标注了每个至少100毫秒的静默停顿。最终停顿是轮次的真正结束;每个早期停顿是代理应倾听的中途犹豫。

The first open dataset for end-to-end detection, containing user turns from real human-agent conversations with aligned audio and text contexts, covering 14 languages: Arabic, Chinese, Dutch, English, French, German, Hindi, Indonesian, Italian, Japanese, Korean, Portuguese, Spanish, and Turkish. Each line represents a complete user turn in a task-oriented dialogue, annotated with every silent pause lasting at least 100 milliseconds. The final pause constitutes the actual end of the turn, while each early pause denotes an interim hesitation at which the agent should listen.

创建时间:
2026-06-09
原始信息汇总

数据集概述:eot-bench

eot-bench 是一个用于评估语音助手“话轮结束检测”(End-of-Turn Detection)能力的开放基准。其核心目标是提供一个可复现的、公共的评估平台,以解决该领域此前缺乏共享数据集和统一评估方法的问题。

核心数据集:livekit/eot-bench-data

这是首个专为话轮结束检测设计的开放数据集,其关键特征如下:

  • 数据来源: 真实的人与智能体之间的任务导向型对话
  • 数据构成: 包含完整的用户话轮,以及与之对齐的音频和文本上下文。
  • 语言覆盖: 涵盖 14 种语言:阿拉伯语、中文、荷兰语、英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、葡萄牙语、西班牙语和土耳其语。
  • 标注方式: 每个话轮中所有超过 100 毫秒的静默停顿都被标注。最后一个停顿被标记为“话轮结束”(eot),而在此之前的所有停顿都被标记为“话中停顿”(hold),代表了智能体需要倾听的犹豫。
  • 许可协议: 采用 Apache-2.0 许可协议,可自由下载和评估。

评估方法

eot-bench 不采用传统的离线分类评估,而是模拟真实语音助手的行为,在实时停顿处进行因果性评估:

  • 跨度级决策: 评估模型在每一次静默停顿发生时(而非在孤立片段上)做出是否回应的决策能力。模型在时间 t 进行预测时,只能使用到 t 时刻为止的上下文。
  • 策略扫描和操作点: 基准不依赖单一阈值,而是通过扫描三个核心策略参数(threshold 置信度阈值,action_delay 动作延迟,timeout 超时时间)来完整评估模型性能。
  • 核心权衡: 评估重点关注假打断率(在话中停顿处错误结束)与响应延迟(在用户完成后等待的时间)之间的权衡。基准报告在固定假打断预算下的最佳延迟(或反之),并给出完整的帕累托前沿(Pareto frontier)。在假打断率和延迟的权衡曲线上,越靠近左下角表示性能越好

评估结果与排行榜

  • 领先模型: 根据基准结果,LiveKit Turn Detector v1 在英语及所有 14 种语言的综合评估中表现最强。
  • 交互式排行榜: 更详细的结果,包括帕累托前沿、多语言热力图等,可在交互式排行榜中查看。
  • 示例数据 (5% 假打断预算下的延迟):
模型 延迟 @ 5% 假打断率
LiveKit Turn Detector v1 543 ms
Deepgram Flux 1151 ms
ultraVAD 899 ms
LiveKit Turn Detector v1-mini 1070 ms
SmartTurn v3.2 1051 ms
AssemblyAI 1049 ms
Soniox 647 ms
OpenAI GPT Realtime 2 1143 ms
VAD baseline 1600 ms

数据集的组成与使用

  • 数据集: 核心数据 livekit/eot-bench-data 可从 Hugging Face 下载。
  • 适配器接口: 提供了批量和流式处理适配器接口,用于接入本地模型或 API 提供商。目前已有 LiveKit Turn Detector v1/v1-mini, Deepgram Flux, AssemblyAI, Soniox, OpenAI GPT Realtime, SmartTurn, 和 ultraVAD 的参考适配器。
  • 可复现的产出: 所有预测结果、指标、帕累托前沿、操作点表格和多语言热力图均被提交在 output/ 目录下,可供复现。
  • 快速开始: 可通过 python -m pip install -e . 安装,并使用 eot-harness 命令行工具运行评估。
  • 所需字段: 数据集要求包含 id, language, audio, silence_spans 字段,可选包含 messageswords 字段。
搜集汇总
数据集介绍
livekit/eot-bench-data 数据集图片
构建方式
在语音交互智能体蓬勃发展的当下,每一处停顿都考验着系统对用户语轮终结的精准判断。eot-bench-data数据集正是为此而生,它开创性地收集了真实人类与语音代理之间的任务导向型对话,覆盖阿拉伯语、中文、荷兰语、英语、法语等14种语言。每个样本均包含一条完整的用户语轮,并附有对齐的音频与文本上下文。构建团队对语轮中所有超过100毫秒的静默段进行精细标注:最后一个静默段标定为语轮结束点,而此前的所有停顿则被视为中间犹豫。这一结构化的标注方式,使得评估能够精准模拟语音代理在真实对话中面临的关键决策瞬间。
特点
与传统的孤立片段评估不同,该数据集的核心魅力在于其独特的因果性评估设计。每个数据条目直接对应生产环境下语音代理的决策节点,模型仅能基于截止至当前时刻的音频、转录文本与消息进行评分,避免了未来信息的泄露。数据集将评估聚焦于两个相互制约的核心指标(虚假截断率与延迟响应时间)之间的帕累托最优权衡,而非单一的准确率分数。此外,通过策略扫描机制,系统可系统性地遍历置信度阈值、动作延迟与超时时间等多个端点策略旋钮,全面揭示模型在不同运营预算下的真实表现边界。
使用方法
研究人员可通过Hugging Face平台轻松获取该数据集,并利用配套的评估工具链开展标准化测试。使用前需安装基础运行库,并配置各模型提供商的API密钥。框架提供了批处理与流式处理两种适配器接口,支持本地模型与Deepgram、AssemblyAI等云端API的无缝接入。运行评估命令时,系统会自动对指定语言子集进行因果性预测生成,并将预测结果、事件记录与策略扫描度量的中间产物统一输出至指定目录。最终,可通过交互式排行榜直观比较各模型在14种语言上的帕累托前沿与分语种热力图,从而精确度量模型的端到端对话流畅度表现。
背景与挑战
背景概述
在语音交互系统的演进历程中,端点检测(End-of-Turn Detection, EoT)始终是制约对话自然度的核心瓶颈。自首个语音助手问世以来,如何精准判别用户是否完成发言——既避免过早打断造成对话碎片化,又防止过晚响应导致冷场——一直被视为语音人工智能领域最棘手的开放性难题之一。2024年,由LiveKit团队主导构建的eot-bench-data数据集应运而生,旨在为该领域提供首个公开、可复现的评估基准。该数据集涵盖阿拉伯语、中文、英语等14种真实人机对话场景,收录了完整的用户发言轮次及标注有100毫秒以上静音段的音频文本对齐信息,为衡量不同模型在真实部署条件下的表现提供了标准化平台。其核心研究问题聚焦于如何在保证低误打断率的前提下最小化响应延迟,这一权衡直接决定了语音代理的对话质感,对推动语音交互技术从实验室走向实用化具有里程碑意义。
当前挑战
该研究面临的核心挑战源于端点检测固有的双重目标矛盾:模型必须在用户停顿的瞬间同时满足“绝不错误打断”与“及时响应”两个对立要求。单纯追求低延迟必然导致高误中断率,而过度保守则造成对话空洞,传统的单一准确率指标完全无法刻画这一博弈关系。构建过程中,数据标注面临严峻挑战——真实对话中的静音停顿形态各异,既有单词间短暂换气(约100毫秒),亦有长句构思的长时间沉默(数秒),人工标注需区分自然停顿与真正的句末边界,技术门槛极高。此外,跨语言韵律差异(如日语助词后常出现思虑停顿)和任务导向对话的多样性(客户服务中用户反复修正需求)进一步增加了标注一致性难度。评估框架本身也需创新,传统基于孤立片段的离线分类方法无法反映流式场景中模型在实时获取音频时的决策动态,迫使研发团队设计因果静音段评分机制及策略参数扫描方法,以还原真实语音系统面临的逐帧抉择困境。
常用场景
经典使用场景
在语音交互系统研发领域,端到端检测(EoT)始终是制约对话流畅性的核心瓶颈。eot-bench-data数据集作为首个开放的、覆盖14种语言的真实人机对话数据集,为研究者提供了评估EoT模型的公共基准。其经典使用场景聚焦于在真实对话的静默间隔上,对模型进行因果性评估——每个用户轮次被标注出所有超过100毫秒的沉默片段,其中最终沉默标记为真结束,而中间沉默则代表用户犹豫。研究者可利用该数据集,在可控的延迟与中断预算下,系统比较不同模型的Pareto前沿性能,从而精准刻画模型在“避免过早打断”与“快速响应”之间的权衡能力。
实际应用
在实际部署中,eot-bench-data为各类语音代理产品的体验优化提供了直接指导。以智能客服、语音助手和实时对话系统为例,该数据集帮助开发者精准调整端点检测策略:例如在5%的误切断预算下,LiveKit Turn Detector v1可将响应延迟压缩至543毫秒,显著优于纯VAD基线的1600毫秒。这种基于真实用户对话的评测使企业能够根据产品容忍度(如金融场景要求极低误打断率,而娱乐场景可接受稍高延迟)选择最优模型,从而将生硬的“对讲机式”交互升级为自然流畅的类人对话体验。
衍生相关工作
eot-bench-data的发布直接催生了一系列相关学术与工程工作。首先,其定义的策略扫描与Pareto前沿评估方法已成为EoT模型评测的基线范式,后续研究如多模态端点检测、跨语言迁移学习均以此作为对比框架。其次,数据集附带的批量与流式适配器接口(覆盖Deepgram Flux、AssemblyAI等主流模型)极大地降低了新模型复现与对比的门槛,推动了社区贡献新的检测器并完善leaderboard。此外,其多语言覆盖特性激发了针对低资源语言EoT性能增进的专项研究,例如利用跨语言嵌入或语义语境增强在西班牙语、日语等语种上的鲁棒性,形成了以数据驱动模型迭代的良性学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务