遇见数据集

TurnBench

收藏
github2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

一个用于记录的双通道人机对话中话轮结束和打断检测的多领域基准数据集,包含154个双人对话(约30小时,106位说话人,6种对话类型),每个对话由三位标注者进行标注,评估指标包括召回率、假阳性率和检测延迟。

A multi-domain benchmark dataset for recording two-channel human-machine conversations and enabling turn end and interruption detection. It contains 154 two-party dialogues, totaling approximately 30 hours of content, involving 106 speakers and covering 6 dialogue types. Each dialogue is annotated by three independent annotators, and the evaluation metrics include recall rate, false positive rate, and detection latency.

创建时间:
2026-08-27
原始信息汇总

TurnBench 数据集详情

数据集概述

TurnBench 是一个用于话轮转换检测的基准数据集,专注于话轮结束(End-of-Turn, EOT)打断(Interruption, INT) 检测任务。该数据集基于录制的双通道人类对话构建,评估指标包括召回率(Recall)、误报率(False-Positive Rate)和检测延迟(Detection Latency)。

数据规模与构成

  • 对话数量:154 组双人对话
  • 总时长:约 30 小时
  • 说话人数:106 位
  • 对话类型:6 种
  • 标注情况:每组对话均经过三重标注(triple-annotated)

数据集划分

划分 说明
开发集(Dev) 包含音频和标注,可在本地进行评分;提供于 mundo-ai/turn-benchmark-dev
测试集(Test) 仅含音频,标注不予公开;提供于 mundo-ai/turn-benchmark-test
训练集(Training) 约 104 小时,与基准数据集说话人无重叠,采用相同标注协议;提供于 otoearth/otoSpeech-full-duplex-turn-104h

所有数据集均为受限访问(gated),需使用 Hugging Face 令牌(token)方可获取。

提交与评分

  • 提交格式:模型需生成 predictions.json 文件,包含每个对话和说话人的 EOT 与 INT 检测时间戳。
  • 评分命令uv run python -m turnbench.score predictions.json(作用于公开开发集)
  • 格式规范与因果性规则见 docs/SUBMISSION_FORMAT.md,评分方法论见 turnbench/README.md,参考实现见 baselines/rms_vad/predict.py

基线模型

baselines/ 目录下每个基线模型均有独立子目录,各基线在数据集上运行后,在其各自工作点输出 predictions.json 文件。

分析脚本(部分示例)

功能 命令
按类型统计语料概览(表 III) uv run python turnbench/analysis/consensus_by_type.py --latex
测试集结果按对话类型分析(表 IV/排行榜) uv run python turnbench/analysis/results_by_conversation_type.py --dataset mundo-ai/turn-benchmark-test-golden --latex
逐标注者动态分析(表 III) uv run python turnbench/analysis/per_conversation.py
标注一致性统计(Cohens/Fleiss kappa,边界 F1) uv run python turnbench/analysis/iaa_agreement.py
人类延迟参考(地板转移偏移、打断产出) uv run python turnbench/analysis/human_baseline.py
与 Switchboard 的时序分布对比 uv run python turnbench/analysis/timing_distributions.py
阈值扫描与工作点(图 2) uv run python -m turnbench.sweep baselines/<name>/probs-<task>.json

排行榜与可视化

提供在线排行榜和交互式对话查看器,访问地址:https://turnbench.sesame.com

许可协议

  • 仓库代码采用 MIT License
  • 数据集托管于 Hugging Face,单独授权,采用非商业许可,并禁止语音克隆(详见各数据集仓库中的 LICENSE 文件)。
搜集汇总
数据集介绍
TurnBench 数据集图片
构建方式
在人类对话的细腻交互中,话轮转换的时机与打断的识别是自然语言处理领域的一项核心挑战。TurnBench数据集基于真实的双通道人类对话录音,精心构建了包含154段双人对话的语料库,总时长约30小时,覆盖106位说话者及6种对话类型。每条对话均由三位标注者独立进行三重注释,精确标记话轮结束(EOT)与打断(INT)的时间戳,从而确保标注的可靠性与一致性。该数据集与一个约104小时的训练集(otoSpeech-full-duplex-turn-104h)保持说话者不重叠,采用相同的标注协议,为模型的训练与评估提供了坚实基础。
特点
TurnBench数据集的独特之处在于其多维度与精细化的特性。其标注不仅涵盖EOT与INT的二元判定,还提供了丰富的时序信息,支持对检测延迟的量化分析。评估指标聚焦于召回率、误报率及检测延迟,全面反映模型在实际对话场景中的性能。数据集涵盖多样化的对话类型,便于研究者探究不同交互情境下的话轮转换动态。此外,与Switchboard等传统语料库相比,TurnBench提供了详尽的时序分布对比,有助于深入理解自然对话中的沉默、重叠与转换模式。
使用方法
研究者可通过Hugging Face平台获取TurnBench的音频与标注数据,其中开发集包含完整标签,可直接用于本地评分;测试集则仅提供音频以确保评估的公正性。提交结果需以predictions.json文件形式输出模型在每段对话及说话者上的EOT与INT检测时间戳,并通过官方评分脚本`uv run python -m turnbench.score predictions.json`进行验证。数据集的拆分文件与基线模型代码一同发布,便于复现与比较。配套的分析脚本支持生成语料概览、性能表格及人类基准对比,为深入挖掘数据价值提供便利。
背景与挑战
背景概述
在口语对话系统蓬勃发展的当下,实现流畅自然的人机交互迫切需要精准的轮次转换管理,其中端点检测(End-of-Turn)与打断检测(Interruption)作为核心机制,直接关系到对话的连续性与用户体验。然而,现有数据集多聚焦于单一场景或受限的对话类型,缺乏对多样现实对话动态的全面覆盖,阻碍了通用模型的构建与评估。TurnBench正是在此背景下应运而生,由全球多家机构的研究人员于2026年联合创建,包含约30小时、含106位说话者、覆盖6种对话类型的154场双人对话录音,每段对话均经三重标注,以确保标注的高可靠性。该基准通过统一的评分框架,从召回率、误报率及检测延迟三个维度对模型进行标准化评估,填补了轮次切换研究在真实多域场景下评估的空白,为推动对话系统向更自然交互演进提供了关键数据支撑与评测平台。
当前挑战
TurnBench面临的挑战贯穿于数据集构建与任务解决两个层面。在领域问题层面,实现高召回与低误报的双重平衡极具难度,尤其在真实对话中,语音交叠、非语言反馈及背景噪声等因素极易导致端点误判,而检测延迟的权衡更增加了系统设计的复杂性,使得模型在动态多变的对话环境中保持鲁棒性成为一大难题。在构建过程中,团队需从零开始设计并采集涵盖广泛对话类型的双声道音频,确保说话者多样性并规避身份重叠对训练评估的影响;同时,制定清晰可操作的标注协议以指导多轮人工标注,并对标注结果进行一致性校验,在克服高昂人力与时间成本的同时,保障了三重标注的高质量。此外,为构建公正可靠的基准,还需明确定义预测时间戳的因果性规则,防范数据泄漏,并设计能公平衡量不同模型性能的评分方法,这些环节均构成了不容忽视的技术与工程挑战。
常用场景
经典使用场景
TurnBench作为对话系统领域的前沿基准,其核心应用场景聚焦于双人自然对话中的话轮转换动态建模,特别针对语音交互代理的端到端(EOT)检测与打断(INT)识别任务。该数据集收录了154段双人对话,涵盖6种会话类型,总时长约30小时,由106位说话者参与,每条对话均经过三位标注者的独立注解,确保了标注的高可靠性与一致性。研究者可利用此基准,在统一框架下评估模型在召回率、假阳性率及检测延迟等关键指标上的表现,从而推动对话系统从传统的按序处理向实时、自然的交互模式演进。
解决学术问题
在学术研究中,TurnBench系统地解决了话轮转换检测领域长期缺乏标准化、多领域基准的问题。以往研究多依赖小规模或单一场景数据,难以全面衡量模型在复杂对话环境中的泛化能力。TurnBench通过提供 speaker-disjoint 的训练与测试划分、明确的评估协议和计算指标,使得不同模型间的性能比较成为可能,极大地促进了端到端话轮转换模型的迭代优化。其基于共识标注的策略有效减少了主观偏差,为评估检测算法的鲁棒性提供了坚实基石,进而推动了对话系统在真实场景中实现自然、流畅交互的学术探索。
衍生相关工作
TurnBench的发布催生了一系列衍生研究,不仅限于话轮转换本身。其基线与分析脚本(如阈值扫描、时序分布对比)为后续工作提供了可复用的技术框架,促进了诸如流式语音识别、语音活动检测(VAD)与话轮转换联合建模的研究。基于该数据集的训练集(如otoSpeech)被广泛用于预训练语音模型,以提高对自然对话节奏的敏感度。此外,TurnBench的评估方法启发了对交互式语音系统公平比较的研究,推动了学术界与工业界在实时对话AI标准化评估上的深入合作,如Sesame公司参与的基准共建,彰显了该数据集在连接前沿研究与产业应用中的桥梁作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务