TurnBench
收藏资源简介:
一个用于记录的双通道人机对话中话轮结束和打断检测的多领域基准数据集,包含154个双人对话(约30小时,106位说话人,6种对话类型),每个对话由三位标注者进行标注,评估指标包括召回率、假阳性率和检测延迟。
A multi-domain benchmark dataset for recording two-channel human-machine conversations and enabling turn end and interruption detection. It contains 154 two-party dialogues, totaling approximately 30 hours of content, involving 106 speakers and covering 6 dialogue types. Each dialogue is annotated by three independent annotators, and the evaluation metrics include recall rate, false positive rate, and detection latency.
TurnBench 数据集详情
数据集概述
TurnBench 是一个用于话轮转换检测的基准数据集,专注于话轮结束(End-of-Turn, EOT) 和打断(Interruption, INT) 检测任务。该数据集基于录制的双通道人类对话构建,评估指标包括召回率(Recall)、误报率(False-Positive Rate)和检测延迟(Detection Latency)。
数据规模与构成
- 对话数量:154 组双人对话
- 总时长:约 30 小时
- 说话人数:106 位
- 对话类型:6 种
- 标注情况:每组对话均经过三重标注(triple-annotated)
数据集划分
| 划分 | 说明 |
|---|---|
| 开发集(Dev) | 包含音频和标注,可在本地进行评分;提供于 mundo-ai/turn-benchmark-dev |
| 测试集(Test) | 仅含音频,标注不予公开;提供于 mundo-ai/turn-benchmark-test |
| 训练集(Training) | 约 104 小时,与基准数据集说话人无重叠,采用相同标注协议;提供于 otoearth/otoSpeech-full-duplex-turn-104h |
所有数据集均为受限访问(gated),需使用 Hugging Face 令牌(token)方可获取。
提交与评分
- 提交格式:模型需生成
predictions.json文件,包含每个对话和说话人的 EOT 与 INT 检测时间戳。 - 评分命令:
uv run python -m turnbench.score predictions.json(作用于公开开发集) - 格式规范与因果性规则见
docs/SUBMISSION_FORMAT.md,评分方法论见turnbench/README.md,参考实现见baselines/rms_vad/predict.py。
基线模型
baselines/ 目录下每个基线模型均有独立子目录,各基线在数据集上运行后,在其各自工作点输出 predictions.json 文件。
分析脚本(部分示例)
| 功能 | 命令 |
|---|---|
| 按类型统计语料概览(表 III) | uv run python turnbench/analysis/consensus_by_type.py --latex |
| 测试集结果按对话类型分析(表 IV/排行榜) | uv run python turnbench/analysis/results_by_conversation_type.py --dataset mundo-ai/turn-benchmark-test-golden --latex |
| 逐标注者动态分析(表 III) | uv run python turnbench/analysis/per_conversation.py |
| 标注一致性统计(Cohens/Fleiss kappa,边界 F1) | uv run python turnbench/analysis/iaa_agreement.py |
| 人类延迟参考(地板转移偏移、打断产出) | uv run python turnbench/analysis/human_baseline.py |
| 与 Switchboard 的时序分布对比 | uv run python turnbench/analysis/timing_distributions.py |
| 阈值扫描与工作点(图 2) | uv run python -m turnbench.sweep baselines/<name>/probs-<task>.json |
排行榜与可视化
提供在线排行榜和交互式对话查看器,访问地址:https://turnbench.sesame.com
许可协议
- 仓库代码采用 MIT License。
- 数据集托管于 Hugging Face,单独授权,采用非商业许可,并禁止语音克隆(详见各数据集仓库中的 LICENSE 文件)。




