tamil-eot
收藏官方服务:
资源简介:
泰米尔语语音中语义性话轮结束检测的首个开放数据集,包含18,485个标注边界,采用CC BY 4.0许可。
The first open dataset for semantic turn boundary detection in Tamil speech, containing 18,485 annotated boundaries and licensed under CC BY 4.0.
创建时间:
2026-08-25
原始信息汇总
TamilEOT 数据集详情
数据集简介
TamilEOT 是首个面向泰米尔语的开源语义话轮结束检测(Semantic End-of-Turn Detection)数据集。该数据集包含 18,485 个标注的话轮边界,来源于 116 通真实的泰米尔语电话录音,用于根据说话人最后 8 秒的音频韵律特征(而非转录文本)判断其是否已结束发言。数据集采用 CC BY 4.0 许可证。
数据来源与构建
- 源码语料:
SPRING_INX_Tamil_R1(CC BY 4.0,由 IIT Madras 的 SPRING 实验室发布),选取其中ta_IN_*_{Left,Right}系列,共 116 通双向电话,每侧说话人独立成音频文件,且每侧均有独立的人工转写。 - 说话人标签直接由音频文件来源确定,无需经过说话人分离处理,也不存在分离误差。
- 话轮边界由 Silero VAD 生成(而非转写时间戳),转写文本仅用于确认语音片段及过滤反馈词(如“嗯”等)。
标注方式与质量
- 初步规则派生标注在盲听测试(97 个片段)中总体准确率为 70.1%,其中正类(话轮完成)准确率 95.9%,负类(话轮未完成)准确率仅 44.4%。
- 经评估后,使用 Gemini 3.7 Flash 对全部 16,213 个片段进行重新标注,总成本仅 5.69 美元,与人类标注者在同一盲测集上的一致率达 97.5%。重新标注后,53% 的负类标签翻转(独立人工标注中翻转比例为 56%)。
- 重新标注还消除了原有结构性混杂因素:
prev_dur特征的类别分离度从 d = −0.33 降至 −0.09。
数据划分
| 划分 | 片段数 | 完成(complete) | 未完成(incomplete) | 通话数 |
|---|---|---|---|---|
| 训练集 train | 11,992 | 7,908 | 4,084 | 71 |
| 开发集 dev | 2,325 | 1,532 | 793 | 15 |
| 测试集 test | 4,168 | 2,629 | 1,539 | 30 |
数据按通话(而非单个片段)切分,以避免说话人声音泄漏,确保韵律泛化能力的真实评估。
相关资源
- 论文:arXiv:2609.05631(描述方法、所有测量结果及负向实验结果)
- 模型:
santhosh-005/smart-turn-tamil(int8 ONNX 格式,tiny 版 8.7 MB / base 版 21 MB,支持 CPU 运行) - 数据集主页:HuggingFace 平台
santhosh-005/tamil-eot - 插件:
smart-turn-livekit(可通过 pip 安装,运行于 LiveKit Agents)
模型在测试集上的表现
测试集来自 30 通电话的 4,168 个片段,在本地以阈值 0.5 重新评分:
| 模型 | 准确率 | ROC-AUC | FP/N | 大小 | p50(单线程) |
|---|---|---|---|---|---|
| 多数类基线(complete) | 63.08% | 0.500 | – | – | – |
| smart-turn-v3.2 零样本 | 70.30% | 0.751 | – | 8.7 MB | – |
| tiny int8(可直接替换) | 83.71% | 0.905 | 7.94% | 8.7 MB | 83 ms |
| base int8(最佳准确率) | 86.13% | 0.921 | 9.17% | 21 MB | 143 ms |
相比零样本提升 +15.83 个百分点,ROC-AUC 从 0.751 提升至 0.921。发布的 ONNX 文件经本地重测可复现训练结果,重新导出的计算图与已发布版本逐位一致(max|delta| = 0.00e+00)。
搜集汇总
数据集介绍

构建方式
TamilEOT数据集源自IIT马德拉斯SPRING实验室发布的SPRING_INX Tamil R1语料库,该语料库包含116通真实泰米尔语电话对话,每通对话按说话人分别存储音频,且每段语音均有人工转写。研究者利用Silero VAD检测话语边界,基于语音活动而非转写时间戳切分音频片段,并通过转写文本确认语音内容及过滤回应词。片段标签起初由规则生成,但经人工盲听评估发现负类标签准确率仅44.4%,遂采用Gemini 3.7 Flash模型重新标注,其与人类标注的一致率达97.5%,共重标16,213个片段,成本仅5.69美元。重标注有效矫正了先前因规则门槛导致的类别偏差,最终形成包含18,485个标注边界的数据集,按通话而非片段划分训练集(71通)、开发集(15通)和测试集(30通),以防语音泄漏并保证韵律泛化。
特点
TamilEOT作为泰米尔语语义话轮结束检测领域的首个开源数据集,具有显著特色。其正类样本锚定于真实通话中的行为证据——对方听到说话者结束后接管话轮,而负类则基于人类判断的韵律不完整,确保了标签的行为学有效性。数据集包含11,992个训练片段、2,325个开发片段和4,168个测试片段,均源自真实窄带电话语音,区别于多数使用TTS合成音频的基准。模型在测试集上实现86.13%的准确率(base模型)和0.921的ROC-AUC,较零样本基线提升15.83个百分点,且误报率低至9.17%。此外,数据集附带完整的实验记录,包括标签质量分析、训练细节及失败实验,体现科学透明性。
使用方法
TamilEOT的设计旨在支持下游模型训练与评估。用户可通过HuggingFace获取数据集,或运行pip install smart-turn-livekit安装配套插件,在LiveKit或Pipecat框架中集成使用。模型提供tiny和base两种int8量化版本,均能在CPU上高效运行(推理延迟分别为83毫秒和143毫秒),无需GPU或PyTorch环境。使用时可调用SmartTurnDetector类加载预训练权重,或加载ONNX模型后处理实时音频流。为复现论文结果,用户需访问SPRING_INX原始语料,并按pipeline中的顺序执行00至22步脚本;其中12步和17步可从裸仓库直接复现标签对比与争议分析。建议依据开发集而非测试集调整阈值,以平衡准确率与误报率。
背景与挑战
背景概述
TamilEOT是首个面向泰米尔语的开源语义话轮结束检测数据集,由研究者Santhosh等人于2026年创建,源自印度理工学院马德拉斯分校SPRING实验室的SPRING_INX Tamil R1语料库。该数据集包含116通真实泰米尔语电话录音,涵盖18,485个标注边界,旨在解决语音助手在对话中因缺乏语言模型而依赖固定静音超时导致的打断或延迟问题。通过微调Smart Turn v3模型,TamilEOT在真实窄带电话语音上实现了83.71%至86.13%的准确率,较零样本提升了近16个百分点,填补了泰米尔语在语义话轮检测领域的空白,为低资源语言的对话系统研究提供了重要基准,其模型轻量(最小仅8.7 MB)且可在CPU上实时运行,兼具学术价值与工业应用潜力。
当前挑战
TamilEOT面临的挑战核心在于语义话轮检测的固有难度:泰米尔语的韵律特征复杂,话轮转换常依赖文化语境的非言语线索,且真实电话语音含噪声、口音及不完整语法,远超TTS合成音频的复杂性。构建过程中,初期基于规则从VAD和转写时间戳推导的标签在负类上准确率仅44.4%,暴露了标注范式的根本缺陷;需引入人工评测与Gemini 3.7 Flash模型重新标注,成本极低($5.69)但实现了97.5%的人类一致性,且纠正了特征偏差。此外,模型在训练中遭遇容量限制——tiny版本受模型容量瓶颈制约,而base版本则面临数据不足,学习曲线未收敛,揭示了低资源语言数据增强的必要性。最终,实际部署中还须应对VAD时间窗偏移(导致准确率下降2.6个百分点)及覆盖率不足(仅92.2%)等工程挑战,确保模型在真实流式端点检测中的稳健性。
常用场景
经典使用场景
TamilEOT数据集在语义性话轮结束检测领域树立了里程碑,其核心应用场景聚焦于对话式人工智能系统的实时交互优化。该数据集利用泰米尔语电话对话的中继韵律特征,使模型得以在无需依赖完整文本转录的条件下,精准判别说话人是否已结束发言。此数据集为研究者提供了18,485个标注清晰的边界样本,并配套了轻量级CPU可运行的ONNX模型,使得在资源受限的对话环境中实现低延迟端到端部署成为可能,从而极大促进了语音助手与自适应对话系统的研究进展。
解决学术问题
该数据集针对口语对话系统中普遍存在的固定静默超时机制缺陷,提供了基于语义的解决方案。它系统性地解决了低资源语言(如泰米尔语)缺乏高质量韵律标注数据的研究困境,并通过严谨的标签替换流程,消除了基于规则标注所固有的类别不平衡和结构混淆偏差。数据集提供了按通话而非片段划分的训练/开发/测试集,有效防止了说话人信息泄露,为可复现的自然语言理解研究建立了新基准,其方法论与测量范式在多语种话轮转换建模中具有深远影响力。
衍生相关工作
该数据集及配套发布的开源模型构成了一个完备的科研构件,催生了若干衍生工作。其可复现的流水线(pipeline/00至22)与详细的对比实验档案,为后续端到端话轮检测器的研究提供了直接参照系。尤为值得注意的是,基于该数据集的微调模型相较于零样本基线实现了15.83个百分点的准确率跃升,该结果直接激励了针对其他低资源语言(如孟加拉语、马拉地语)进行类似模型适配的研究。此外,其高性价比的标签弱监督策略(利用大语言模型仅以5.69美元完成全部数据的重标注)为语音处理领域的数据高效标注范式开辟了新的探索方向,已被视为半监督学习在对话韵律分析中应用的重要实证。
以上内容由遇见数据集搜集并总结生成



