遇见数据集

Real-TurnTurk

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Real-TurnTurk 是一个多模态、双通道的土耳其语双人对话数据集,旨在改进基于语音的对话系统中的轮流预测(turn-taking prediction)。与另一合成数据集 Syn-TurnTurk 不同,本数据集中的所有对话均为两人之间通过视频通话录制的真实、无脚本交流。每位参与者被录制在独立的音频通道上,因此说话人归属准确,无需说话人分离模型。除音频外,数据集还提供了帧级的面部特征向量(头部姿态、注视方向、52个 ARKit 混合形状)、时间对齐的转录文本以及基于共同 62.5 ms 网格的帧级语音活动标注。数据集包含 6 个对话,6 个独特说话者(p01-p06),总时长 1.94 小时(6,987 秒),说话者-通道音频总时长 3.88 小时,包含 1,642 个话轮、360 个反馈信号、800 次话轮转换,以及 223,602 行面部特征数据。音频采用 Opus 编解码器,48 kHz 采样率,单声道;视频为 H.264,1920×1080,16 fps 恒定帧率。面部特征通过 MediaPipe Face Landmarker 提取,坐标归一化至参与者图块范围内。数据集适用于以下 AI 任务:土耳其语口语对话系统中的轮流预测、多模态语音分析、时间对齐转录与语音活动检测(VAD)、以及面部特征向量(ARKit 混合形状、头部姿态)支持的语音建模。

Real-TurnTurk is a multimodal, dual-channel Turkish dyadic conversation dataset designed to improve turn-taking prediction in speech-based dialogue systems. Unlike the synthetic dataset Syn-TurnTurk, all conversations in this dataset are real, unscripted exchanges between two people recorded via video call. Each participant is recorded on a separate audio channel, ensuring accurate speaker attribution without the need for speaker diarization models. In addition to audio, the dataset provides frame-level facial feature vectors (head pose, gaze direction, 52 ARKit blend shapes), time-aligned transcripts, and frame-level voice activity annotations based on a common 62.5 ms grid. The dataset contains 6 conversations with 6 unique speakers (p01-p06), totaling 1.94 hours (6,987 seconds) of audio, with speaker-channel audio totaling 3.88 hours, including 1,642 turns, 360 backchannel signals, 800 turn-switches, and 223,602 rows of facial feature data. Audio is encoded with Opus codec at 48 kHz sampling rate, mono; video is H.264, 1920×1080, 16 fps constant frame rate. Facial features are extracted using MediaPipe Face Landmarker, with coordinates normalized within each participants tile. The dataset is suitable for the following AI tasks: turn-taking prediction in Turkish spoken dialogue systems, multimodal speech analysis, time-aligned transcription and voice activity detection (VAD), and speech modeling supported by facial feature vectors (ARKit blend shapes, head pose).

创建时间:
2026-08-26
原始信息汇总

Real-TurnTurk 数据集概述

基本信息

  • 数据集名称:Real-TurnTurk
  • 语言:土耳其语
  • 许可证:Apache 2.0
  • arXiv 编号:2608.22071
  • 数据集规模:100K < n < 1M

核心简介

Real-TurnTurk 是一个多模态、双声道的土耳其语双人对话数据集,旨在改进基于语音的对话系统中的话轮转换预测。与合成数据构成的 Syn-TurnTurk 相比,该数据集包含的是两人间真实、无脚本的对话,通过视频通话录制而成。

关键特征

  • 每位参与者使用独立声道录制,说话人归属精确,无需倒谱分离模型
  • 数据包含帧级面部特征向量(头部姿态、注视方向、52个 ARKit blendshapes)
  • 时间对齐的转录文本及共享 62.5ms 网格下的帧级语音活动标注

使用场景

  • 土耳其语口语对话系统中的话轮转换预测
  • 多模态语音分析
  • 时间对齐转录与语音活动检测
  • 面部特征向量支持的语音建模

数据规模统计

指标 数值
对话数 6
唯一说话人 6(p01-p06)
说话人声道数 12
总时长 1.94 小时(6,987 秒)
话轮数 1,642
反馈表达数 360
话轮转换数 800
转录段数 2,502
转录词数 16,027
面部特征记录行数 223,602
帧率 16 fps(62.5 ms)

说话人在不同录音中会重复出现,支持跨录音的人员对比:p01 与 p06 各出现在 3 段对话中,p03 与 p04 各出现在 2 段对话中。

文件结构与内容

每个录音按录音 ID 存放在单独目录中,包含:

文件类型 内容
*__L_*.webm / *__R_*.webm 每个说话人独立声道音频,交叉声道泄漏低于说话人自身电平 73-78 dB
*__text.csv 转录文本,每段对应一行
*__speech_activity.csv 每帧每人语音活动标注(基于独立声道上的 Silero VAD)
*__video_features.csv 每人每帧 71 列数据:头部姿态、注视、52 个 ARKit blendshapes 等
*__animation.mp4 面部特征向量的动画可视化,用于人工检查

数据列结构

text.csv

包含start_timeend_time(HH:MM:SS.mmm 格式)、speaker(p01-p06)、text字段。

speech_activity.csv

包含记录 ID、帧索引与时间戳(62.5ms 步长)、说话人代码(p01-p06)及语音状态(0/1)。VAD 参数:min_silence_duration_ms=300speech_pad_ms=100min_speech_duration_ms=120

video_features.csv

包含标识符与时间戳、说话人代码与面板位置(左/右)、face_detected标志(0 时测量列留空)、头部角度(俯仰/偏航/翻滚)、眼睛开合比例、嘴巴开合与宽度比例、注视方向、头部平移量及 52 个 ARKit blendshapes。

技术规格

音频参数

  • 编解码器:Opus
  • 采样率:48 kHz
  • 声道数:单声道
  • 码率:约 126-128 kbps
  • 语音活动标注基于 16 kHz 单声道下混后计算

视频/动画参数

  • 视频编码:H.264,1920×1080
  • 帧率:16 fps 恒定
  • 码率:约 3.2 Mbps
  • 动画音频:AAC,16 kHz 单声道

特征提取

  • 使用 MediaPipe Face Landmarker 0.10.35
  • 478 个网格点 + 52 个 ARKit blendshapes
  • 坐标已归一化到 0..1,非像素单位

数据大小

  • 总体积:3.0 GB(每段录音 400-693 MB)
  • animation.mp4 占总体积约 80%

统计分析要点

话轮转换偏移(FTO)

  • 全量均值:-0.116 秒,中位数:+0.188 秒
  • 42.1% 为负值(话轮有重叠)
  • 94% 的转换落在 ±3 秒范围

话轮时长

  • 平均 3.955 秒,中位数 2.438 秒
  • 最长话轮 35.9 秒

对话风格差异

不同对话的风格差异显著:rec02 较为有序(中位 FTO +438ms,3% 同时说话),rec04 与 rec03 重叠较多(12-13% 同时说话)。

重叠与静默

  • 重叠块总数:1,200
  • 总重叠时长:989.3 秒(其中同时说话 491.4 秒,占 7.0%)
  • 双方静默:801.4 秒(占 11.5%)

声画领先效应

测量发现嘴部运动领先于发声:说话人在发声前先打开和定位发音器官。该领先量在个体间存在差异且具有跨录音的可重复性(如 p03 在两段录音中均为 +438ms,p01 三段录音中分别为 +375/+375/+312ms)。对于以亚秒级分辨率融合面部与音频的研究者,需要将这些按声道区分的数值纳入考量

数据许可与引用

数据集以 Apache 2.0 许可证发布,相关论文已提交至 arXiv(编号 2608.22071)。如需引用请参考附带的 BibTeX 引文格式。

搜集汇总
数据集介绍
Real-TurnTurk 数据集图片
构建方式
在语音对话系统研究领域,真实多人交互数据的稀缺长期制约着话轮转换建模的发展。Real-TurnTurk 的构建以视频通话中的无脚本双人土耳其语对话为素材,六段对话由六位说话人两两组合完成,每位参与者均通过独立音频通道录制,从而彻底规避了说话人分离模型的介入需求。录制完成后,研究团队以 16 fps、62.5 毫秒的公共时基对齐多模态信号:采用 MediaPipe Face Landmarker 逐帧提取面部特征,包括头部姿态、注视方向与 52 维 ARKit 表情基系数;借助 Silero VAD 在隔离通道上生成帧级语音活动标注;并转录出带有精确时间戳的文本片段。全部模态由此统一到同一离散时间网格,形成结构严密的多模态语料库。
特点
该数据集的核心特质在于其真实性与多模态的精细对齐。与合成语料不同,所有对话均为自然发生的即兴交流,说话人自身的语音通道隔离度高达 73 至 78 分贝,确保说话人归属绝对精确。数据集提供 1,642 个话轮、800 次话轮转换及 360 次反馈信号,并附有帧级面部特征向量,涵盖头部平移、眼部与嘴部几何量、注视坐标及完整 ARKit 表情基。当面部检测失败时,测量列留空而时间轴保持连续,使数据缺失模式透明可见。部分说话人跨录音重复出现,为个体层面的对比分析提供了可能。
使用方法
研究者可将 Real-TurnTurk 直接用于土耳其语话轮转换预测、多模态语音分析、时间对齐转录及语音活动检测等任务。加载时需注意,文本、语音活动与视频特征分别存储于三类 CSV 配置中,共享 recording、frame 与 t_sec 等键值,便于跨模态联结。由于面部特征与音频存在可测量的超前效应——即嘴部运动先于发声,且该超前量具有说话人特异性——在低于秒级分辨率下融合视听信号的研究者,应依据各通道实测超前值对时序对齐加以校正。隔离的单人音频存放于 webm 文件,动画视频仅用于视觉查验,不包含原始视频与 478 点关键点数据。
背景与挑战
背景概述
对话系统中的轮次转换预测长期受制于数据稀缺,既有语料多依赖合成或脚本化交互,难以捕捉自然会话的微妙时序。土耳其语作为低资源语种,在该领域几无公开资源。为填补这一空白,研究者于2026年构建了Real-TurnTurk,由Ahmet Tuğrul Bayrak等学者依托土耳其多家机构合作完成,成果发布于arXiv。该数据集以6段真实视频通话为源,经双通道隔离采集,融合语音、文本与面部特征,成为首个面向土耳其语真实二元对话的多模态轮次转换语料,为会话分析与多模态建模提供了实证基础,推动低资源语种对话系统研究。
当前挑战
该数据集所应对的核心领域问题在于,如何在真实、无脚本的对话中准确预测话轮转换,尤其是处理话轮转换偏移的个体差异与负值重叠现象。构建过程中面临多重挑战:双通道音频需严格隔离,确保串音抑制达73-78分贝以下;面部特征提取需在每秒16帧下保持与语音活动的精确对齐,并应对面部检测失败时的数据连续性;此外,会话风格的配对差异、重叠言语与静默区段的分布不均,以及音视频超前于发声的时序失配,均对标注与建模提出严苛要求,使该数据集在泛化性与表征学习方面仍存显著挑战。
常用场景
经典使用场景
在语音对话系统与多模态交互研究领域,话轮转换预测长期受制于缺乏真实、双通道且同步标注的语料资源。Real-TurnTurk以六组土耳其语二人视频通话为基底,将每位参与者的音频独立分轨,辅以帧级面部特征向量、时间对齐转写与语音活动标注,天然适配话轮转换预测、语音活动检测、多模态语音分析及时间对齐转写等任务。研究者可基于共享的62.5毫秒网格,同步调用音频与视觉线索,在无需说话人分离模型的条件下精确归因发言者,从而在接近自然对话的情境中检验建模策略。
实际应用
在工程实践中,Real-TurnTurk可服务于土耳其语智能语音助手、实时会议转录与交互式虚拟人等系统。其双通道设计使系统能直接定位当前发言者,显著降低低延迟场景下的响应误差;面部特征向量则可辅助预测用户即将接话的意图,从而优化打断恢复与轮流发言策略。此外,帧级语音活动标注为构建鲁棒语音活动检测器提供了真实噪声条件下的训练素材,有助于提升嘈杂环境中的端点检测精度,并为多模态对话管理提供可解释的行为线索。
衍生相关工作
作为Syn-TurnTurk的实景对照语料,Real-TurnTurk衍生出一系列围绕真实对话动态的后续研究。基于其音视频先行效应的量化结果,研究者开始系统校正面部与音频融合中的时序偏差,并探索个性化话轮转换预测模型;其重叠发言与反馈信号的精细标注亦催生了针对高互动性对话的建模工作。该数据集与合成版本形成互补,共同推进土耳其语乃至多语种会话智能的基准建设,为多模态对话系统提供可复用的评测范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务