Real-TurnTurk
收藏资源简介:
Real-TurnTurk 是一个多模态、双通道的土耳其语双人对话数据集,旨在改进基于语音的对话系统中的轮流预测(turn-taking prediction)。与另一合成数据集 Syn-TurnTurk 不同,本数据集中的所有对话均为两人之间通过视频通话录制的真实、无脚本交流。每位参与者被录制在独立的音频通道上,因此说话人归属准确,无需说话人分离模型。除音频外,数据集还提供了帧级的面部特征向量(头部姿态、注视方向、52个 ARKit 混合形状)、时间对齐的转录文本以及基于共同 62.5 ms 网格的帧级语音活动标注。数据集包含 6 个对话,6 个独特说话者(p01-p06),总时长 1.94 小时(6,987 秒),说话者-通道音频总时长 3.88 小时,包含 1,642 个话轮、360 个反馈信号、800 次话轮转换,以及 223,602 行面部特征数据。音频采用 Opus 编解码器,48 kHz 采样率,单声道;视频为 H.264,1920×1080,16 fps 恒定帧率。面部特征通过 MediaPipe Face Landmarker 提取,坐标归一化至参与者图块范围内。数据集适用于以下 AI 任务:土耳其语口语对话系统中的轮流预测、多模态语音分析、时间对齐转录与语音活动检测(VAD)、以及面部特征向量(ARKit 混合形状、头部姿态)支持的语音建模。
Real-TurnTurk is a multimodal, dual-channel Turkish dyadic conversation dataset designed to improve turn-taking prediction in speech-based dialogue systems. Unlike the synthetic dataset Syn-TurnTurk, all conversations in this dataset are real, unscripted exchanges between two people recorded via video call. Each participant is recorded on a separate audio channel, ensuring accurate speaker attribution without the need for speaker diarization models. In addition to audio, the dataset provides frame-level facial feature vectors (head pose, gaze direction, 52 ARKit blend shapes), time-aligned transcripts, and frame-level voice activity annotations based on a common 62.5 ms grid. The dataset contains 6 conversations with 6 unique speakers (p01-p06), totaling 1.94 hours (6,987 seconds) of audio, with speaker-channel audio totaling 3.88 hours, including 1,642 turns, 360 backchannel signals, 800 turn-switches, and 223,602 rows of facial feature data. Audio is encoded with Opus codec at 48 kHz sampling rate, mono; video is H.264, 1920×1080, 16 fps constant frame rate. Facial features are extracted using MediaPipe Face Landmarker, with coordinates normalized within each participants tile. The dataset is suitable for the following AI tasks: turn-taking prediction in Turkish spoken dialogue systems, multimodal speech analysis, time-aligned transcription and voice activity detection (VAD), and speech modeling supported by facial feature vectors (ARKit blend shapes, head pose).
Real-TurnTurk 数据集概述
基本信息
- 数据集名称:Real-TurnTurk
- 语言:土耳其语
- 许可证:Apache 2.0
- arXiv 编号:2608.22071
- 数据集规模:100K < n < 1M
核心简介
Real-TurnTurk 是一个多模态、双声道的土耳其语双人对话数据集,旨在改进基于语音的对话系统中的话轮转换预测。与合成数据构成的 Syn-TurnTurk 相比,该数据集包含的是两人间真实、无脚本的对话,通过视频通话录制而成。
关键特征
- 每位参与者使用独立声道录制,说话人归属精确,无需倒谱分离模型
- 数据包含帧级面部特征向量(头部姿态、注视方向、52个 ARKit blendshapes)
- 时间对齐的转录文本及共享 62.5ms 网格下的帧级语音活动标注
使用场景
- 土耳其语口语对话系统中的话轮转换预测
- 多模态语音分析
- 时间对齐转录与语音活动检测
- 面部特征向量支持的语音建模
数据规模统计
| 指标 | 数值 |
|---|---|
| 对话数 | 6 |
| 唯一说话人 | 6(p01-p06) |
| 说话人声道数 | 12 |
| 总时长 | 1.94 小时(6,987 秒) |
| 话轮数 | 1,642 |
| 反馈表达数 | 360 |
| 话轮转换数 | 800 |
| 转录段数 | 2,502 |
| 转录词数 | 16,027 |
| 面部特征记录行数 | 223,602 |
| 帧率 | 16 fps(62.5 ms) |
说话人在不同录音中会重复出现,支持跨录音的人员对比:p01 与 p06 各出现在 3 段对话中,p03 与 p04 各出现在 2 段对话中。
文件结构与内容
每个录音按录音 ID 存放在单独目录中,包含:
| 文件类型 | 内容 |
|---|---|
*__L_*.webm / *__R_*.webm |
每个说话人独立声道音频,交叉声道泄漏低于说话人自身电平 73-78 dB |
*__text.csv |
转录文本,每段对应一行 |
*__speech_activity.csv |
每帧每人语音活动标注(基于独立声道上的 Silero VAD) |
*__video_features.csv |
每人每帧 71 列数据:头部姿态、注视、52 个 ARKit blendshapes 等 |
*__animation.mp4 |
面部特征向量的动画可视化,用于人工检查 |
数据列结构
text.csv
包含start_time、end_time(HH:MM:SS.mmm 格式)、speaker(p01-p06)、text字段。
speech_activity.csv
包含记录 ID、帧索引与时间戳(62.5ms 步长)、说话人代码(p01-p06)及语音状态(0/1)。VAD 参数:min_silence_duration_ms=300、speech_pad_ms=100、min_speech_duration_ms=120。
video_features.csv
包含标识符与时间戳、说话人代码与面板位置(左/右)、face_detected标志(0 时测量列留空)、头部角度(俯仰/偏航/翻滚)、眼睛开合比例、嘴巴开合与宽度比例、注视方向、头部平移量及 52 个 ARKit blendshapes。
技术规格
音频参数
- 编解码器:Opus
- 采样率:48 kHz
- 声道数:单声道
- 码率:约 126-128 kbps
- 语音活动标注基于 16 kHz 单声道下混后计算
视频/动画参数
- 视频编码:H.264,1920×1080
- 帧率:16 fps 恒定
- 码率:约 3.2 Mbps
- 动画音频:AAC,16 kHz 单声道
特征提取
- 使用 MediaPipe Face Landmarker 0.10.35
- 478 个网格点 + 52 个 ARKit blendshapes
- 坐标已归一化到 0..1,非像素单位
数据大小
- 总体积:3.0 GB(每段录音 400-693 MB)
- animation.mp4 占总体积约 80%
统计分析要点
话轮转换偏移(FTO)
- 全量均值:-0.116 秒,中位数:+0.188 秒
- 42.1% 为负值(话轮有重叠)
- 94% 的转换落在 ±3 秒范围
话轮时长
- 平均 3.955 秒,中位数 2.438 秒
- 最长话轮 35.9 秒
对话风格差异
不同对话的风格差异显著:rec02 较为有序(中位 FTO +438ms,3% 同时说话),rec04 与 rec03 重叠较多(12-13% 同时说话)。
重叠与静默
- 重叠块总数:1,200
- 总重叠时长:989.3 秒(其中同时说话 491.4 秒,占 7.0%)
- 双方静默:801.4 秒(占 11.5%)
声画领先效应
测量发现嘴部运动领先于发声:说话人在发声前先打开和定位发音器官。该领先量在个体间存在差异且具有跨录音的可重复性(如 p03 在两段录音中均为 +438ms,p01 三段录音中分别为 +375/+375/+312ms)。对于以亚秒级分辨率融合面部与音频的研究者,需要将这些按声道区分的数值纳入考量。
数据许可与引用
数据集以 Apache 2.0 许可证发布,相关论文已提交至 arXiv(编号 2608.22071)。如需引用请参考附带的 BibTeX 引文格式。




