遇见数据集

TED4C-L

收藏
arXiv2026-06-29 更新2026-07-04 收录
数据链接:
官方服务:

资源简介:

TED4C-L是一个面向文化感知手势生成研究的大规模多模态数据集,由意大利理工学院和热那亚大学的研究团队构建。该数据集包含来自印度、意大利、土耳其和日本四个文化区域的764位演讲者,总时长106小时,共计659,454个五秒重叠样本,涵盖音频、运动姿态和文本转录等多维度信息。数据采集过程严格筛选了TED演讲视频,确保演讲者使用母语且姿态清晰,通过OpenPose提取9个上身关键点,并结合音频频谱特征与LaBSE文本嵌入进行对齐处理。该数据集旨在解决跨文化手势生成的泛化问题,支持语音同步、文化一致性建模等前沿人机交互研究。

TED4C-L is a large-scale multimodal dataset for culture-aware gesture generation research, constructed by research teams from the Istituto Italiano di Tecnologia (IIT) and the University of Genoa. It contains 764 speakers from four cultural regions: India, Italy, Turkey, and Japan, with a total duration of 106 hours and a total of 659,454 5-second overlapping samples, covering multi-dimensional information including audio, motion gestures, and text transcriptions. During data collection, TED talk videos were strictly screened to ensure that speakers used their native language and had clear gestures. Nine upper-body key points were extracted via OpenPose, and alignment processing was performed by combining audio spectrum features and LaBSE text embeddings. This dataset aims to address the generalization issue of cross-cultural gesture generation, and supports cutting-edge human-computer interaction research such as speech synchronization and cultural consistency modeling.

创建时间:
2026-06-29
搜集汇总
数据集介绍
TED4C-L 数据集图片
构建方式
TED4C-L数据集基于YouTube上的TED演讲视频构建,涵盖印度(印地语)、意大利、日本和土耳其四个文化群体的764位演讲者,总时长106小时。研究团队仅选取演讲者清晰可见、站立演讲且未手持可能影响手势的物品的视频片段。通过OpenPose提取上肢9个3D关键点(颈部、头部、中央髋部、肩部、肘部、腕部),以15 FPS采样,每个样本包含75帧运动序列,并利用VQVAE编码器将其压缩为25个离散标记。音频被降采样至16 kHz,提取64维梅尔对数谱、起始强度及1024维wav2vec特征;文本则通过LaBSE模型获取语义嵌入。最终生成659,454个5秒长度的样本,确保每位演讲者仅出现在单一数据子集中,实现跨说话人的文化泛化评估。
特点
该数据集具有三大显著特点。其一,文化多样性:涵盖四种语言背景(印地语、意大利语、日语、土耳其语)的约190位演讲者,文化标签基于地理和语言群体划分,减少了文化重叠的干扰。其二,跨说话人评估协议:训练、验证和测试集采用说话人无关划分,确保同一说话人不会跨子集出现,从而抑制模型对个体风格记忆而真正学习群体文化模式。其三,多模态对齐:运动、音频和文本特征严格同步,通过0.5秒滑动窗口切片,实现了精细的时序对应。实验显示,仅凭运动特征训练的分类器在未见说话人上达到了约45%的平衡准确率(随机基线为25%),证实手势动作中确实蕴含可泛化的文化信号。
使用方法
该数据集适用于文化感知的共语手势生成研究。使用时可加载预处理的运动标记(VQVAE编码后的25个离散标记)、音频特征(梅尔谱、起始强度、wav2vec嵌入)及文本嵌入(LaBSE)。建议采用说话人无关的训练-验证-测试划分(数据集已预定义),以便评估模型的文化泛化能力。研究者可将其作为SICAGE框架的输入,结合Fishr正则化或对抗性学习训练文化嵌入提取器,再接入扩散模型(如ALaDiT)生成手势。数据集支持批量加载,每个样本为一个5秒片段,适合实时生成任务。开源代码与预处理流程已公开,便于复现与扩展。
背景与挑战
背景概述
TED4C-L数据集由意大利理工学院(IIT)与热那亚大学的研究团队于2026年创建,旨在解决跨文化共语手势生成中普遍存在的文化特异性忽视问题。该数据集基于TED演讲视频,精心筛选了来自印度、意大利、日本和土耳其四个文化区域的764位演讲者,累计106小时的多模态数据,涵盖音频、文本及姿态信息。其核心研究问题在于,如何在说话者无关的条件下,从语言和声学特征中提取可靠的文化表征,以驱动生成与文化群体一致的手势动作。TED4C-L的提出,为评估文化泛化能力提供了大规模、说话者严格分离的基准,对提升社会机器人与虚拟代理在跨文化交互中的自然性与可信度具有重要推动作用。
当前挑战
TED4C-L所应对的核心挑战在于,现有文化感知手势生成方法常因说话者身份混淆而错误归因文化效应。这一领域难题要求模型在仅凭多模态线索(如韵律、语义)的条件下,自动学习可跨越说话者个体差异的文化风格模式。在数据构建层面,挑战尤为突出:确保各文化组内说话者数量均衡、姿态提取质量一致,以及面对不同语言与视频拍摄条件(如遮挡、晃动)时维持动作关键点的可靠性。此外,由于手势本身存在巨大的个体间变异,基于单人标签的监督信号难以直接泛化,迫使研究者采用领域泛化策略(如Fishr正则化与对抗学习)进行训练,这进一步增加了模型设计的复杂性。
常用场景
经典使用场景
TED4C-L数据集最经典的使用场景在于跨文化共语手势生成研究,即基于演讲者的语音和文本信息,合成与特定文化背景相协调的伴随性手势动作。研究者可将其作为大规模、多模态、说话人独立的数据资源,用于训练和评估能够感知文化差异的手势生成模型。数据集包含来自印度、意大利、日本和土耳其四个文化群体的764位演讲者的106小时TED演讲视频,覆盖音频、文本、姿态关键点等多模态信息,且采用说话人不相交的划分策略,为检验模型是否真正习得文化层面的泛化能力而非记忆个体风格提供了严格的实验平台。
实际应用
在实际应用层面,TED4C-L所支撑的技术可被部署于人机交互、虚拟角色动画及社交机器人等场景之中。例如,面向跨文化用户的虚拟助手或教育机器人,能够根据用户的文化背景自动调整其伴随语音的手势风格,从而提升互动的自然性、亲和力与文化适切性。此外,该数据集还可服务于多语言TED演讲的自动化手势增强,帮助内容创作者为不同语言版本的演讲生成与本地文化表达习惯相吻合的肢体动作,从而增强信息传递的效果与观众的沉浸式体验。
衍生相关工作
基于TED4C-L数据集,研究者已衍生出多项具有影响力的经典工作。其中最具代表性的是SICAGE框架,该框架首次将说话人独立的领域泛化策略(如Fishr正则化与对抗学习)引入文化感知手势生成,成功学习到可跨说话人迁移的文化嵌入表征。此外,ALaDiT扩散模型作为配套的实时手势生成器,充分利用了文化嵌入、音频与文本等多模态条件,显著提升了生成手势的真实感、多样性、节拍对齐以及语义相关性。这些工作不仅验证了TED4C-L在文化手势研究中的核心价值,也为后续探索文化感知的多模态生成任务提供了重要的方法论与基准参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务