遇见数据集

3D TalKing Eyes Dataset (TKED)

收藏
arXiv2025-01-17 更新2025-02-25 收录
官方服务:

资源简介:

3D TalKing Eyes Dataset (TKED) 是由厦门大学、中国移动(杭州)信息技术有限公司和香港城市大学联合构建的音频-视线数据集,旨在解决语音驱动的3D眼动动画生成问题。该数据集包含约14小时的高质量音频-网格序列,涵盖了眼动、头部运动和面部运动。数据来源于VoxCeleb2和HDTF视频数据集,通过3D面部重建和3D眼动拟合技术生成。数据集的应用领域主要集中在语音驱动的3D面部动画生成,特别是眼动动画的多样性和自然性生成。

3D Talking Eyes Dataset (TKED) is an audio-gaze dataset jointly constructed by Xiamen University, China Mobile (Hangzhou) Information Technology Co., Ltd., and City University of Hong Kong, which aims to address the problem of speech-driven 3D eye movement animation generation. This dataset contains approximately 14 hours of high-quality audio-mesh sequences covering eye movements, head movements and facial movements. The data is sourced from the VoxCeleb2 and HDTF video datasets, and generated via 3D facial reconstruction and 3D eye movement fitting techniques. The application scenarios of this dataset mainly focus on speech-driven 3D facial animation generation, especially the generation of diverse and natural eye movement animations.

创建时间:
2025-01-17
搜集汇总
数据集介绍
3D TalKing Eyes Dataset (TKED) 数据集图片
构建方式
在语音驱动3D面部动画领域,尽管近年来取得了显著进展,但语音驱动下不可或缺的面部组成部分——眼神动画却未得到充分研究。主要原因是语音与眼神之间的弱相关性以及音频-眼神数据的稀缺性,使得仅从语音生成3D眼神运动极具挑战。为了解决这一难题,研究人员构建了3D TalKing Eyes Dataset (TKED),该数据集包含约14小时的音频-网格序列,同时具有高质量的眼神运动、头部运动和面部运动。通过对现有音频-视觉数据集中的视频进行轻量级的眼神拟合和面部重建,获取了这些运动数据。随后,研究人员定制了一个新颖的语音到运动的转换框架,在该框架中,头部运动和眼神运动从语音中联合生成,但在两个独立的潜在空间中进行建模。这种设计源于眼球旋转范围小于头部的生理学知识。通过将语音嵌入映射到两个潜在空间,从而减轻了建模语音与非语言运动之间弱相关性的难度。最后,TalkingEyes与一个语音驱动的3D面部运动生成器集成,可以从语音中综合眼神运动、眼睑运动、头部运动和面部运动。
特点
3D TalKing Eyes Dataset (TKED)具有以下特点:1)数据量丰富:包含约14小时的音频-网格序列,涉及高质量的眼神运动、头部运动和面部运动;2)数据多样性:数据集包含来自不同种族、口音、职业和年龄的669位参与者的5982个视频,提供了广泛的眼球旋转模式;3)数据质量高:通过3D面部重建和3D眼神拟合,获得了伪真实数据,为生成自然的眼神动画提供了基础。
使用方法
使用3D TalKing Eyes Dataset (TKED)进行眼神动画生成的方法如下:首先,通过音频编码器从输入语音中提取语音嵌入;其次,使用条件VAE模型根据语音嵌入重建头部运动;然后,使用基于VQVAE的自回归模型将语音嵌入映射到眼神运动的离散潜在空间,并生成眼神运动;最后,将头部运动、眼神运动和面部运动整合到统一的3D面部表示FLAME中,生成完整的3D面部动画。在训练过程中,需要对头部运动编码器、头部运动解码器、跨模态解码器、投影层和部分语音编码器进行训练,同时保持眼神运动解码器和代码本不变。在生成动画时,不需要使用真实的头部运动和头部运动编码器。
背景与挑战
背景概述
在计算机图形和视觉领域,基于语音的3D面部动画研究取得了显著进展,主要得益于生成模型和视听数据集的兴起。然而,一个不可或缺的面部组件——眼球注视的动画,却未得到足够关注。眼球注视与语音之间的弱相关性以及音频-注视数据的稀缺性,使得仅从语音生成3D眼球注视运动极具挑战。为此,本文提出了一种名为TalkingEyes的数据驱动方法,该方法能够生成与语音协调的多样化3D眼球注视运动。为了实现这一目标,研究人员首先构建了一个包含约14小时高质量音频-网格序列的音频-注视数据集,这些序列同时具有眼球注视运动、头部运动和面部运动。随后,研究人员定制了一个新颖的语音到运动转换框架,在该框架中,头部运动和眼球注视运动从语音中联合生成,但分别建模于两个分离的潜在空间中。最后,集成有语音驱动3D面部运动生成器的TalkingEyes能够从语音中综合生成眼球注视运动、眨眼、头部运动和面部运动。广泛定性和定量评估表明,该方法在从语音生成多样化、自然的3D眼球注视运动方面具有优越性。
当前挑战
该数据集及相关方法面临的主要挑战包括:1)语音与眼球注视之间的弱相关性;2)音频-注视数据的稀缺性。为了解决这些挑战,研究人员提出了一个轻量级的眼球注视拟合和面部重建方法,名为LightGazeFit,用于从现有视听数据集中的视频中获取运动数据。此外,研究人员还提出了一个新颖的语音到运动转换框架,该框架在两个分离的潜在空间中对头部运动和眼球注视运动进行建模,并通过映射语音嵌入来减少建模语音和非言语运动之间弱相关性的难度。
常用场景
经典使用场景
在计算机图形学和视觉领域,3D TalKing Eyes Dataset (TKED) 主要用于生成与语音同步的多样化 3D 眼球运动,从而提高语音驱动 3D 面部动画的自然度和真实感。通过将语音嵌入到两个不同的潜在空间中,该方法成功地解决了语音与非言语运动之间弱相关性的建模难题,使得生成的眼球运动更加丰富和自然。
解决学术问题
TKED 数据集解决了语音驱动 3D 眼球动画中存在的两个主要挑战:语音与眼球运动的弱相关性以及音频-眼球数据稀缺。传统的基于规则和基于学习的方法只能建立语音信号与眼球运动之间的一对一映射,导致生成的运动过于平滑和确定性。而 TKED 数据集和 TalkingEyes 方法通过引入轻量级眼球拟合和面部重建技术,以及利用 VAE 和 VQVAE 模型分别对头部运动和眼球运动进行建模,成功地解决了这些问题,从而实现了多样化、自然且与语音同步的眼球运动生成。
衍生相关工作
基于 TKED 数据集和 TalkingEyes 方法的成功,未来的研究可以进一步探索将情感标签融入眼球运动生成过程,以实现更具表现力的 3D 动画。此外,还可以研究如何提高眼球运动与口腔运动之间的协调性,以生成更加连贯和整体的动画效果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务