数字人表情和动作多模态生成数据
收藏国家基础学科公共科学数据中心2026-07-10 收录
官方服务:
资源简介:
从文字或语音输入中生成到精细化面部动画控制参数。系统采用中文CLIP模型进行文本语义编码,接收预提取的384维语音嵌入特征,通过Transformer解码器的交叉注意力机制实现文本-语音-面部动作的有效对齐,最终输出完整的面部控制参数序列。
提供机构:
网易(杭州)网络有限公司
从文字或语音输入中生成到精细化面部动画控制参数。系统采用中文CLIP模型进行文本语义编码,接收预提取的384维语音嵌入特征,通过Transformer解码器的交叉注意力机制实现文本-语音-面部动作的有效对齐,最终输出完整的面部控制参数序列。