MME-Avatar
收藏资源简介:
MME-Avatar是一个用于情感数字人受控多模态评估的基准数据集。它包含8,400个绿幕坐姿半身表演,来自30名演员,涵盖7种情感、4个动作模板和10个脚本,提供同步的音频、视频、文本、元数据、软Alpha遮罩和RGBA前景,支持对身份、情感、语言、运动、前景质量和音视频同步进行耦合分析。
MME-Avatar is a benchmark dataset for controlled multimodal evaluation of emotional digital humans. It contains 8,400 green-screen seated half-body performances from 30 actors, covering 7 emotions, 4 action templates and 10 scripts. It provides synchronized audio, video, text, metadata, soft alpha masks and RGBA foregrounds, supporting coupled analysis of identity, emotion, language, motion, foreground quality and audio-visual synchronization.
数据集概述
MME-Avatar 是一个用于情感数字人的受控多模态评估基准,旨在将虚拟人系统视为耦合的多模态系统,对身份、情感、语言、动作、前景质量和音视频同步进行联合分析。
数据集规模与构成
| 项目 | 数值 |
|---|---|
| 演员数量 | 30 |
| 情感类别 | 7 |
| 动作模板 | 4 |
| 每情感-动作条件下的脚本数量 | 10 |
| 总片段数 | 8,400 |
| 采集设置 | 带桌子和绿幕的坐姿半身表演 |
| 发布模态 | 音频、视频、文本、元数据、alpha 遮罩、RGBA 前景 |
总片段计算公式
30 演员 x 7 情感 x 4 动作模板 x 10 脚本 = 8,400 片段
数据设计
- 情感状态:快乐、惊讶、愤怒、悲伤、恐惧、厌恶、中性
- 动作模板:每个情感定义4个粗粒度的动作模板
- 脚本:每个动作模板包含10个脚本化的语句
- 表演流程:每个语句从双手放在桌上的标准初始状态开始,演员在表演对应情感动作的同时说出脚本,最后回到初始状态
- 质量控制:所有演员使用相同的脚本集,通过自动语音识别和人工检查纠正阅读错误
发布数据组件
| 组件 | 描述 |
|---|---|
| 音频 | 每个语句的语音波形 |
| 处理后的视频 | 同步的处理后视频片段 |
| 文本 | 纠正后的转录文本和脚本元数据 |
| 元数据 | 演员ID、情感、动作模板、脚本ID、时长、帧率、路径 |
| 软 alpha 遮罩 | 每帧前景 alpha 标签 |
| RGBA 前景 | 带 alpha 通道的前景人体视频 |
| 拆分文件 | 推荐的训练/验证/测试划分 |
| 基准测试结果 | 四个测试轨道的评估结果 |
| 评估代码 | 用于指标计算和基准测试复现的脚本 |
基准测试轨道
轨道1:语音克隆
评估语音合成质量与身份保留,使用的指标包括:
- UTMOS(越高越好):自动语音质量估计
- DNSMOS(越高越好):非侵入式语音质量估计
轨道2:前景抠像
评估绿幕前景提取质量,包括3个分割模型和6个抠像模型,使用的指标包括:
- MAD(越低越好):平均绝对差异
- MSE(越低越好):均方误差
- dtSSD_mean(越低越好):时间稳定性误差
- Grad_mean(越低越好):梯度误差
- Conn_mean(越低越好):连通性误差
轨道3:多模态情感识别
评估使用单模态和多模态输入的情感分类,模态包括:图像帧、音频、视频、文本、视频+音频、视频+文本、视频+音频+文本,使用准确率指标。
轨道4:可控虚拟人合成
评估在不同控制信号下的数字人合成质量,设置包括:头部图像+语音驱动、头部图像+提取的视频姿态驱动、头部图像+文本驱动、半身图像+视频姿态驱动,使用的指标包括:
- PSNR(越高越好):像素级重建质量
- SSIM(越高越好):结构相似性
- LPIPS(越低越好):感知距离
- FID(越低越好):图像分布距离
- FVD(越低越好):视频分布距离
- SyncNet-Sync-C(越高越好):音视频同步置信度
- SyncNet-Sync-D(越低越好):音视频同步距离
评估协议要求
报告结果时应包含:
- 训练/验证/测试划分
- 演员是否在训练和测试之间重叠
- 输入模态或驱动条件
- 音频、视频、文本、alpha 遮罩和 RGBA 前景的预处理细节
- 模型名称、检查点来源和训练数据
- 指标实现和评估设置
- 使用纠正后的转录文本还是原始 ASR 转录文本
预期用途
- 情感数字人研究
- 可控虚拟人合成
- 语音驱动和文本驱动的人体动画
- 多模态情感识别
- 绿幕分割和视频抠像
- 受控评估与故障归因
伦理要求
- 仅用于许可的研究目的
- 不得试图识别、联系或模仿演员
- 不得生成误导性、有害、诽谤或未经授权的合成媒体
- 在必要时明确披露生成内容
- 不得在许可条款外重新分发数据集
项目地址
- GitHub:https://github.com/GML-MMGroup/MME-Avatar




