遇见数据集

MME-Avatar

收藏
github2026-07-08 更新2026-07-16 收录
官方服务:

资源简介:

MME-Avatar是一个用于情感数字人受控多模态评估的基准数据集。它包含8,400个绿幕坐姿半身表演,来自30名演员,涵盖7种情感、4个动作模板和10个脚本,提供同步的音频、视频、文本、元数据、软Alpha遮罩和RGBA前景,支持对身份、情感、语言、运动、前景质量和音视频同步进行耦合分析。

MME-Avatar is a benchmark dataset for controlled multimodal evaluation of emotional digital humans. It contains 8,400 green-screen seated half-body performances from 30 actors, covering 7 emotions, 4 action templates and 10 scripts. It provides synchronized audio, video, text, metadata, soft alpha masks and RGBA foregrounds, supporting coupled analysis of identity, emotion, language, motion, foreground quality and audio-visual synchronization.

创建时间:
2026-07-01
原始信息汇总

数据集概述

MME-Avatar 是一个用于情感数字人的受控多模态评估基准,旨在将虚拟人系统视为耦合的多模态系统,对身份、情感、语言、动作、前景质量和音视频同步进行联合分析。

数据集规模与构成

项目 数值
演员数量 30
情感类别 7
动作模板 4
每情感-动作条件下的脚本数量 10
总片段数 8,400
采集设置 带桌子和绿幕的坐姿半身表演
发布模态 音频、视频、文本、元数据、alpha 遮罩、RGBA 前景

总片段计算公式

30 演员 x 7 情感 x 4 动作模板 x 10 脚本 = 8,400 片段

数据设计

  • 情感状态:快乐、惊讶、愤怒、悲伤、恐惧、厌恶、中性
  • 动作模板:每个情感定义4个粗粒度的动作模板
  • 脚本:每个动作模板包含10个脚本化的语句
  • 表演流程:每个语句从双手放在桌上的标准初始状态开始,演员在表演对应情感动作的同时说出脚本,最后回到初始状态
  • 质量控制:所有演员使用相同的脚本集,通过自动语音识别和人工检查纠正阅读错误

发布数据组件

组件 描述
音频 每个语句的语音波形
处理后的视频 同步的处理后视频片段
文本 纠正后的转录文本和脚本元数据
元数据 演员ID、情感、动作模板、脚本ID、时长、帧率、路径
软 alpha 遮罩 每帧前景 alpha 标签
RGBA 前景 带 alpha 通道的前景人体视频
拆分文件 推荐的训练/验证/测试划分
基准测试结果 四个测试轨道的评估结果
评估代码 用于指标计算和基准测试复现的脚本

基准测试轨道

轨道1:语音克隆

评估语音合成质量与身份保留,使用的指标包括:

  • UTMOS(越高越好):自动语音质量估计
  • DNSMOS(越高越好):非侵入式语音质量估计

轨道2:前景抠像

评估绿幕前景提取质量,包括3个分割模型和6个抠像模型,使用的指标包括:

  • MAD(越低越好):平均绝对差异
  • MSE(越低越好):均方误差
  • dtSSD_mean(越低越好):时间稳定性误差
  • Grad_mean(越低越好):梯度误差
  • Conn_mean(越低越好):连通性误差

轨道3:多模态情感识别

评估使用单模态和多模态输入的情感分类,模态包括:图像帧、音频、视频、文本、视频+音频、视频+文本、视频+音频+文本,使用准确率指标。

轨道4:可控虚拟人合成

评估在不同控制信号下的数字人合成质量,设置包括:头部图像+语音驱动、头部图像+提取的视频姿态驱动、头部图像+文本驱动、半身图像+视频姿态驱动,使用的指标包括:

  • PSNR(越高越好):像素级重建质量
  • SSIM(越高越好):结构相似性
  • LPIPS(越低越好):感知距离
  • FID(越低越好):图像分布距离
  • FVD(越低越好):视频分布距离
  • SyncNet-Sync-C(越高越好):音视频同步置信度
  • SyncNet-Sync-D(越低越好):音视频同步距离

评估协议要求

报告结果时应包含:

  • 训练/验证/测试划分
  • 演员是否在训练和测试之间重叠
  • 输入模态或驱动条件
  • 音频、视频、文本、alpha 遮罩和 RGBA 前景的预处理细节
  • 模型名称、检查点来源和训练数据
  • 指标实现和评估设置
  • 使用纠正后的转录文本还是原始 ASR 转录文本

预期用途

  • 情感数字人研究
  • 可控虚拟人合成
  • 语音驱动和文本驱动的人体动画
  • 多模态情感识别
  • 绿幕分割和视频抠像
  • 受控评估与故障归因

伦理要求

  • 仅用于许可的研究目的
  • 不得试图识别、联系或模仿演员
  • 不得生成误导性、有害、诽谤或未经授权的合成媒体
  • 在必要时明确披露生成内容
  • 不得在许可条款外重新分发数据集

项目地址

  • GitHub:https://github.com/GML-MMGroup/MME-Avatar
搜集汇总
数据集介绍
MME-Avatar 数据集图片
构建方式
MME-Avatar数据集的构建系统而严谨,旨在为情感数字人提供可控的多模态评估基准。该数据集收录了30位演员在绿幕前坐姿半身表演的8400个片段,每位演员需在7种情感状态下,依照4种动作模板和10种脚本进行演绎。每个样本均包含同步的音频、视频、文本、元数据、软阿尔法遮罩及RGBA前景视频,形成了一套完整的、可组合的评估单元。所有表演均从双手置于桌面的标准初始姿态开始,演员在完成带有情感的动作和脚本后回归初始姿态,确保了实验的可重复性和可控性。
特点
MME-Avatar数据集的独特之处在于其多维度可控性与失效归因能力。它打破了传统将虚拟形象系统作为孤立说话头生成器的评估模式,将身份、情感、语言、动作、前景质量和音画同步视为耦合的多模态系统进行联合分析。通过精心设计的情感、动作、脚本和身份的交叉组合,研究者能够独立调控或固定某一变量,精准定位生成失败的根本原因,如身份漂移、情感弱化、脚本偏差或动作不协调,为数字人系统的诊断与优化提供了强有力的工具。
使用方法
MME-Avatar数据集的使用方式灵活且富有多样性,旨在支持多方面的研究探索。研究者可将其用于语音克隆、前景抠图、多模态情感识别及可控虚拟形象合成四个基准测试轨道。使用时需遵循建议的目录结构加载音频、视频、元数据等文件。为保障研究公平性,建议采用演员独立的评估策略,并在报告结果时详细说明数据划分、输入模态、预处理细节及模型配置,以实现精准的失效归因与性能对比,推动情感数字人领域的标准化评估。
背景与挑战
背景概述
随着情感化数字人逐渐成为人机交互的核心界面,其评估手段却长期陷于碎片化困境。现有基准将语音克隆、表情识别、前景抠图、动作生成等模块孤立评测,致使系统级故障归因困难——身份漂移、情感衰减、文本偏见、运动塌缩或音画不同步等问题常因孤立指标而被掩盖。MME-Avatar由GML-MMGroup于2026年提出,构建了一个包含30位演员、7种情感、4类动作模板、10组脚本的精细多模态基准,总计8400条绿幕半身表演片段,同步提供音频、视频、文本、软阿尔法遮罩及RGBA前景数据。该基准设立了语音克隆、前景抠图、多模态情感识别、可控数字人合成四个评测轨道,旨在从身份保持、情感传递、语言一致性、动作质量与音画同步等维度实现耦合系统级的可控归因分析,为数字人领域提供系统性的测评范式。
当前挑战
情感化数字人评估面临多重挑战:其一,现有基准对系统级故障归因能力薄弱,模型在图像保真度、帧间同步、身份保持或内容覆盖等维度可能各有优劣,单一排行榜分数极易掩盖关键失效模式;其二,多媒体情感识别中文本路径凭借词汇捷径近乎达到多模态情感识别精度,暴露出脚本偏见问题,使得视觉-听觉-语言三模态融合的真实增益难以准确衡量。在数据集构建层面,跨越7类情感、4种动作模板与30位演员的协议设计需同时兼顾标准化与自然变异性,演员需从双手放桌的初始状态出发,完成情感动作与脚本表达后再回归原位,该过程对采集精度与质量控制提出了严苛要求;此外,需借助自动语音识别加人工校验确保8,400条样本的语音转录准确性,并配合同步视频、逐帧阿尔法遮罩及RGBA前景的多模态数据产出,进一步增加了数据装配与格式统一的技术难度。
常用场景
经典使用场景
在情感化数字人研究领域,MME-Avatar数据集为可控多模态评估提供了标准化的实验平台。其最经典的使用场景是作为情感化数字人系统的整体性能评价基准,研究者可依托该数据集中精心设计的30位演员、7种情感状态、4个动作模板与10组脚本的交叉组合,系统性地分析身份保持、情感表达、语音质量、前景分割以及音视频同步等核心模块的协同表现。该数据集提供的对齐音频、视频、文本、软alpha遮罩与RGBA前景等丰富模态,使得研究者能够在控制单一变量的条件下,精准归因数字人生成失败的具体环节,从而推动情感化数字人从孤立的模块评估走向耦合系统的综合分析。
实际应用
在实际应用中,MME-Avatar数据集为情感化数字人的产业化落地提供了关键技术支撑。基于其精细标注的多模态数据,开发者可以高效训练和评估语音克隆、情感感知、视频抠像以及可控数字人合成等核心模块。例如,在虚拟客服与情感陪伴场景中,数据集帮助优化数字人对愤怒、悲伤等情感的准确表达与识别;在影视制作与虚拟直播领域,其高质量的前景遮罩与RGBA数据支持真实感合成与动态背景替换。此外,数据集有意识暴露的文本捷径现象,提示实际部署中需谨慎处理脚本偏差,确保数字人的情感表达不因语词模板而失真,从而增强人机交互的自然性与可信度。
衍生相关工作
围绕MME-Avatar数据集已衍生出多项经典研究工作,推动了情感化数字人关键技术的协同发展。其一,语音克隆跟踪中,研究者利用该数据集的标准音视频对,系统对比了不同网络架构在身份保持与情感传递上的权衡,揭示了语音质量预测器偏好合成音而忽略身份漂移的固有问题。其二,前景抠像跟踪中,基于软alpha遮罩与RGBA数据的基准评测,催生了多种时效性更优的语义分割与抠图模型。其三,多模态情感识别跟踪借助其统一的模态控制条件,量化了文本模态在高准确率下对音视频特征的替代效应,从而启发了消除词义捷径的鲁棒识别方法。这些工作共同构建了情感化数字人从评估到优化的完整研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务