遇见数据集

MMA-82

收藏
github2026-06-20 更新2026-06-21 收录
数据链接:
官方服务:

资源简介:

MMA-82是一个用于微动作识别和多标签时序检测的多领域基准数据集,扩展了微动作分析从受控实验室设置到现实多领域场景。它包含82个细粒度全身微动作类别,涵盖实验室访谈、精神病患者访谈、街头访谈和情感丰富的电视视频四个领域,提供79,574个标注实例,支持域内、跨域、零样本和少样本评估协议。

MMA-82 is a multi-domain benchmark dataset designed for micro-motion recognition and multi-label temporal detection, which extends the scope of micro-motion analysis from controlled laboratory settings to real-world multi-domain scenarios. It encompasses 82 fine-grained full-body micro-motion categories, spanning four domains: laboratory interviews, psychiatric patient interviews, street interviews, and emotion-rich television videos. It contains 79,574 annotated instances, and supports multiple evaluation protocols including in-domain, cross-domain, zero-shot, and few-shot settings.

创建时间:
2026-06-12
原始信息汇总

MMA-82 数据集概述

基本信息

  • 全称: MMA-82 (Multi-Domain Micro-Action 82)
  • 提交状态: 已投稿至 IEEE TMM 2026
  • 任务: 微动作识别与多标签时序检测
  • 类别数: 82 个细粒度全身微动作类别
  • 领域数: 4 个源域

数据域组成

  1. 实验室访谈 (Laboratory Interviews)
  2. 精神科患者访谈 (Psychiatric Patient Interviews)
  3. 街头采访 (Street Interviews)
  4. 情感丰富的电视视频 (Emotion-rich Television Videos)

数据集规模

子集 视频/片段数 实例数 时长 受试者数
MMA-82-Rec (识别) 39,816 片段 39,816 28.94h 454
MMA-82-Det (检测) 11,180 视频 39,758 46.93h 434
总计 - 79,574 75.87h 454

MMA-82-Rec 按域分布

数据源 训练集 验证集 测试集 总片段数 总时长 平均长度
实验室访谈 15,820 5,636 6,053 27,509 20.48h 2.68s
精神科访谈 4,203 1,398 1,410 7,011 5.72h 2.94s
街头采访 2,358 792 775 3,925 2.10h 1.92s
情感视频 795 247 329 1,371 0.64h 1.67s
总计 23,176 8,073 8,567 39,816 28.94h 2.62s

MMA-82-Det

  • 包含 11,180 个未修剪视频
  • 39,758 个时序动作实例
  • 每个视频平均包含 3.56 个微动作实例
  • 每个实例平均持续 3.66s

标签体系

82 个动作级类别,组织为 7 个身体级组:

  • Body(身体)
  • Head(头部)
  • Upper Limb(上肢)
  • Lower Limb(下肢)
  • Body-Hand(身体-手)
  • Head-Hand(头部-手)
  • Leg-Hand(腿-手)

评估协议

微动作识别

  • 域内设置: 训练/验证/测试来自同一域
  • 跨域零样本设置: 在实验室访谈上训练,直接在目标域测试
  • 跨域小样本设置: 在实验室访谈上训练,使用少量目标域标注样本微调
  • 指标: Top-1 Acc, Top-5 Acc, MCA, Macro F1, Micro F1

多标签微动作检测

  • 输出: (start_time, end_time, action_category, confidence_score)
  • 挑战: 动作短、细微、密集、可能快速连续共现
  • 指标: 多时序IoU阈值下的检测 mAP

基线结果摘要

识别 — 域内 (动作级)

子数据集 方法 Top-1 Acc Top-5 Acc MCA Macro F1
MMA-82-Rec (全部) Skeleton 56.62 80.45 36.77 39.39
MMA-82-Rec (全部) RGB 60.43 86.14 38.98 39.56
实验室访谈 RGB 68.15 92.83 48.01 46.48
精神科访谈 RGB 46.74 72.13 14.10 13.64
街头采访 Skeleton 40.77 70.71 19.49 20.70
情感视频 RGB 25.53 52.89 12.20 11.05

识别 — 跨域 (Skeleton,零样本与小样本)

目标域 协议 Action Top-1 Action Top-5 Action MCA Body Top-1
精神科访谈 Zero-Shot 27.30 50.28 14.25 68.58
精神科访谈 10-Shot 30.13 58.59 22.71 72.64
街头采访 Zero-Shot 20.65 44.90 10.65 53.16
街头采访 10-Shot 22.52 45.92 17.76 65.64
情感视频 Zero-Shot 14.13 32.98 6.63 43.92
情感视频 10-Shot 17.70 42.53 15.43 42.03

检测 — AdaTAD on MMA-82-Det (VideoMAE-H)

指标 Action mAP@0.2 Action mAP@0.5 Action Avg Body Avg AVG
26.53 17.56 16.08 30.05 23.07

情感与微动作关联

  • 微动作单独优于面部微表情 (Top-1: 32.38 vs 22.86)
  • 微动作+微表情结合进一步提升 (Top-1: 32.86, F1: 32.36)
  • 悲伤与忧郁均与低头转头相关;忧郁更微妙内向

数据集获取

搜集汇总
数据集介绍
MMA-82 数据集图片
构建方式
MMA-82的构建基于对现有MA-52标签空间的系统性扩展,将细粒度全身微动作类别从52类增至82类,并跨越实验室访谈、精神病患者访谈、街头访谈以及富含情感色彩的电视视频四个领域。数据集的构建过程包括从多种来源收集原始视频素材,随后由专业标注人员进行精确的裁剪与多标签时间定位标注。最终形成了两个核心子集:MMA-82-Rec包含39,816个经过剪辑的短片,每个片段附带身体层级和动作层级的类别标签;MMA-82-Det则包含11,180个未剪辑视频,其中标注了39,758个时间动作实例,平均每个视频包含3.56个实例,每个实例时长约3.66秒,涵盖了密集或重叠的细微动作。
使用方法
使用MMA-82数据集时,研究者首先可通过Hugging Face平台下载数据集,命令为‘hf download lpynow/MAR_plus_plus --repo-type dataset --local-dir data/MMA-82’。针对微动作识别任务,可直接利用MMA-82-Rec中已裁剪的短片,使用RGB或骨架数据训练分类模型,评估指标包括Top-1/5准确率、平均类别准确率及F1分数。针对多标签微动作检测任务,则需在MMA-82-Det的未剪辑视频上运行时间动作检测算法,预测每个微动作实例的起止时间、类别与置信度,并以不同时间IoU阈值下的mAP作为评估标准。论文同时提供了基于PoseC3D、GC-TSM、AdaTAD等的基线结果,便于新方法进行性能对比。
背景与挑战
背景概述
微动作作为人类非语言行为的关键载体,在心理学、人机交互及情感计算领域具有重要研究价值。然而,现有微动作数据集多局限于受控实验室环境,导致模型在真实场景中的泛化能力严重不足。为突破这一瓶颈,合肥工业大学与中国科学技术大学的闫滨浩、刘鹏宇等研究者于2026年构建了MMA-82数据集。该数据集将微动作类别从MA-52的52类扩展至82类细粒度全身动作,涵盖实验室访谈、精神病患者访谈、街头访谈及情感电视视频四大领域,共包含79,574个标注实例。通过支持域内、跨域、零样本及少样本评估协议,MMA-82为微动作识别与多标签时序检测提供了标准化基准,其发布对推动真实场景下微动作理解研究具有里程碑意义。
当前挑战
MMA-82所面临的挑战具有双重性。在领域问题层面,微动作识别需应对动作的细微性、多域间的风格差异及类别长尾分布,尤其在跨域零样本场景下,模型在心理咨询访谈等目标域的动作分类准确率骤降至27.30%,而情感视频域仅达14.13%,凸显出领域漂移与语义鸿沟的严峻挑战。在数据集构建层面,多标签时序检测任务要求精确定位时长仅3.66秒的密集或重叠微动作实例,但基于VideoMAE的基线模型在不同时序IoU阈值下的检测平均精度仅徘徊于7.55%-26.53%之间,远未达到实用水平。此外,454名受试者的数据采集涉及伦理审批、动作边界一致性标注等高成本流程,如何保证跨域数据均衡性与标注质量亦是核心难题。
常用场景
经典使用场景
在人体行为理解领域,微动作作为揭示人类隐性意图与情感状态的关键线索,长期受限于实验室环境的单一化数据采集。MMA-82数据集的提出,首次将微动作分析从受控场景拓展至包含实验室访谈、精神科患者访谈、街头采访及情感电视视频在内的多域真实场景,并构建了涵盖82类细粒度全身微动作的全新标签体系。该数据集的核心使用场景聚焦于两大基准任务:一是对裁剪片段进行微动作识别,要求模型在身体级与动作级双层次上完成精细分类;二是在未裁剪视频中执行多标签时序检测,精准定位并识别密集或重叠的微小动作实例。通过引入域内、跨域、零样本及少样本等多种评估协议,MMA-82为微动作理解领域提供了极具挑战性的标准化评测平台。
解决学术问题
传统微动作研究长期受困于标注范畴狭窄(仅52类)、数据来源单一(实验室访谈)以及任务形式简单(仅识别)等瓶颈,严重制约了模型对真实世界中复杂微动作模式的泛化能力。MMA-82数据集通过扩展至82类动作标签并覆盖四个差异化应用域,有效解决了跨域场景下微动作识别准确率骤降的核心学术难题。尤为重要的是,该数据集首次系统性引入多标签时序检测任务,攻克了密集、快速叠加的微小动作在时序上的精确定位与分类挑战。基于该数据集的基线实验揭示,当前最优骨骼点与RGB模型在域内识别准确率仅达60.43%,而跨域零样本场景下动作级Top-1准确率骤降至14.13%至27.30%之间,清晰揭示了现有算法在鲁棒性与泛化能力上的显著不足,为后续研究指明了核心突破方向。
实际应用
在心理健康辅助诊断领域,MMA-82数据集为精神科患者非语言行为(如持续低头、频繁转头)的量化分析提供了标准化数据支撑,有助于构建基于微动作的抑郁与悲伤情绪早期筛查系统。在人机交互与情感计算场景中,该数据集支持开发者训练能够感知用户微妙肢体语言的智能系统,例如通过识别情感视频中的细微动作模式,增强虚拟助手或社交机器人对人类情感状态的响应精度。面向公共安全与司法审讯领域,街头与实验室访谈场景中的微动作检测能力可辅助识别可疑对象的紧张或回避行为,为审讯辅助决策提供客观的行为学依据。此外,在影视内容分析中,多域微动作检测技术可用于自动解析电视剧中角色情绪的肢体表达,助力视频摘要与情感分析服务。
数据集最近研究
最新研究方向
MMA-82作为首个涵盖实验室访谈、精神科患者访谈、街头采访及情感电视视频四个真实场景的多领域微动作基准,突破了传统受控环境下的分析局限。最新研究聚焦于微动作识别与多标签时序检测两大核心任务,在细粒度全身动作分类基础上,进一步探索跨领域零样本与少样本泛化能力。实验表明,结合RGB与骨骼数据的基线模型在域内识别中Top-1准确率达60.43%,而跨域迁移场景下识别性能显著下降(如情感视频域仅7%-25%),揭示了微动作在不同社会情境中的分布偏移与域适应挑战。同时,微动作在情感分析中展现出超越面部微表情的互补信号(动作仅用TSM达32.38% Top-1),为抑郁症等精神健康状态的自动化评估提供了新的非侵入式生物标记,推动了微动作理解从实验室走向真实临床与社交场景的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务