遇见数据集

awesome-human-activity-recognition

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

这是一个关于人类活动识别(HAR)的数据集合集资源,覆盖了视觉(RGB/深度)、骨架/运动捕捉、可穿戴传感器、多模态和第一人称视角等多种模态的数据集。该合集整合了53个数据集,包括Kinetics-700、UCF-101、HMDB-51、NTU RGB+D 120等,并提供了数据集选择指南、分类列表以及相关框架、模型、论文和工具,旨在为HAR研究提供全面的数据集索引和推荐。

This is a dataset collection resource for Human Activity Recognition (HAR), covering multiple modalities including visual (RGB/Depth), skeleton/motion capture, wearable sensors, multimodal, and first-person perspective datasets. This collection integrates 53 datasets such as Kinetics-700, UCF-101, HMDB-51, NTU RGB+D 120, and others. It provides dataset selection guidelines, classification lists, as well as relevant frameworks, models, papers and tools, aiming to offer a comprehensive dataset index and recommendation for HAR research.

创建时间:
2025-10-22
原始信息汇总

数据集详情总结:Awesome Human Activity Recognition

这是一个面向人类活动识别(HAR) 领域的综合性资源列表,收录了该领域常用的数据集、框架、预训练模型、教程、关键论文、竞赛与挑战赛以及工具。

数据集分类概览

该资源按照数据模态和任务类型,将数据集分为以下六大类:

  • 视觉(RGB/深度):主要面向基于视频的动作分类与检测任务。知名数据集包括用于预训练的 Kinetics-700、经典基准 UCF-101HMDB-51、时序动作检测的 ActivityNet、时空动作检测的 AVA、多视角3D动作识别的 NTU RGB+D 120 等。
  • 骨架与动作捕捉(Skeleton & Mocap):专注于基于人体骨架或动捕数据的动作识别。核心数据集包括骨架动作识别的标准基准 NTU RGB+D 60NTU RGB+D 120、大规模统一动捕数据集 AMASS、文本-动作对齐数据集 BabelHumanML3D
  • 可穿戴传感器(Wearable Sensors):面向IMU(惯性测量单元)等可穿戴设备数据。经典基准包括 UCI-HAR、多传感器数据集 PAMAP2,以及最新大规模真实场景数据集 CAPTURE-24(151名受试者,3883小时记录)。
  • 多模态与第一人称(Multimodal & Egocentric):融合多种传感器或提供第一人称视角的数据。主要包含大规模第一人称数据集 Ego4D(3300小时)、厨房动作数据集 EPIC-Kitchens-100,以及跨视角动作理解数据集 Ego-Exo4D
  • 新兴与前沿(Emerging & Frontier):收录近年提出的新型数据集,涵盖文本到动作生成(如 HumanML3DMotion-X++)、人-物交互(BEHAVE)、Wi-Fi感知(WiMANS)等前沿方向。

数据集选择建议

资源列表针对不同任务场景给出了明确的数据集选择指引:

  • 视频动作分类:使用Kinetics-700进行预训练,在UCF-101或HMDB-51上评估。
  • 未修剪视频时序检测:首选ActivityNet(提议),AVA(时空检测)。
  • 骨架/动捕数据:NTU RGB+D 120是标准基准;文本-动作对齐使用Babel或HumanML3D。
  • IMU/可穿戴数据:UCI-HAR可作为基线,PAMAP2用于多传感器研究,CAPTURE-24适用于大规模真实场景。
  • 第一人称/多模态数据:优先考虑Ego4D(规模大)、EPIC-Kitchens-100(厨房场景)、Ego-Exo4D(跨视角,CVPR 2024)。
  • 文本到动作生成:首选HumanML3D(单人)、InterHuman(双人)、Motion-X++(全身,含面部与手部)。

配套资源

  • 框架与库:涵盖视觉领域(MMAction2、PySlowFast)、骨架领域(ST-GCN、CTR-GCN)、可穿戴传感器领域(tsai、aeon、DeepConvLSTM)以及运动生成领域(MDM、MotionGPT)等多种工具。
  • 预训练模型:提供VideoMAE V2、InternVideo2、MotionBERT等模型权重下载。
  • 教程与课程:包含交互式教材(Dive into Deep Learning)、框架教程(MMAction2)、传感器HAR教程(dl-for-har)及运动扩散模型Colab教程。
  • 关键论文:系统整理了从奠基性工作(Two-Stream、C3D、I3D、ST-GCN、SlowFast)到Transformer时代(ViViT、TimeSformer、VideoMAE)及最新方法的论文列表。
  • 竞赛:介绍Ego-Exo4D Challenge、ActivityNet Challenge、EPIC-Kitchens Challenge等年度竞赛。

所有链接均已转换为绝对地址。

搜集汇总
数据集介绍
awesome-human-activity-recognition 数据集图片
构建方式
该数据集以GitHub仓库形式呈现,系统性地整合了人类活动识别(HAR)领域的海量资源。构建者基于对HAR研究范式的深刻洞察,精心遴选了涵盖视觉、骨骼动作、可穿戴传感器、多模态与自我中心视角及前沿探索等五大类别的数十个代表性数据集,并辅以框架库、预训练模型、教程、关键论文与竞赛等配套资源。每项资源均附有直接链接与简洁描述,便于研究者按图索骥。
特点
该数据集具备高度的结构性与导航性,其核心特色在于“问题导向”的组织逻辑。通过“我应该使用哪个数据集”的决策树,引导用户根据自身模态与任务需求,快速定位至最相关的资源板块。此外,其覆盖面极为广泛,从经典基准如UCF-101、Kinetics-700,到前沿创新如Ego-Exo4D、Motion-X++,均被纳入其中,且持续追踪顶会最新成果,呈现了HAR领域从传统方法到Transformer时代、再到生成式模型的完整演进脉络。
使用方法
使用者可首先根据研究目标(如动作分类、时序检测、文本到动作生成)及输入数据形式(视频、骨骼、IMU等),参照“Which Dataset Should I Use”部分的推荐,定位至对应章节。随后,在相应章节中浏览数据集列表,点击名称链接获取原始数据与详细说明。对于模型开发,可直接跳转至“Frameworks and Libraries”部分,选用MMAction2、PySlowFast等成熟工具箱或预训练模型(如VideoMAE V2)进行快速实验与迁移学习。
背景与挑战
背景概述
人体活动识别(Human Activity Recognition, HAR)作为计算机视觉与感知智能领域的核心研究方向,旨在从多模态传感器数据中自动解析人类行为语义。该领域的研究可追溯至21世纪初,随着深度学习技术的突破,尤其是2014年Simonyan等人提出的双流卷积网络与2017年Carreira等人提出的I3D架构,HAR实现了从手工特征到端到端学习的范式跃迁。由Leooo-Huang团队创建的awesome-human-activity-recognition资源库,系统整合了涵盖视觉、骨架、可穿戴传感器及多模态自我中心视角的百余个数据集与前沿框架,如Kinetics-700、NTU RGB+D 120、Ego4D等,为研究者提供了标准化基准与工具链。该资源库的发布显著降低了HAR研究的入门门槛,推动了从细粒度动作分类到文本-运动生成等新兴任务的快速发展,已成为领域内重要的知识枢纽。
当前挑战
尽管HAR领域取得了长足进步,当前仍面临多重挑战。在领域问题层面,跨模态数据融合的异构性导致模型泛化能力不足,例如可穿戴IMU数据与视频数据在时间尺度与特征空间上的对齐难题;真实场景中的类间相似性与类内多样性(如细粒度体操动作Diving48)对时序推理能力提出了严苛要求;现有数据集多受限于受控环境,缺乏对长尾分布、多主体交互及遮挡场景的充分覆盖。在构建过程中,大规模标注成本居高不下,如Ego4D的3.3k小时视频需依赖众包进行精细动作边界标注;多传感器同步采集中的时间戳漂移与硬件噪声难以完全消除;不同数据集间的协议差异(如动作类别定义、采样率、传感器放置位置)阻碍了跨数据集迁移学习的有效性。
常用场景
经典使用场景
在人体活动识别(HAR)这一融合计算机视觉、传感器技术与人工智能的交叉领域中,该数据集资源汇聚了从经典基准到前沿探索的丰富数据资产。其最经典的使用场景在于为研究者提供了一套系统化的数据集导航体系,涵盖视觉RGB/深度视频、骨骼与动作捕捉数据、可穿戴传感器信号以及多模态第一人称视角等多元模态。研究者可根据自身任务需求——如动作分类、时序检测、空间-时间定位或文本到动作生成——快速定位最适用的数据集,例如利用Kinetics-700进行预训练,再在UCF-101或HMDB-51上评估性能,这种分层式数据使用范式已成为动作识别研究的黄金标准。
解决学术问题
该数据集集合系统性地应对了人体活动识别领域长期存在的若干核心学术挑战。首先,它解决了跨模态数据稀缺与标准不统一的问题,通过整理NTU RGB+D 120、AMASS、UCI-HAR等权威数据集,为骨骼动作识别、可穿戴传感器分析等子领域奠定了可重复验证的基准。其次,它推动了细粒度动作理解与复杂时序建模的研究,如FineGym和Diving48等数据集促使算法突破对微小动作差异的辨别能力。此外,多模态数据集的整合(如Ego4D与EPIC-Kitchens-100)催生了跨视角、跨传感器的融合方法,显著提升了模型在真实世界场景下的泛化能力。这些贡献共同加速了从实验室环境到开放世界的HAR研究范式转型。
衍生相关工作
该数据集资源库孕育了一系列具有深远影响的经典研究工作。在视觉动作识别领域,基于Kinetics-700预训练的VideoMAE和InternVideo2等模型推动了自监督学习与大规模视频理解的边界。在骨骼动作识别方面,ST-GCN及其变体CTR-GCN、HD-GCN等图卷积网络以NTU RGB+D数据集为基准,建立了空间-时序建模的经典范式。可穿戴传感器领域,DeepConvLSTM和NNCLR-HAR等工作利用UCI-HAR和PAMAP2等数据集,奠定了深度学习与对比学习在时序信号分析中的基础。在动作生成前沿,HumanML3D数据集催生了MDM、MotionGPT等文本到动作扩散模型,而BEHAVE和HOI4D则推动了人-物交互的3D理解。这些衍生工作不仅深化了HAR的理论体系,也为跨学科研究提供了坚实的数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务