CUHK-X
收藏数据链接:
官方服务:
资源简介:
包含64,267个样本、七种模态的大规模多模态数据集,用于人类活动识别、理解和推理。
A large-scale multimodal dataset containing 64,267 samples and seven modalities, intended for human activity recognition, understanding and reasoning.
创建时间:
2026-09-07
原始信息汇总
数据集概述
CUHK-X 是一个大规模多模态人体活动场景理解与推理数据集,由香港中文大学开放物联网实验室(OpenIoT Lab)构建。该数据集包含 64,267 个标注样本,覆盖 7 种同步模态,专为人体活动识别(HAR)、人体活动理解(HAU)与人体活动推理(HARn)设计,旨在弥补现有 HAR 数据集在复杂推理任务上的不足。
一、核心特性
| 特性 | 说明 |
|---|---|
| 规模 | 64,267 个动作样本,来自 30 名参与者 |
| 模态 | RGB 视频、红外(IR)、深度(Depth)、热成像(Thermal)、IMU、毫米波雷达、骨骼(Skeleton)共 7 种时间对齐模态 |
| 环境 | 2 种室内环境,涵盖不同光照与条件差异 |
| 动作类别 | 40+ 个动作类别 |
| 数据类型 | 包含单一动作与连续动作序列两种类型 |
| 多样性 | 覆盖长尾分布、跨域迁移等真实场景挑战 |
| 数据集结构 | 分为小模型数据(3 万+个单一动作样本)与大模型数据(连续动作序列)两部分 |
| 创新标注 | 采用 LLM 生成的场景描述并结合人工循环验证,确保逻辑一致性与时空表征准确性 |
二、七种同步模态详情
- RGB 视频:标准彩色视频,用于常规视觉分析
- 红外(IR):对光照变化鲁棒,适合低光环境
- 深度(Depth):提供 3D 空间信息,支持几何理解
- 热成像(Thermal):捕捉热信号特征
- IMU:惯性测量单元,记录运动与姿态数据
- 毫米波雷达:保护隐私的运动检测方式
- 骨骼(Skeleton):3D 姿态估计数据
以上模态全部通过同步录制实现时间对齐(硬件包括 Vzense NYX 650 RGB-D 相机、TI 毫米波雷达、IMU 传感器与热成像相机)。
三、基准与任务
该数据集定义了 3 个主要基准,涵盖 6 个不同子任务:
| 基准 | 任务/子任务 | 目标 |
|---|---|---|
| 人体活动识别(HAR) | 传统动作分类 | 评估跨试验(80/20 划分)、跨受试者(LOSO 协议)、跨域、长尾分布与多模态融合等场景下的分类性能 |
| 人体活动理解(HAU) | 动作描述生成;情绪分析;序列动作重排序;动作选择 | 通过感知与上下文整合,生成自然语言描述、识别情绪状态、纠正动作时间顺序、从候选中选取相关动作 |
| 人体活动推理(HARn) | 下一动作预测;时序推理;上下文推断 | 推断连续动作中的意图与因果关系,预测后续可能动作 |
四、关键基准结果(摘录)
4.1 HAR 跨试验任务
| 模态 | 准确率 | F1 分数 | 精确率 | 召回率 |
|---|---|---|---|---|
| RGB | 90.89% | 91.28% | 92.24% | 91.02% |
| 深度 | 90.46% | 90.93% | 91.76% | 90.75% |
| 红外 | 90.22% | 90.46% | 91.53% | 89.94% |
| 热成像 | 92.57% | 93.36% | 93.54% | 93.50% |
| 雷达 | 46.63% | 44.53% | 48.29% | 46.63% |
| IMU | 45.52% | 38.32% | 40.84% | 38.00% |
| 骨骼 | 79.08% | 84.17% | 91.46% | 79.08% |
4.2 HAU 部分任务表现(大模型)
| 模型 | 描述生成(BLEU-1) | 情绪分析(准确率) | 序列重排序(准确率) |
|---|---|---|---|
| QwenVL-7B | 18.04% | 55.03% | 60.00% |
| VLLaVA-7B | 12.86% | 73.34% | 5.29% |
| InternVL-8B | 0.72% | 31.35% | 74.03% |
4.3 关键模型发现
- 更大规模模型(7B 参数)整体优于小模型
- QwenVL-7B 与 VLLaVA-7B 在多数基准上表现优异
- 深度与红外模态在推理任务中的信息丰富度常优于 RGB
- 跨受试者性能显著下降(约 56.56% 准确率),体现域迁移挑战
五、代码与资源
该 GitHub 仓库提供:
| 路径 | 内容 |
|---|---|
SM/ |
小模型 HAR 基线(RGB、IMU、毫米波雷达、骨骼),含 PyTorch 训练与评估流程 |
LM/ |
大模型基准代码(CUHK-X-VLM),支持 QwenVL、InternVL、Video-LLaVA、Video-Chat 在 HAU 与 HARn 任务上的评估 |
docs/ |
项目网站与浏览器内数据浏览器(Observatory),支持深度/红外/热成像片段同步播放 |
scripts/ |
用于构建网站与 README 的资源脚本 |
数据集文件另行分发,需通过数据使用协议(DUA)在数据门户申请访问。
六、重要时间节点
- 2025 年 11 月:获得 ANAI Workshop @ MobiCom 2025 最佳演示奖
- 2026 年 2 月:被 MobiSys 2026 接收
- 2026 年 6 月:发布 v1.0.0 版本代码;Kaggle 挑战赛上线(总奖金池 2 万美元,决赛于 UbiComp 2026 上海举办);数据在线浏览平台上线
七、许可与伦理
- 代码基于 MIT 许可证
- 数据集仅限于非商业研究用途,需签署且不可再分发,遵循数据使用协议
- 派生标注与划分以 CC BY 4.0 发布
- 研究已获机构审查委员会(IRB)批准
八、引用
如需引用,请参照 README 中提供的 BibTeX 格式(MobiSys 26 论文,DOI: 10.1145/3745756.3809209)。另有机器可读版本 CITATION.cff 支持 GitHub 一键引用。
九、联系与项目页面
- 邮箱:syjiang [AT] ie.cuhk.edu.hk
- 项目主页:https://openaiotlab.github.io/CUHK-X/
- 数据获取:https://aiot-public-dataset-cuhk-x.cuhkaiot.com/
- 数据浏览:https://openaiotlab.github.io/CUHK-X/explorer/
- Kaggle 挑战赛:https://openaiotlab.github.io/CUHK-X-Challenge/
十、主要应用场景
- 医疗健康监护:认知衰退检测、日常生活活动评估、康复进度追踪
- 智能环境:家居自动化、安全与异常检测、人机交互设计
- 研究与教育:多模态融合算法开发、时序推理研究、隐私保护 AI、传感器融合教学
总结
CUHK-X 是首个面向人体活动理解与推理的多模态数据集,提供跨七个同步通道的大规模样本与多任务基准框架,不仅涵盖传统 HAR 评估(含跨域与长尾场景),还创新性地引入基于 LLM 的场景生成与多步推理任务,对推动多模态感知、时序推理与大型视觉语言模型评估具有重要价值。
搜集汇总
数据集介绍

构建方式
CUHK-X数据集由香港中文大学团队构建,旨在填补现有人类活动识别(HAR)数据集在复杂推理任务上的空白。该数据集通过精心设计的采集流程,从30名受试者、2种室内环境、不同光照与场景条件下,同步采集了七种模态的数据,包括RGB视频、红外(IR)、热成像、深度图像、毫米波雷达、骨骼关键点与惯性测量单元(IMU)数据。数据集包含64,267个标注样本,涵盖40余种动作类别,并分为小模型数据集(30,000+单一动作样本)与大模型数据集(序列动作样本)。构建过程中,采用LLM驱动的场景描述生成框架,产生符合逻辑的时序动作描述,并辅以人工校验(human-in-the-loop)确保标注质量。所有模态均通过硬件同步机制实现时间对齐,确保数据的一致性与准确性。
使用方法
CUHK-X数据集的使用方式灵活多样,依托其公开的代码仓库与数据访问门户。研究者在遵循数据使用协议(DUA)获取数据后,可直接采用仓库中的基线模型:小模型基线(SM)提供RGB、IMU、毫米波雷达与骨骼关键点的PyTorch训练与评估流程;大模型基线(LM)则支持QwenVL、InternVL、Video-LLaVA等视觉语言模型在HAU与HARn任务上的微调与测试。此外,数据集支持跨试验、跨受试者(LOSO)等评估协议,便于通过标准化模块比较模型性能。对于教学或快速探索,项目网站提供了数据观测站(Observatory),支持在浏览器中同步查看深度、红外与热成像剪辑,并包含动作图谱与推理测验。同时,数据集已发起Kaggle挑战赛,提供总计$20K的奖金池,鼓励研究者在公开竞赛框架下验证新方法,推动该领域的持续创新。
背景与挑战
背景概述
CUHK-X数据集由香港中文大学的研究团队于2026年发布,发表于MobiSys 2026,是首个大规模多模态人类活动场景理解与推理数据集。该数据集包含64,267个样本,覆盖RGB、红外、深度、热成像、毫米波雷达、骨架和IMU七种同步模态,由30名参与者在多样环境中采集,旨在克服现有HAR数据集在模态单一、标注粗浅和推理能力缺失方面的局限。其核心研究问题在于推动从传统动作识别向高层活动理解与因果推理的跨越,为多模态算法、跨域泛化及大语言模型评估提供了标准化基准。CUHK-X的影响力体现在其创新性的LLM辅助标注框架和三个基准任务(HAR、HAU、HARn)上,已衍生出高额奖金的Kaggle挑战赛,被广泛视为连接实验室研究与现实部署的关键资源。
当前挑战
CUHK-X数据集面临的挑战涵盖多层面。所解决的领域问题中,传统HAR任务受限于单一模态和浅层语义,难以应对光照变化、遮挡及隐私敏感场景,而多模态融合与跨域泛化仍是棘手难题;进一步,HAU(如动作描述、情绪分析)与HARn(如下一动作预测)需求模型具备时空逻辑推理能力,现有模型尚难精准捕捉活动序列的内在因果与意图。在构建过程中,挑战尤为显著:需同时部署并精确同步多种异构传感器(如RGB-D相机、毫米波雷达、IMU),保证七路数据的时间对齐与空间一致性;设计LLM生成场景后需经过人工循环验证以保持逻辑连贯和标注质量;此外,应对小样本与长尾分布、跨主体性能骤降(准确率仅56.56%)及隐私伦理合规等亦构成现实障碍。
常用场景
经典使用场景
CUHK-X数据集凭借其涵盖RGB、红外、深度、热成像、毫米波雷达、骨架及惯性测量单元等七种同步模态的64,267个样本,为多模态人类活动识别研究提供了迄今最为全面的基准。其经典使用场景聚焦于跨模态算法开发与验证,研究者可借助该数据集系统评估不同传感器组合在动作分类性能上的优劣,以及模态融合策略对识别鲁棒性的增益。数据集中精心设计的跨试次、跨受试者及跨环境评价协议,支持从单一模态基线到多模态集成方法的递进式探索,尤其适用于对比不同模型在跨域泛化与长尾分布场景下的表现。此外,其附带的针对小模型与大型视觉-语言模型的基线代码框架,极大降低了研究者复现与二次开发的门槛,促进了可持续的社区演进。
解决学术问题
CUHK-X旨在攻克现有行为识别数据集普遍存在的单一模态局限、样本规模不足及缺乏语义推理支持等核心学术瓶颈。在方法论层面,该数据集引入了一种基于大语言模型的提示式场景生成框架,配合人工闭环校验,产出了逻辑一致且时空合理的活动描述,从而首次将动作理解从标签分类提升至场景认知与因果推理的层次。在评估体系上,其系统性构建了涵盖动作识别、动作理解与动作推理的三层基准,并细化为动作描述生成、情绪剖析、序列重排序及下一动作预测等六项任务,为评测模型的时空感知与意图推断能力提供了可量化的参照系。尤其值得关注的是,数据集中深度与红外模态在推理任务上展现的优越信息量,对传统认为RGB主导的范式构成挑战,为隐私保护型感知的研究开辟了新的路径。
实际应用
在实际应用场景中,CUHK-X数据集为智能健康监护与普适计算技术的落地提供了关键支撑。在医疗照护领域,通过连续性行为序列的深度解析,该数据集支持开发用于早期识别认知衰退的智能系统,可捕捉健忘或重复性行为等病征,并用于评估阿尔茨海默病患者的日常活动能力及监控康复训练进展。在智慧环境构建中,数据驱动的情景感知算法可依据动作意图自动调节家居设备,或经由异常行为模式检测来增强安全监控的有效性。由于数据集中包含完整的毫米波雷达与惯性测量单元流,其尤为契合对隐私高度敏感的养老与家庭场景,能够在不依赖光学影像的情境下实现可靠的姿态估计与动作识别,从而弥合实验室研究与现实部署之间的鸿沟,推动可穿戴与边缘计算系统的实际演进。
数据集最近研究
最新研究方向
随着多模态感知技术与大语言模型的深度耦合,人类活动理解与推理正从单一视觉识别迈向场景化、时序化的认知范式。CUHK-X数据集以64,267个样本与七路同步模态(RGB、红外、热成像、深度、毫米波雷达、骨架、惯性测量单元)构建了迄今规模最大的多模态活动场景语料库,其前沿研究方向聚焦于三个层面:其一,依托LLM生成的逻辑化场景描述与人类反馈校验,探索活动理解中的语义对齐与因果推断,推动动作描述、情感分析、时序重排等复杂任务的统一评估;其二,基于跨域与跨被试协议,系统剖析模型在环境迁移与个体差异下的泛化瓶颈,特别是雷达与IMU等非视觉模态在隐私保护场景中的潜力;其三,针对动作预测与场景推理,构建了从感知到认知的端到端基准,揭示更大参数模型(如QwenVL-7B)在时序逻辑上的优势,同时反衬出小模型在跨被试任务中的薄弱环节。该数据集的发布恰逢边缘智能与具身智能兴起之际,其开源挑战赛(Kaggle,奖金2万美元)与可视化天文台工具,为泛在计算、健康监测及人机协同提供了标准化试验场,有望弥合实验室算法与现实部署之间的鸿沟,驱动下一代情境感知系统的演进。
以上内容由遇见数据集搜集并总结生成



