遇见数据集

action-lab/gcaption

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

GCaption是一个为多个RGB步态数据集提供的自然语言属性标注数据集,由GaitMax(CVPR26)引入。该数据集包含103,124个行走序列,覆盖四个子数据集:casiab、ccgrm、ccpg和sustech1k。每个序列通过7个属性进行描述(详见SCHEMA.md),并为每个属性提供预计算的OpenCLIP文本嵌入,以支持上下文感知的步态研究和条件去相关损失(CDLoss)。嵌入维度为(103124, 7, 768)的fp16格式。数据集仅包括文本标题和每属性的OpenCLIP嵌入,按序列ID键控,不包含源帧、掩码或姿态数据。标注基于Gemini-2.5-flash-lite和GPT-4o生成,嵌入使用OpenCLIP ViT-L-14模型计算。需要注意的是,属性(尤其是年龄)是模型推断的表观属性,未经地面真实验证,不应用于个体识别;源数据已去识别化,不包含个人身份信息。

Natural-language attribute annotations for multiple RGB gait datasets, introduced in GaitMax (CVPR26). Each walking sequence is described by 7 attributes (see SCHEMA.md) plus a precomputed OpenCLIP text embedding per attribute, to support context-aware gait research and the Conditional Decorrelation Loss (CDLoss). The dataset includes 103,124 sequences across four datasets: casiab, ccgrm, ccpg, and sustech1k, with embeddings of shape (103124, 7,768) in fp16 format. It provides text captions and per-attribute OpenCLIP embeddings keyed by sequence ID, but does not include source frames, masks, or poses. Captions are generated using Gemini-2.5-flash-lite and GPT-4o, and embeddings are computed with OpenCLIP ViT-L-14. Note that attributes (especially age) are model-inferred apparent attributes, not verified ground truth, and should not be used for individual identification; source data is de-identified and contains no PII.

提供机构:
action-lab
搜集汇总
数据集介绍
action-lab/gcaption 数据集图片
构建方式
GCaption数据集源自于CVPR'26会议提出的GaitMax框架,旨在为步态识别领域注入自然语言语义信息。其构建过程对四个公开RGB步态数据集(CASIA-B、CCGR、CCPG、SUSTech1K)中的103,124条步态序列进行了精细的语义标注。每条序列通过Gemini-2.5-flash-lite大语言模型的结构化输出生成了7个属性描述,对于被模型内容过滤器拦截的少量样本,则采用GPT-4o进行恢复。在生成描述前,原始帧经过掩码自动裁剪以聚焦于行人区域。随后,基于OpenCLIP ViT-L-14模型为每个属性计算序列级别的文本嵌入,最终形成维度为(103124, 7, 768)的嵌入张量,以支持上下文感知的步态研究。
特点
该数据集的核心特色在于将自然语言描述与步态识别任务深度融合。每条序列通过7个关键属性(如年龄、服装、视角等)进行结构化描述,打破了传统步态识别仅依赖视觉特征的局限,为模型提供了丰富的语义上下文。尤为突出的是,每项属性均预计算了768维的OpenCLIP文本嵌入,使得研究人员能够直接利用这些语义特征,配合提出的条件去相关损失(CDLoss)进行训练。数据集规模达到十万级,覆盖多个场景和视角,但明确不包含原始帧、掩码或姿态数据,仅提供标注和嵌入,保证了使用的灵活性。
使用方法
使用GCaption数据集需先获取原始步态数据集,并通过序列id进行关联。研究人员可通过jsonlines文件轻松读取每帧的文本描述,并通过safetensors格式的嵌入文件高效加载预计算的属性嵌入张量。数据集的典型使用流程包括:加载所有序列的文本描述(如json.load读取jsonl文件),使用safetensors.torch.load_file加载嵌入,并构建id到索引的映射关系以快速定位特定序列。该设计适配于基于对比学习或特征解耦的现代深度学习框架,尤其适用于需要将语义属性与步态特征进行对齐或解耦的研究场景。
背景与挑战
背景概述
步态识别作为生物特征识别领域的重要分支,因其实施隐蔽、难以伪造及远距离可感知等优势,广泛应用于安防监控与智慧城市。然而,现有研究多聚焦于基于轮廓或骨架的几何表征,忽视了语义属性与上下文信息对识别鲁棒性的潜在增益。在此背景下,GCaption数据集由Huang等人在2026年CVPR会议提出的GaitMax框架中创建,旨在引入自然语言属性注释,填补步态数据中语义标注的缺失。该数据集整合了CASIA-B、CCGR、CCPG和SUSTech1K四个主流RGB步态数据集,覆盖103,124条行走序列,每条序列包含7个属性描述及对应的OpenCLIP文本嵌入,为跨场景、跨视角的步态识别提供了上下文感知的研究基础,显著推动了多模态步态分析领域的发展。
当前挑战
GCaption数据集所面临的挑战涵盖领域问题与构建过程两大层面。在领域问题方面,步态识别长期受困于视角变化、衣着遮挡及行走状态差异,而传统几何方法难以捕捉语义层面的关联性,导致对复杂场景的泛化能力不足。GCaption通过属性描述构建语义桥梁,但如何弥合图像特征与自然语言间的语义鸿沟,并利用条件去相关损失有效抑制冗余信息,仍是关键难题。在构建过程中,挑战尤为显著:首先,大规模属性标注依赖Gemini-2.5-flash-lite与GPT-4o等大语言模型,面临长尾属性分布与低光照条件下颜色歧义等局限;其次,模型推断的年龄等外观属性缺乏真实标签验证,存在伦理风险;此外,开集合并多源数据时需严格规避原数据集的隐私限制,且文本嵌入空间中视角偏航特征的弱分离性进一步加剧了多模态对齐的复杂度。
常用场景
经典使用场景
GCaption数据集专为步态识别与视觉-语言联合建模而设计,其经典使用场景在于利用自然语言属性标注来增强步态序列的语义理解。该数据集为来自CASIA-B、CCGR、CCPG和SUSTech1K四个主流步态数据集的103,124条行走序列提供了7种细粒度属性描述(如年龄、着装、视角等),并配以OpenCLIP文本嵌入。研究者可借此将步态特征与属性文本对齐,实现跨模态检索、属性驱动的步态分析,或作为多模态模型的训练基准,从而探索步态模式与高级语义之间的映射关系。
衍生相关工作
GCaption数据集的发布催生了一系列影响深远的衍生工作,其中最典型的是其原始引入论文GaitMax(CVPR 2026),该工作基于属性嵌入设计了一种条件去相关损失函数,有效提升了步态特征的判别性。此后,研究者利用GCaption开展了视角不变性步态属性预测、基于文本-步态互检索的跨模态匹配、以及利用大语言模型生成步态描述等探索。此外,该数据集还启发了多项将视觉-语言预训练模型(如CLIP)应用于生物特征识别的尝试,推动了步态识别从纯视觉范式向多模态语义理解的演进。
数据集最近研究
最新研究方向
步态识别领域正经历从传统几何特征向多模态语义建模的范式跃迁。GCaption数据集通过为CASIA-B、CCPG等四大步态数据集的逾十万条行走序列标注七维自然语言属性与OpenCLIP文本嵌入,开创了视觉语言模型与步态分析深度融合的新路径。其核心突破在于利用大语言模型(Gemini-2.5-flash-lite)生成细粒度语义描述,并引入条件去相关损失(CDLoss)以消解属性间的统计依赖,从而在衣着、视角等复杂协变量干扰下仍能保持身份特征的判别性。该工作呼应了CVPR'26提出的运动语义与运动学二元性理论,为跨场景步态识别提供了兼具解释性与泛化能力的可扩展数据基座,标志着步态研究正从封闭的几何空间迈向开放语义驱动的认知计算时代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务