遇见数据集

Multi-VSL-front-skeleton

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Multi-VSL(前视图)DWPose 骨架数据集是基于 Multi-VSL 越南手语语料库前摄像头视频片段,使用 DWPose 算法提取的全身二维姿态关键点数据集。该数据集包含 28,406 个剪辑片段,每个片段存储为一个独立的 .npz 文件,总数据量约 4.6 GB。文件按照 signer 目录组织,共有 30 个 signer 目录,每个目录包含 628 至 1,167 个 .npz 文件。每个 .npz 文件包含以下字段:all_xy(形状为 (T, 128, 2) 的 float16 数组,表示每帧关键点的像素坐标)、all_score(形状为 (T, 128) 的 float16 数组,表示每个关键点的置信度)、detected(形状为 (T,) 的 int8 数组,表示该帧是否检测到人物)、frame_size(形状为 (2,) 的 int32 数组,表示源视频帧尺寸)、fps(标量 float32,表示源视频帧率)。其中 T 为剪辑的帧数,128 个关键点遵循 DWPose/COCO-WholeBody 布局,包括 17 个身体关键点、6 个脚部关键点、68 个面部关键点和 42 个手部关键点(每只手 21 个)。文件名格式为 <session>___<view>_<device>_<signer>_<view>_<order>_<clip_index>.npz,例如 01_Co-Hien_100-200_1-2-3_0118___center_device10_signer01_center_ord1_100.npz。该数据集适用于手语识别、姿态估计、人体动作分析等任务,尤其适合越南手语相关研究。

The Multi-VSL (Front View) DWPose Skeleton Dataset is a whole-body 2D pose keypoint dataset extracted from the front camera video clips of the Multi-VSL Vietnamese Sign Language Corpus using the DWPose algorithm. It contains 28,406 clips, each stored as an independent .npz file, with a total data volume of approximately 4.6 GB. The files are organized by signer directories, with 30 signer directories, each containing 628 to 1,167 .npz files. Each .npz file includes the following fields: all_xy (a float16 array of shape (T, 128, 2) representing pixel coordinates of keypoints per frame), all_score (a float16 array of shape (T, 128) representing confidence scores for each keypoint), detected (an int8 array of shape (T,) indicating whether a person is detected in the frame), frame_size (an int32 array of shape (2,) representing the source video frame dimensions), and fps (a scalar float32 representing the source video frame rate). T is the number of frames in the clip. The 128 keypoints follow the DWPose/COCO-WholeBody layout, including 17 body keypoints, 6 foot keypoints, 68 facial keypoints, and 42 hand keypoints (21 per hand). The filename format is <session>___<view>_<device>_<signer>_<view>_<order>_<clip_index>.npz, e.g., 01_Co-Hien_100-200_1-2-3_0118___center_device10_signer01_center_ord1_100.npz. This dataset is suitable for tasks such as sign language recognition, pose estimation, human action analysis, and especially for Vietnamese Sign Language research.

创建时间:
2026-08-02
原始信息汇总

数据集概述

Multi-VSL (front view) — DWPose skeletons 是一个用于越南手语识别的全身2D姿态关键点数据集,从 Multi-VSL 越南手语语料库的前置摄像头视频片段中提取。

基本信息

  • 许可证:unknown(未知)
  • 任务类别:other(其他)
  • 语言:越南语(vi)
  • 标签:手语、越南手语、姿态估计、DWPose、骨架
  • 数据规模:10K < n < 100K

数据内容

  • 片段数量:28,406 个视频片段,每个片段对应一个 .npz 文件
  • 总大小:约 4.6 GB
  • 目录结构data/<signer>/<clip>.npz,共 30 个手语者目录,每个目录包含 628 至 1,167 个文件(由于 Hugging Face 限制目录内文件数不能超过 10,000,故采用非扁平目录结构)

每个 .npz 文件包含的字段

字段名 形状 数据类型 描述
all_xy (T, 128, 2) float16 每帧关键点像素坐标
all_score (T, 128) float16 每个关键点的置信度
detected (T,) int8 该帧是否检测到人物(1 为是,0 为否)
frame_size (2,) int32 源视频帧尺寸
fps 标量 float32 源视频帧率

其中,T 为片段的帧数。128 个关键点遵循 DWPose / COCO-WholeBody 布局,包含:17 个身体关键点 + 6 个脚部关键点 + 68 个面部关键点 + 42 个手部关键点(每只手 21 个)。

文件命名格式

文件名格式为:

<session><view><device><signer><view><order><clip_index>.npz

示例:01_Co-Hien_100-200_1-2-3_0118___center_device10_signer01_center_ord1_100.npz

使用方式

可通过 Hugging Face Hub 下载单个文件,例如:

python import numpy as np from huggingface_hub import hf_hub_download

path = hf_hub_download( "Tri1/Multi-VSL-front-skeleton", "data/signer01/01_Co-Hien_100-200_1-2-3_0118___center_device10_signer01_center_ord1_100.npz", repo_type="dataset", ) d = np.load(path) xy, score = d["all_xy"], d["all_score"] # (T, 128, 2), (T, 128)

也可下载整个数据集或仅下载某个手语者的数据:

python from huggingface_hub import snapshot_download

下载全部数据

snapshot_download("Tri1/Multi-VSL-front-skeleton", repo_type="dataset", local_dir="skeleton")

仅下载 signer01 的数据

snapshot_download("Tri1/Multi-VSL-front-skeleton", repo_type="dataset", allow_patterns="data/signer01/*", local_dir="skeleton")

搜集汇总
数据集介绍
Multi-VSL-front-skeleton 数据集图片
构建方式
该数据集源自Multi-VSL越南手语语料库的前置摄像头视频片段,通过先进的DWPose姿态估计技术提取全身二维关键点。数据以28,406个剪辑片段为单位,每个片段存储为独立的.npz文件,整体规模约4.6GB。文件按照'data/<signer>/<clip>.npz'的层级结构组织,涵盖30位手语者,每位手语者的剪辑数量在628至1,167之间,这种组织方式巧妙地规避了HuggingFace对单一目录文件数量的限制。每个.npz文件内含时间序列关键点坐标、置信度分数、人员检测标志、源视频分辨率及帧率等丰富信息,关键点布局遵循DWPose/COCO-WholeBody标准,包括身体、足部、面部及手部的128个关键点,为手语动作的精细化分析奠定了坚实基础。
使用方法
该数据集的使用极为便捷,开发者可通过Hugging Face Hub轻松访问。首选方法是利用`hf_hub_download`函数直接下载单个.npz文件,然后通过NumPy加载,即可获得关键点坐标和置信度数组,其形状分别为(T, 128, 2)和(T, 128),其中T代表帧数。对于需要整体数据的用户,`snapshot_download`函数支持批量下载整个数据集或仅特定手语者的子集,通过`allow_patterns`参数如'data/signer01/*'即可定向获取,有效节省存储和带宽。数据格式采用标准NumPy数组,兼容主流深度学习框架,可直接用于训练手语识别模型、动作捕捉分析或姿态估计的基准测试。清晰的命名规则和结构布局,使得数据集的探索、预处理和特征工程变得直观高效。
背景与挑战
背景概述
Multi-VSL-front-skeleton数据集由研究团队于近年构建,旨在为越南手语识别提供高质量的骨架级姿态数据。该数据集基于Multi-VSL语料库的前视摄像头视频,利用先进的DWPose模型提取全身2D关键点,涵盖身体、脚部、面部及手部共128个关键点,形成28,406个片段,总容量约4.6GB。其发布填补了越南手语在细粒度姿态估计领域的空白,为跨模态手语理解、人机交互及辅助技术研究提供了关键资源,推动了低资源语言视觉任务的进展。
当前挑战
该数据集面临多重挑战:首先,手语识别需克服复杂背景、遮挡及手部快速运动带来的关键点检测不稳定性,而DWPose在低分辨率或模糊帧上的置信度波动可能影响下游任务精度;其次,构建过程中需处理大规模视频的批量处理与存储限制(如HF单目录文件数限制),并确保30位手语者的数据分布均衡;此外,骨架数据虽轻量,但时间序列的异质性(如不同帧长T)对模型设计提出了自适应要求,而当前数据未提供语义标签,进一步增加了从姿态到语言映射的难度。
常用场景
经典使用场景
Multi-VSL-front-skeleton数据集以越南手语多视角语料库中前视摄像头的视频片段为源头,经由DWPose姿态估计技术提取了全身二维关键点序列,构建了包含28,406个片段、约4.6GB数据量的手语骨架数据资源。该数据集的核心使用场景在于为基于骨架的动作识别模型提供标准化输入,其关键点布局遵循COCO-WholeBody规范,涵盖身体、足部、面部及双手的128个关键点,能够全面捕捉手语表达中的细微手部姿态与身体动态,是研究手语识别、动作分类及序列建模等任务的理想基准数据。
解决学术问题
该数据集针对手语识别研究中视觉特征冗余度高、计算开销大且跨模态泛化能力不足等学术痛点,通过提供轻量级且高语义密度的骨架表示,有效解决了传统RGB视频数据对光照、背景及视角变化敏感的问题。它为肢体动作的时空建模提供了干净、紧凑的输入,降低了模型对算力的依赖,同时保留了手语表达的关键运动学信息,从而支撑了从视觉特征学习到语义理解的研究链条,推动了手语识别在无文本条件下的鲁棒性研究,并为跨语种手语识别技术的知识迁移提供了数据基础。
实际应用
在实际应用中,该骨架数据集可直接服务于实时手语翻译系统、聋人辅助交互设备及智能教育平台等场景。由于骨架数据具备计算高效、隐私友好及易于部署至边缘设备等特性,它尤其适合构建面向移动端的低成本手语识别应用,帮助听障群体在无网络环境下实现基本沟通。此外,该数据集还可用于手语教学评估、虚拟人动画驱动以及多模态人机交互系统中,作为动作生成和理解的训练素材,其结构化的关键点时序数据为手势驱动虚拟形象提供了精准的语义映射,有效增强了辅助技术的可用性与普及性。
数据集最近研究
最新研究方向
该数据集聚焦于越南手语识别的前沿方向,利用DWPose提取的全身2D骨架关键点,覆盖身体、面部、手部等128个关键点,为多模态手语理解提供了高精度、结构化的运动表征。当前研究热点在于结合大规模骨架序列与深度学习模型,探索时序建模、跨视角泛化及细粒度手势解析,以突破传统基于RGB视频方法在光照、背景上的局限。此数据集的发布推动了低资源语言手语识别技术的进步,为构建鲁棒、实时的辅助通信系统奠定了基础,对促进听障人士社会包容具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务