遇见数据集

awesome-sign-language-recognition

收藏
github2026-03-18 更新2026-06-04 收录
官方服务:

资源简介:

这是一个关于手语识别和手语翻译的资源集合,主要收录了多个相关数据集,如AUTSL、WLASL、MS-ASL、BSL-1K、How2Sign、CSL-Daily等,涵盖中文、土耳其语、美国手语、英国手语等多种语言和类型(孤立、连续、翻译),并提供了数据集的简要总结和比较表格。

This is a curated resource collection for sign language recognition and sign language translation, which primarily compiles multiple relevant datasets including AUTSL, WLASL, MS-ASL, BSL-1K, How2Sign, CSL-Daily, etc. It covers a wide range of languages and sign language task types: Chinese, Turkish, American Sign Language, British Sign Language, as well as three categories including isolated, continuous and sign language translation tasks, and provides brief summaries and comparative tables for these datasets.

创建时间:
2021-09-18
原始信息汇总

手语识别与翻译资源集合概述

该数据集详情页面汇集了手语识别(SLR)和手语翻译(SLT)领域的相关论文、数据集、基准测试、挑战赛等资源,旨在为研究者提供一站式参考。

基础资源

  • 手语的基本定义(维基百科)
  • 手语资源合集
  • 基于深度学习的手语识别入门教程
  • 手语识别、生成与翻译的跨学科综述论文(arXiv:1908.08597)

流行数据集

页面列出了多个公开手语数据集,并以表格形式汇总了其关键属性:

数据集 手语类型 类别数 手语者数 视频数 类型 模态 发布年份 公开可用
SLR500 中文 500 50 125,000 孤立词 RGB+D 2016
AUTSL 土耳其语 226 43 38,336 孤立词 RGB+D 2020
WLASL 美式 2,000 119 21,083 孤立词 RGB 2020
MS-ASL 美式 1,000 222 25,513 孤立词 RGB 2019
BSL-1K 英式 1,064 40 273,000 孤立词 RGB 2021
SLR100 中文 100 50 25,000 连续 RGB+D 2016
How2Sign 美式 16k词汇量 11 35,000 连续 RGB+D 2021
PHOENIX-2014T 德语 1,066 9 8,257 翻译 RGB 2014
CSL-Daily 中文 2,000 10 20,654 翻译 RGB 2021 -

更完整的数据集列表可参考:https://how2sign.github.io/related_datasets.html

论文分类

孤立词手语识别

  • 2021 CVPRW:基于骨架的多模态手语识别(含代码)
  • 2021 TMM:时空多线索网络
  • 2021 AAAI:基于手部模型的手语识别
  • 2021 WACV:手部姿态引导的3D池化
  • 2020 ECCV:BSL-1K数据集及口型线索方法(含代码)

连续手语识别

  • 2021 ICCV:视觉对齐约束(含代码)
  • 2020 ECCV:全卷积网络
  • 2020 AAAI:时空多线索网络
  • 2019 CVPR:迭代对齐网络
  • 2018 AAAI:无时间分割的视频手语识别

手语翻译

  • 2021 ACMMM:骨架感知神经翻译(含代码)
  • 2021 CVPR:基于单语数据的反向翻译
  • 2021 TMM:时空多线索网络
  • 2020 NeurIPS:时间语义金字塔(含代码)
  • 2018 CVPR:神经手语翻译(含代码)

基准测试

  • 手语识别任务的基准可参考 Papers with Code 平台

竞赛

  • CVPR 2021 ChaLearn 大规模独立手语者孤立词SLR挑战赛(含RGB和RGB+D两条赛道)

研讨会

  • CVPR 2021 ChaLearn 野外手语识别研讨会

流行实现

  • CVPR21Chal-SLR 代码仓库
  • 其他相关实现仓库
搜集汇总
数据集介绍
awesome-sign-language-recognition 数据集图片
构建方式
手语识别与翻译领域的研究近年来蓬勃发展,涌现出大量高质量的数据集与算法成果。该资源库由研究者精心整理,系统性地收录了该领域的核心论文、公开数据集、基准测试与挑战赛信息。其构建方式基于对孤立词手语识别、连续手语识别及手语翻译三大子方向的全面梳理,汇集了如AUTSL、WLASL、BSL-1K、How2Sign、CSL-Daily等知名数据集,并附有详尽的论文链接与代码实现,为研究者提供了一站式的知识导航。
特点
该资源库的特色在于其高度的结构化与实用性。它以表格形式清晰对比了各数据集的语种、类别数、手语者数量、视频规模及模态类型(RGB或RGB+D),便于用户快速筛选。同时,按研究方向分类整理的论文列表覆盖了从经典方法到前沿成果,并标注了会议来源与代码仓库,体现了对可复现性的重视。此外,它整合了挑战赛与研讨会信息,使研究者能及时把握领域最新动态与竞争焦点。
使用方法
用户可根据研究目标灵活使用该资源库。若需入门,可从“Basics”部分的基础文献与入门教程入手;若需选择数据集,可参考“Popular Datasets”表格中的对比信息,根据语言、任务类型及公开性进行筛选;若需寻找算法参考,可直接跳转至对应方向的论文列表,并通过附带的代码链接快速复现实验。该仓库还支持通过Pull Request贡献新资源,鼓励社区协作更新。
背景与挑战
背景概述
手语作为聋人群体沟通的核心媒介,其自动识别与翻译技术长期受限于数据稀缺与模态复杂性。由多机构研究者共同维护的awesome-sign-language-recognition资源库,自2020年创建以来系统整合了孤立词与连续手语识别、翻译等方向的文献与数据集,成为领域内重要的知识枢纽。该资源库涵盖AUTSL、WLASL、How2Sign等代表性数据集,涉及中、美、英等多国手语,推动从词汇级分类到句子级翻译的技术演进。其核心研究问题在于如何借助深度学习模型捕捉手语中的时空动态特征与手势语义关联,相关成果已显著提升跨模态理解精度,并催生了CVPR等顶级会议上的专题挑战赛,为构建无障碍人机交互系统提供了关键支撑。
当前挑战
手语识别与翻译面临多维度挑战。领域层面,不同手语体系间的语法结构差异(如美国手语与德国手语的非线性表达)导致模型泛化困难,而连续手语中的词边界模糊与共发音现象进一步加剧了时序对齐的复杂性。构建过程中,现有数据集普遍存在样本量不足、标注成本高昂等问题,例如BSL-1K虽包含27万视频但仅覆盖40名手语者,且RGB-D模态数据在真实场景中易受光照与遮挡干扰。此外,手语动作的细粒度特征(如手指屈伸、非手动表情)要求模型具备多尺度感知能力,而当前主流方案在跨语种迁移与实时推理效率上仍存在显著瓶颈。
常用场景
经典使用场景
在手语识别与翻译这一交叉学科领域中,awesome-sign-language-recognition数据集被广泛用于构建和评估基于深度学习的孤立词级别手语识别模型。研究者常利用该数据集中的多模态视频序列(如RGB与深度信息)来训练时空特征提取网络,捕捉手部姿态、面部表情及身体动作的细微变化,从而实现对手语词汇的精准分类。其丰富的标注类别和多样化的手语者群体,为模型在复杂环境下的鲁棒性验证提供了坚实基础。
解决学术问题
该数据集有效解决了手语识别研究中长期存在的两大核心难题:跨手语者差异性导致的泛化能力不足,以及连续手语流中词汇边界模糊带来的时序对齐困难。通过提供大规模、多语种(如中美英土手语)的孤立词与连续语句样本,它促进了端到端识别框架的突破,显著提升了模型对未见手语者的适应能力。其发布直接推动了手语翻译从实验室场景向真实世界应用的跨越,为残障群体的人机交互研究奠定了数据基石。
衍生相关工作
该数据集催生了多项标志性研究工作,包括基于骨架感知的多模态融合网络(Skeleton Aware Multi-modal SLR)、时序语义金字塔分层特征学习框架(TSPNet)以及视觉对齐约束连续手语识别方法(VAC-CSLR)。这些工作分别从人体结构先验、长序列语义建模和帧级时序监督等角度,推动了手语理解的理论边界。此外,衍生出的回译数据增强策略(Sign Back-Translation)利用单语语料库缓解了平行数据稀缺问题,为低资源手语翻译任务提供了可复用的方法论范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务