遇见数据集

KSE-RESEARCH-Group/USL-Suspilne

收藏
Hugging Face2026-05-27 更新2026-06-14 收录
官方服务:

资源简介:

USL-Suspilne是一个小规模的乌克兰手语数据集,专为文本到姿态的研究而设计。该数据集基于乌克兰公共广播公司Suspilne Mовлення公开播出的新闻片段构建。每个数据片段将乌克兰语句子与对应手语翻译配对,提供视频剪辑以及MediaPipe姿态序列(包括2D和3D格式)。数据集包含训练、验证和测试分割,总共有3416个剪辑,总计5.17小时,涉及6名手语者。姿态数据详细描述了身体和手部关节的位置,可用于手语识别和生成任务。数据来源受版权保护,使用时需遵循相关许可条款。

A small-scale Ukrainian Sign Language dataset for text-to-pose research, built from publicly broadcast news clips on Suspilne Mовлення (Ukrainian public broadcaster). Each clip pairs a Ukrainian sentence with the corresponding interpreters signing, provided as a video clip and as MediaPipe pose sequences.

提供机构:
KSE-RESEARCH-Group
搜集汇总
数据集介绍
KSE-RESEARCH-Group/USL-Suspilne 数据集图片
构建方式
USL-Suspilne数据集专为文本到姿态(text-to-pose)任务而构建,素材源自乌克兰公共广播公司Suspilne Mовлення的新闻播报视频片段。每个片段均包含一段乌克兰语句子与对应手语译员的翻译表现,以视频和MediaPipe姿态序列两种形式存储。数据集采用管道分隔的CSV文件组织索引,训练集、开发集和测试集按片段级别以80/10/10的比例划分,确保每个源视频和译员均出现在所有划分中。姿态数据涵盖2D holistic(225维,含身体与双手的坐标及置信度)和3D(150维,50个关节的三维坐标)两种表示,均由MediaPipe工具提取,并严格与视频帧同步至30帧/秒。
特点
该数据集包含3416个片段,总时长约5.17小时,覆盖17个源视频和6位手语译员。训练集词汇量达到8120种类型(29368个token),而开发集和测试集的词级未登录词比例分别为16.6%和18.2%,反映了真实广播新闻的语言多样性。姿态数据经过归一化处理:2D坐标已缩放至[0,1]区间,不可见关节以全零标记;3D坐标基于骨骼长度约束解算,以鼻尖为锚点,数值范围约在[-2.5, 2.5]之间。这一设计使研究人员能够灵活选择姿态表示,并便于对缺失数据进行掩码处理。
使用方法
研究者可通过CSV文件中的片段名称链接至features/目录下的MP4视频或poses/目录下的NumPy姿态数组,以乌克兰语归一化文本(text_norm字段)作为模型输入,进行文本到姿态的生成或翻译任务。2D姿态数据需reshape为(T, 75, 3)以恢复33个身体关节点和42个手部关节点,其中手部置信度为0或1的占位符;3D姿态则reshape为(T, 50, 3)对应上半身和双手关节。由于划分并非基于译员或视频独立,该数据集适用于评估模型在有限广播场景下的表现,而非跨场景泛化能力。
背景与挑战
背景概述
USL-Suspilne数据集是一个面向乌克兰手语的文本到姿态生成研究的小规模数据集,由乌克兰公共广播公司Suspilne Mовлення的新闻片段构建而成。该数据集创建于近年,主要服务于手语合成领域,旨在将规范化的乌克兰语句子与对应的手语翻译者姿态序列进行配对。其核心研究问题是探索文本到手语姿态的映射机制,为听障人士提供更自然的人机交互方式。在相关领域内,该数据集填补了乌克兰手语资源匮乏的空白,尽管规模有限,但其标准化的数据处理流程和明确的姿态标注格式为后续乌克兰手语研究奠定了坚实基础,对推动低资源手语的自动化合成研究具有重要示范意义。
当前挑战
该数据集所解决的领域挑战包括:手语姿态序列与口语文本之间的非一一对应性与多模态对齐难题,以及乌克兰手语作为低资源语言在数据稀缺条件下的建模瓶颈。在构建过程中,挑战则体现在:其一,从公开新闻视频中自动裁剪翻译者区域时需应对复杂背景与多角度拍摄;其二,采用MediaPipe进行姿态提取时,手部与体部遮挡、检测失败导致的关键点缺失问题;其三,无法做到手语者身份或视频来源的独立划分,使得模型泛化能力评估受限;其四,词汇覆盖不足,导致开发集与测试集的词级未登录词率分别高达16.6%与18.2%。
常用场景
经典使用场景
USL-Suspilne数据集聚焦于文本到姿态(text-to-pose)这一前沿研究方向,旨在通过乌克兰语文本序列生成对应的连续手语姿态序列。该数据集由乌克兰公共广播公司Suspilne Mовлення的新闻播报片段构建,每段视频均包含播报员的乌克兰语语句与手语译员的同步手语动作。借助MediaPipe提取的2D和3D姿态关键点,研究者可将文本语义与手语动作的时空结构关联起来,训练能够从语言描述直接映射到手语姿态的生成模型。这是手语翻译领域从单帧识别迈向连续序列生成的关键资源,尤其适用于数据稀缺的语种上探索文本驱动的姿态合成技术。
实际应用
在实际应用中,该数据集可直接服务于乌克兰公共媒体中的手语翻译自动化系统。通过训练文本到姿态生成模型,能够将乌克兰语新闻文本实时转换为手语译员的姿态动画,辅助聋哑人群便捷地获取新闻报道信息。此外,该数据集还可用于辅助手语教学工具的开发,将书面语转化为可视化的手语动作序列,帮助学习者理解手语的语法结构与运动模式。这种文本驱动的手语生成技术最终有望集成到智能电视、移动应用或在线新闻平台中,为听障人士提供无障碍的信息访问服务,提升公共信息传播的包容性。
衍生相关工作
围绕USL-Suspilne数据集,衍生出一系列手语生成相关的重要工作。在模型层面,研究者借鉴了神经机器翻译的编解码器架构和Transformer序列模型,将文本编码后通过姿态解码器生成连续的2D或3D关键点序列,形成基线方法。后续工作进一步引入了手语动作的先验知识,如身体-手部关节的运动学约束和动作流畅性正则化项,以提升生成姿态的真实性与平滑度。此外,该数据集的公开促进了跨数据集对比研究,推动了将乌克兰手语的生成方法迁移到德、美等其他视觉语言风格的适应性探索,也催生了基于对比学习的跨模态对齐技术和对抗训练方法在前馈姿态生成中的改进验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务