遇见数据集

ph14t-multilang

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

PHOENIX-Weather 2014T Multilingual 是一个基于 PHOENIX-Weather 2014T 视频级数据构建的多语言索引数据集,涵盖德语、英语和中文三种语言。数据集中的每个视频对应三行记录,分别对应三种语言的翻译,共享同一份视频元数据和帧路径。数据集以 Parquet 格式存储,可直接通过 Hugging Face datasets 库加载。数据来源包括视频元数据、帧路径和德语翻译来自 WayenVan/PHOENIX-Weather14T 的 video_level 配置,中文和英文翻译来自 CSV 文件。数据规模:训练集 7096 个视频(21288 行),验证集 519 个视频(1557 行),测试集 642 个视频(1926 行)。核心字段包括 name、lang、translation、video、start/end、speaker、orth、frames、backend_model、tokens、token_offsets、content_mask、pseudo_gloss_default/strict/relaxed/lemma 及 pseudo_gloss_offsets。pseudo-gloss 生成使用 UPOS 标签筛选内容词,中文使用 HanLP,英文和德文使用 spaCy。适用任务包括手语翻译、多语言翻译、文本生成、手语语言模型研究等。

PHOENIX-Weather 2014T Multilingual is a multilingual indexing dataset built on the PHOENIX-Weather 2014T video-level data, covering three languages: German, English, and Chinese. Each video corresponds to three rows of records, each representing a translation in one of the three languages, sharing the same video metadata and frame paths. The dataset is stored in Parquet format and can be loaded directly via the Hugging Face datasets library. Data sources include video metadata, frame paths, and German translations from the WayenVan/PHOENIX-Weather14T video_level configuration, with Chinese and English translations from CSV files. Data scale: 7096 videos (21288 rows) in training set, 519 videos (1557 rows) in validation set, and 642 videos (1926 rows) in test set. Key fields include name, lang, translation, video, start/end, speaker, orth, frames, backend_model, tokens, token_offsets, content_mask, pseudo_gloss_default/strict/relaxed/lemma, and pseudo_gloss_offsets. Pseudo-gloss generation uses UPOS tags to filter content words, with Chinese using HanLP and English/German using spaCy. Applicable tasks include sign language translation, multilingual translation, text generation, and sign language language model research.

创建时间:
2026-08-12
原始信息汇总

数据集概述:PHOENIX-Weather 2014T Multilingual

基本信息

属性 内容
数据集名称 PHOENIX-Weather 2014T Multilingual
任务类型 翻译、文本生成
标签 手语、手语翻译、多语言、天气、伪注释
语言 德语(de)、英语(en)、中文(zh)
数据格式 Parquet
配置 默认配置,包含 train、validation、test 三个 split

数据集结构

该数据集基于 PHOENIX-Weather 2014T 视频级数据构建,每个视频在输出中对应三行(德语、英语、中文各一行),三行共享同一份视频元数据和帧路径,但 translationlang 字段不同。多语言行数满足关系:多语言行数 = 原始视频数 × 3

数据规模

Hugging Face Split 源 Split 视频数 多语言行数
train train 7,096 21,288
validation dev 519 1,557
test test 642 1,926

核心字段

字段 类型概念 说明
name string 视频/样本唯一标识;同一 name 对应 de、en、zh 三行
lang string 当前翻译语言:deenzh
translation string 当前语言的自然语言翻译
video string 从源数据集继承的视频标识或路径
start / end int64 从源数据集继承的样本边界
speaker string signer/speaker 标识
orth string 从源数据集继承的原始转写字段
frames sequence[string] 从源视频级数据集继承的帧路径;构建时不解码图像
backend_model string 生成当前行 pseudo-gloss 时使用的分析模型
tokens sequence[string] 分词后的完整非空白 token 序列
token_offsets sequence 每个 token 在 stripped translation 中的 [start, end) 字符位置
content_mask sequence[int] tokens 对齐;默认规则保留为 1,否则为 0
pseudo_gloss_default string 保留 NOUN、VERB、ADJ、ADV、NUM、PRON、PROPN
pseudo_gloss_strict string default 去掉 PRON
pseudo_gloss_relaxed string default 加入 AUX
pseudo_gloss_lemma string default 内容词的 lemma 形式;中文回退为原 token
pseudo_gloss_offsets sequence 与 default pseudo-gloss token 对齐的字符位置

Pseudo-gloss 生成规则

三种语言统一使用 UPOS 类别筛选内容词,规则如下:

text default = NOUN + VERB + ADJ + ADV + NUM + PRON + PROPN strict = default - PRON relaxed = default + AUX

语言处理后端

语言 后端 默认模型
中文 HanLP tokenizer CTB9_TOK_ELECTRA_SMALL
中文 HanLP POS CTB9_POS_ELECTRA_SMALL
英文 spaCy en_core_web_sm
德文 spaCy de_core_news_sm

HanLP 首先输出 CTB 词性标签,脚本再将其映射为 UPOS。spaCy 的 Token.pos_ 本身就是 UPOS 标签。

数据来源

  • 视频元数据、帧路径和德语翻译来自 Hugging Face 数据集 WayenVan/PHOENIX-Weather14Tvideo_level config。
  • 中文翻译位于 resources/ph14t_chinese/
  • 英文翻译位于 resources/ph14t_english/

CSV 文件使用 | 分隔,必须包含 name|translation 格式。构建脚本要求德语、英语和中文数据中的 name 集合完全一致,并拒绝缺失、null 或重复的 name

加载方式

可以直接通过 Hugging Face datasets 库加载:

python from datasets import load_dataset

dataset = load_dataset("YOUR_NAMESPACE/ph14t-multilang") train = dataset["train"] validation = dataset["validation"] test = dataset["test"]

也可以直接从本地 Parquet 文件加载:

python from datasets import load_dataset

data_files = { "train": "data/ph14t_multilingual_train.parquet", "validation": "data/ph14t_multilingual_dev.parquet", "test": "data/ph14t_multilingual_test.parquet", }

dataset = load_dataset("parquet", data_files=data_files)

数据校验

构建脚本在写出 Parquet 前执行以下检查:

  • origin、中文和英文数据必须包含 nametranslation 字段。
  • name 不得为 null。
  • 每个输入中的 name 必须唯一。
  • 中文和英文 name 集合必须与 origin 完全一致。
  • join 后行数必须严格等于 origin 行数的三倍。
  • HanLP tokenizer 输出的 token 数必须等于 POS tag 数。

注意事项

  • pseudo_gloss_* 字段是通过词性筛选得到的自然语言内容词序列,不等同于 PHOENIX-2014T 官方手语 gloss 标注。
  • 中文 pseudo-gloss 使用空格连接分词结果;原始中文翻译保留在 translation 字段。
  • offset 相对于去除首尾空白后的 translation,而非未经处理的原始字符串。
  • Parquet 中的 frames 是源数据集提供的索引信息;构建脚本不会主动解码或重新编码视频帧。
  • 发布派生数据集前,需确认源数据集和中英文翻译资源的许可证、署名及再分发要求。
搜集汇总
数据集介绍
ph14t-multilang 数据集图片
构建方式
该数据集以PHOENIX-Weather 2014T视频级数据为基础,融合德语、英语与中文三种语言的翻译,构建了一个多语言索引资源。构建过程中,每个视频对应三行记录,分别携带不同语言的翻译文本,共享相同的视频元数据与帧路径。数据以Parquet格式存储,通过Hugging Face datasets库可直接加载。构建脚本严格校验三语数据中name集合的一致性,拒绝缺失或重复条目,并确保最终行数为原始视频数的三倍。此外,脚本利用HanLP与spaCy工具对三种语言的翻译进行词性标注,提取内容词序列作为伪注解(pseudo-gloss),为后续研究提供便利。
特点
该数据集的核心特色在于其三语平行结构与丰富的伪注解字段。每个视频条目均涵盖德语、英语和中文翻译,便于跨语言比较与多语言任务建模。数据集中提供的pseudo_gloss字段基于UPOS词性筛选,包括默认、严格、宽松及词元化等多种变体,适应不同研究需求。伪注解由自然语言翻译自动生成,虽非官方手语标注,但为手语翻译研究提供了近似注解的替代方案。此外,数据集保留了原始视频的索引信息,如起始帧、说话人及路径,便于与视频数据关联。
使用方法
使用者可通过Hugging Face datasets库便捷加载数据集,例如`load_dataset("YOUR_NAMESPACE/ph14t-multilang")`,并按需访问train、validation、test分割。数据集支持直接使用Parquet文件进行本地加载。对于多语言翻译任务,可按需筛选特定语言行;对于伪注解研究,可选用pseudo_gloss_default等字段作为目标序列。构建脚本提供灵活参数,允许用户自定义NLP模型或禁用伪注解生成,以适应不同实验需求。数据集的验证机制确保数据质量,便于直接应用于模型训练与评估。
背景与挑战
背景概述
PHOENIX-Weather 2014T Multilingual(ph14t-multilang)数据集诞生于2023年,由致力于多语言手语翻译研究的团队构建。该数据集基于广受认可的PHOENIX-Weather 2014T视频级数据,扩展出德语、英语和中文三种自然语言翻译,形成多语言索引,旨在促进跨语言手语翻译研究。其核心研究问题在于如何利用多语言平行语料增强手语翻译的泛化能力,并深入探究伪注释(pseudo-gloss)的生成与利用。通过提供丰富的语言变体,该数据集为神经机器翻译模型提供了宝贵的训练资源,对推动手语翻译领域的发展具有重要影响力。
当前挑战
该数据集面临的挑战主要来自两方面。在领域问题层面,手语翻译本身就是一项复杂任务,涉及视觉特征、语法结构和文化差异,多语言手语翻译更是加剧了语言间的语义不对齐问题。此外,手语缺乏标准化的书写系统,官方gloss标注稀缺,使得模型难以捕捉深层语义。在构建过程中,挑战同样显著:需确保三种语言的翻译资源与原始视频metadata严格对齐,处理不同自然语言处理工具(如HanLP与spaCy)间词性标注的不一致性,并设计鲁棒的pseudo-gloss生成规则,以尽量逼近手语标注的本质。这些挑战需严谨的数据校验和跨语言处理策略方可克服。
常用场景
经典使用场景
该数据集在手语翻译与多语言自然语言处理交叉领域中,为跨语言手语识别与翻译任务提供了关键的基准资源。其典型使用方式是将视频级的手语表达与其对应的德语、英语和中文翻译进行对齐,从而支持从手语视觉特征到多语言文本序列的端到端模型训练。研究者可借助其统一的视频标识和帧路径,便捷地抽取视频特征,并结合语言模型输出,构建集视觉编码与神经翻译于一体的多模态系统。此外,伪标注的引入使得在缺乏官方手语注释的情况下,仍能开展基于内容词的跨语言迁移学习,为手语翻译的低资源场景提供了新范式。
衍生相关工作
基于该数据集,衍生了若干具有影响力的研究方向。其一,伪标注方法启发了对弱监督手语翻译的探索,促使研究者比较不同词性筛选策略对翻译性能的影响,进而改进用于低资源手语语料的标注技术。其二,多语言对齐的设置催生了跨语言手语翻译模型的预训练-微调范式,推动了多语言通用表示学习在手语领域的应用。其三,该数据集常被用作评估生成式手语翻译模型的新基准,与官方标注的PHOENIX-2014T对照,量化揭示伪标注与真实标注间的差距,从而指导生成更高质量自动标注的后续工作。这些衍生研究共同丰富了多语言手语翻译的理论与实践体系。
数据集最近研究
最新研究方向
该数据集聚焦于手语翻译的多语言扩展与伪标注生成,代表了将单语手语语料库转化为跨德语、英语、中文三语平行资源的创新尝试。其核心前沿方向在于利用自然语言处理工具(如spaCy和HanLP)从翻译文本中提取内容词序列作为伪术语标注,从而绕过对手语官方标注的依赖,支持低资源场景下的手语翻译模型训练。这一方法响应了全球手语多样性带来的挑战,通过统一UPOS筛选规则实现了跨语言的一致性,为多语手语机器翻译、跨语言迁移学习及多模态理解提供了新基准。该数据集的发布促进了手语翻译研究从单一语言向多语方向的演进,强化了数据稀缺问题的解决路径,并对手语语言学计算研究具有重要推动作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务