ph14t-multilang
收藏资源简介:
PHOENIX-Weather 2014T Multilingual 是一个基于 PHOENIX-Weather 2014T 视频级数据构建的多语言索引数据集,涵盖德语、英语和中文三种语言。数据集中的每个视频对应三行记录,分别对应三种语言的翻译,共享同一份视频元数据和帧路径。数据集以 Parquet 格式存储,可直接通过 Hugging Face datasets 库加载。数据来源包括视频元数据、帧路径和德语翻译来自 WayenVan/PHOENIX-Weather14T 的 video_level 配置,中文和英文翻译来自 CSV 文件。数据规模:训练集 7096 个视频(21288 行),验证集 519 个视频(1557 行),测试集 642 个视频(1926 行)。核心字段包括 name、lang、translation、video、start/end、speaker、orth、frames、backend_model、tokens、token_offsets、content_mask、pseudo_gloss_default/strict/relaxed/lemma 及 pseudo_gloss_offsets。pseudo-gloss 生成使用 UPOS 标签筛选内容词,中文使用 HanLP,英文和德文使用 spaCy。适用任务包括手语翻译、多语言翻译、文本生成、手语语言模型研究等。
PHOENIX-Weather 2014T Multilingual is a multilingual indexing dataset built on the PHOENIX-Weather 2014T video-level data, covering three languages: German, English, and Chinese. Each video corresponds to three rows of records, each representing a translation in one of the three languages, sharing the same video metadata and frame paths. The dataset is stored in Parquet format and can be loaded directly via the Hugging Face datasets library. Data sources include video metadata, frame paths, and German translations from the WayenVan/PHOENIX-Weather14T video_level configuration, with Chinese and English translations from CSV files. Data scale: 7096 videos (21288 rows) in training set, 519 videos (1557 rows) in validation set, and 642 videos (1926 rows) in test set. Key fields include name, lang, translation, video, start/end, speaker, orth, frames, backend_model, tokens, token_offsets, content_mask, pseudo_gloss_default/strict/relaxed/lemma, and pseudo_gloss_offsets. Pseudo-gloss generation uses UPOS tags to filter content words, with Chinese using HanLP and English/German using spaCy. Applicable tasks include sign language translation, multilingual translation, text generation, and sign language language model research.
数据集概述:PHOENIX-Weather 2014T Multilingual
基本信息
| 属性 | 内容 |
|---|---|
| 数据集名称 | PHOENIX-Weather 2014T Multilingual |
| 任务类型 | 翻译、文本生成 |
| 标签 | 手语、手语翻译、多语言、天气、伪注释 |
| 语言 | 德语(de)、英语(en)、中文(zh) |
| 数据格式 | Parquet |
| 配置 | 默认配置,包含 train、validation、test 三个 split |
数据集结构
该数据集基于 PHOENIX-Weather 2014T 视频级数据构建,每个视频在输出中对应三行(德语、英语、中文各一行),三行共享同一份视频元数据和帧路径,但 translation 与 lang 字段不同。多语言行数满足关系:多语言行数 = 原始视频数 × 3。
数据规模
| Hugging Face Split | 源 Split | 视频数 | 多语言行数 |
|---|---|---|---|
train |
train | 7,096 | 21,288 |
validation |
dev | 519 | 1,557 |
test |
test | 642 | 1,926 |
核心字段
| 字段 | 类型概念 | 说明 |
|---|---|---|
name |
string | 视频/样本唯一标识;同一 name 对应 de、en、zh 三行 |
lang |
string | 当前翻译语言:de、en 或 zh |
translation |
string | 当前语言的自然语言翻译 |
video |
string | 从源数据集继承的视频标识或路径 |
start / end |
int64 | 从源数据集继承的样本边界 |
speaker |
string | signer/speaker 标识 |
orth |
string | 从源数据集继承的原始转写字段 |
frames |
sequence[string] | 从源视频级数据集继承的帧路径;构建时不解码图像 |
backend_model |
string | 生成当前行 pseudo-gloss 时使用的分析模型 |
tokens |
sequence[string] | 分词后的完整非空白 token 序列 |
token_offsets |
sequence | 每个 token 在 stripped translation 中的 [start, end) 字符位置 |
content_mask |
sequence[int] | 与 tokens 对齐;默认规则保留为 1,否则为 0 |
pseudo_gloss_default |
string | 保留 NOUN、VERB、ADJ、ADV、NUM、PRON、PROPN |
pseudo_gloss_strict |
string | default 去掉 PRON |
pseudo_gloss_relaxed |
string | default 加入 AUX |
pseudo_gloss_lemma |
string | default 内容词的 lemma 形式;中文回退为原 token |
pseudo_gloss_offsets |
sequence | 与 default pseudo-gloss token 对齐的字符位置 |
Pseudo-gloss 生成规则
三种语言统一使用 UPOS 类别筛选内容词,规则如下:
text default = NOUN + VERB + ADJ + ADV + NUM + PRON + PROPN strict = default - PRON relaxed = default + AUX
语言处理后端
| 语言 | 后端 | 默认模型 |
|---|---|---|
| 中文 | HanLP tokenizer | CTB9_TOK_ELECTRA_SMALL |
| 中文 | HanLP POS | CTB9_POS_ELECTRA_SMALL |
| 英文 | spaCy | en_core_web_sm |
| 德文 | spaCy | de_core_news_sm |
HanLP 首先输出 CTB 词性标签,脚本再将其映射为 UPOS。spaCy 的 Token.pos_ 本身就是 UPOS 标签。
数据来源
- 视频元数据、帧路径和德语翻译来自 Hugging Face 数据集
WayenVan/PHOENIX-Weather14T的video_levelconfig。 - 中文翻译位于
resources/ph14t_chinese/。 - 英文翻译位于
resources/ph14t_english/。
CSV 文件使用 | 分隔,必须包含 name|translation 格式。构建脚本要求德语、英语和中文数据中的 name 集合完全一致,并拒绝缺失、null 或重复的 name。
加载方式
可以直接通过 Hugging Face datasets 库加载:
python from datasets import load_dataset
dataset = load_dataset("YOUR_NAMESPACE/ph14t-multilang") train = dataset["train"] validation = dataset["validation"] test = dataset["test"]
也可以直接从本地 Parquet 文件加载:
python from datasets import load_dataset
data_files = { "train": "data/ph14t_multilingual_train.parquet", "validation": "data/ph14t_multilingual_dev.parquet", "test": "data/ph14t_multilingual_test.parquet", }
dataset = load_dataset("parquet", data_files=data_files)
数据校验
构建脚本在写出 Parquet 前执行以下检查:
- origin、中文和英文数据必须包含
name、translation字段。 name不得为 null。- 每个输入中的
name必须唯一。 - 中文和英文
name集合必须与 origin 完全一致。 - join 后行数必须严格等于 origin 行数的三倍。
- HanLP tokenizer 输出的 token 数必须等于 POS tag 数。
注意事项
pseudo_gloss_*字段是通过词性筛选得到的自然语言内容词序列,不等同于 PHOENIX-2014T 官方手语 gloss 标注。- 中文 pseudo-gloss 使用空格连接分词结果;原始中文翻译保留在
translation字段。 - offset 相对于去除首尾空白后的 translation,而非未经处理的原始字符串。
- Parquet 中的
frames是源数据集提供的索引信息;构建脚本不会主动解码或重新编码视频帧。 - 发布派生数据集前,需确认源数据集和中英文翻译资源的许可证、署名及再分发要求。




