遇见数据集

document-level-word-alignment

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

Document-Level Word Alignment 是一个面向六种语言对(英语-法语、英语-罗马尼亚语、英语-日语、英语-中文、拉丁语-古希腊语、英语-捷克语)的文档级词对齐数据集。该数据集从现有的句子级人工标注词对齐黄金标准中重建而来,通过按文档归属和句子顺序将句子级标注分组,构建文档级样例(不包含新的人工标注)。数据集的每个配置对应一个语言对,每行数据代表一个文档对。数据分为开发集(dev)和测试集(test),其中英语-捷克语仅有测试集。数据字段包括:文档唯一标识符(sent_id)、父文档标识符(doc_id)、语言对代码(lang)、源语言文本(text_a,按空格分词)、目标语言文本(text_b,按空格分词)、确定对齐链接(sure_align,空格分隔的“i-j”格式,0索引词位置)以及可能对齐链接(possible_align)。数据集统计信息显示,每个语言对的文档数量从1到52不等,文档平均字符长度(目标语言侧)从646到22,408不等。该数据集随论文《Scaling Unsupervised Word Alignment to Documents with Structural Constraints》发布,并采用混合许可协议(每个子集来源与许可证不同)。数据集创建过程为:将文档内句子级源语言和目标语言文本按原始顺序拼接,并相应重新索引对齐链接。

Document-Level Word Alignment is a document-level word alignment dataset covering six language pairs (English-French, English-Romanian, English-Japanese, English-Chinese, Latin-Ancient Greek, English-Czech). It is reconstructed from existing sentence-level manually annotated word alignment gold standards, grouping sentence-level annotations by document affiliation and sentence order to create document-level examples (without new manual annotations). Each configuration of the dataset corresponds to a language pair, and each row of data represents a document pair. Data is split into dev and test sets, with English-Czech having only test set. Data fields include: document unique identifier (sent_id), parent document identifier (doc_id), language pair code (lang), source language text (text_a, space-tokenized), target language text (text_b, space-tokenized), sure align links (sure_align, space-separated i-j format, 0-indexed word positions), and possible align links (possible_align). Dataset statistics show that the number of documents per language pair ranges from 1 to 52, and the average character length of documents (target language side) ranges from 646 to 22,408. The dataset is released with the paper Scaling Unsupervised Word Alignment to Documents with Structural Constraints and uses a mixed license agreement (each subset has different sources and licenses). The dataset creation process concatenates sentence-level source and target language texts within a document in original order and reindexes alignment links accordingly.

创建时间:
2026-08-11
原始信息汇总

数据集概述:Document-Level Word Alignment

基本信息

  • 数据集名称:Document-Level Word Alignment
  • 发布机构:ZurichNLP
  • 许可证:混合许可证(各子集独立授权,详见 LICENSE.md)
  • 语言:英语(en)、法语(fr)、罗马尼亚语(ro)、日语(ja)、中文(zh)、古希腊语(gr)、拉丁语(la)、捷克语(cs)
  • 多语言性:多语言
  • 任务类别:词元分类(token-classification)
  • 数据规模:1K < n < 10K

数据集内容

该数据集包含六个语言对的文档级词对齐数据,由现有的句子级人工标注词对齐黄金标准重建而来,不包含新的手工标注。文档级样本通过按文档归属和句子顺序对句子级标注进行分组构建。

语言对配置

配置名称 语言对 可用划分
en-fr 英语–法语 dev, test
en-ro 英语–罗马尼亚语 dev, test
en-ja 英语–日语 dev, test
en-zh 英语–中文 dev, test
la-gr 拉丁语–古希腊语 dev, test
en-cz 英语–捷克语 仅 test

数据结构

每个配置对应一个语言对,每一行代表一个文档对。

数据字段

字段 类型 描述
sent_id string 文档唯一标识符
doc_id string 父文档标识符
lang string 语言对代码,如 “en-ja”
text_a string 源语言文本(按空格分词)
text_b string 目标语言文本(按空格分词)
sure_align string 空格分隔的 i-j 确定对齐链接
possible_align string 空格分隔的 i-j 可能对齐链接

示例

json {"sent_id": "trial", "doc_id": "trial", "lang": "en-fr", "text_a": "source document text ...", "text_b": "target document text ...", "sure_align": "0-0 3-5", "possible_align": "1-1"}

数据统计(dev / test)

语言对 文档数(dev/test) 平均文档长度(字符)
en-fr 1 / 1 22,408
en-ro 1 / 10 2,901
en-ja 8 / 7 5,516
en-zh 47 / 52 646
la-gr 1 / 1 5,837
en-cz — / 33 6,318

注:长度为 text_b(目标语言侧)的字符数。

数据来源与许可

语言对 来源 许可证
en-ja Neubig (2011) CC BY-SA 3.0
la-gr Yousef et al. (2022) CC BY-SA 4.0
en-fr, en-ro Mihalcea & Pedersen (2003) 来源未指定
en-zh Liu and Sun (2015) 来源未指定
en-cz Mareček (2011) CC BY-SA 4.0

构建方法

文档级样本通过将文档内句子级源语言/目标语言文本按原始顺序拼接,并相应地重新索引 sure_alignpossible_align 来构建。

引用说明

使用该数据集时,需同时引用本工作及所使用的语言对对应的原始来源。相关论文为 "Scaling Unsupervised Word Alignment to Documents with Structural Constraints"

搜集汇总
数据集介绍
document-level-word-alignment 数据集图片
构建方式
在跨语言自然语言处理中,词对齐作为机器翻译与句法分析等任务的关键基石,长期受限于以单句为单位的标注粒度,难以支撑篇章级语义建模的需求。该数据集采用文档级重构策略,将现存六组经人工标注的句级词对齐金标准语料,依据文档归属与句序进行逐句拼接,并对齐链接中的词位置索引重新编号,从而生成篇章级对齐样本。整个构建过程未引入新的标注,确保了数据来源的可追溯性与标注质量的一致性,涉及英语—法语、英语—罗马尼亚语、英语—日语、英语—中文、拉丁语—古希腊语及英语—捷克语六个语言对。
特点
该数据集呈现出鲜明的多语言与篇章级双重特征。各语言对分别对应独立配置,其中英语—中文与英语—日语子集包含数十篇文档,而英语—法语、英语—罗马尼亚语等子集文档数量较少,体现了资源分布的不均衡性。数据字段涵盖文档标识、语言对代码、源端与目标端文本以及两类对齐链接,其中确定对齐与可能对齐的区分保留了原始标注的置信层级。文档平均长度从数百字符至两万余字符不等,为评估模型在不同篇章规模下的对齐泛化能力提供了多样化的测试场景。
使用方法
研究者可通过HuggingFace数据集接口按语言对配置加载相应子集,依据文档标识与句标识追溯篇章结构。输入端的源语言与目标语言文本已进行空白分词处理,对齐标签以词位置索引对的形式给出,适用于令牌分类任务的训练与评测。使用过程中需注意各语言对均设有开发集与测试集划分,而英语—捷克语仅提供测试集。若将该数据用于学术发表,应同时引用本数据集所依托的论文及对应语言对的原始来源文献,以符合各子集独立许可协议的要求。
背景与挑战
背景概述
文档级词对齐长期受限于缺乏篇章级标注语料,既有资源多囿于句级粒度,难以支撑跨句依赖与篇章结构约束下的对齐研究。该数据集由苏黎世大学Michelle Wastl、Jannis Vamvas与Rico Sennrich于2026年构建,系论文《Scaling Unsupervised Word Alignment to Documents with Structural Constraints》的配套资源。研究者将英语—法语、英语—罗马尼亚语、英语—日语、英语—汉语、拉丁语—古希腊语及英语—捷克语六组句级人工标注标准,按文档归属与句序重组为文档级样本,覆盖dev与test划分,为无监督词对齐的篇章级扩展提供了评测基准,推动了词对齐研究由孤立句子向真实文档语境的范式迁移。
当前挑战
该数据集所应对的领域难题在于,词对齐任务本身即需在词汇歧义、语序差异与句法结构异质等条件下建立跨语言词汇对应,而文档级设定进一步引入跨句指代、省略与篇章连贯等复杂现象,使对齐空间显著扩张。构建过程中,六组来源语料的许可条款与标注规范各自独立,部分源数据未明确授权,需逐一厘清并遵循混合许可;句级标注向文档级重组时,须重新索引对齐链接并保证句序与文档归属的准确映射,同时各语言对文档长度与样本量差异悬殊,对模型的长文本建模能力与跨语言泛化提出了非均衡的考验。
常用场景
经典使用场景
在跨语言自然语言处理领域,词对齐任务长期以句子为基本单元展开,而文档级词对齐数据集的出现则打破了这一固有范式。该数据集的经典使用场景在于为无监督词对齐模型提供文档粒度的结构约束监督信号,使模型能够在篇章范围内捕捉跨句的词汇对应关系,尤其适用于长距离依存、代词消解及省略结构等句子级对齐难以覆盖的语言现象。研究者通常将其作为基准测试平台,评估模型在英语—法语、英语—罗马尼亚语、英语—日语、英语—中文、拉丁语—古希腊语及英语—捷克语六组语言对上的文档级对齐性能。
衍生相关工作
围绕该数据集,研究者已展开一系列相关工作,其中最具代表性的是其配套论文所提出的基于结构约束的无监督文档级词对齐方法,该方法利用文档内句序与对齐一致性等结构信息,将句级对齐模型扩展至篇章层面。此外,该数据集的重组构建思路亦启发了后续对既有句级金标准的文档化再利用研究,推动了多语言文档级对齐资源的整合与标准化。相关衍生工作还涉及文档级对齐在神经机器翻译训练中的应用探索,以及跨语言篇章结构分析的实证研究,逐步形成以文档为单位的词对齐研究新脉络。
数据集最近研究
最新研究方向
文档级词对齐作为自然语言处理的基础性任务,长期受限于缺乏跨句边界的标注资源。该数据集通过整合六个语言对(涵盖英语—法语、英语—罗马尼亚语、英语—日语、英语—中文、拉丁语—古希腊语及英语—捷克语)的句级人工标注,重构出文档级对齐语料,为无监督对齐方法从句子尺度向篇章尺度的扩展提供了关键评测基准。其研究导向紧密呼应大规模语言模型时代对长文档机器翻译与跨语言信息抽取的需求,推动结构约束下的无监督对齐模型在真实文档场景中的鲁棒性验证,对低资源语言与历史语言的对齐研究亦具有深远的方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务