遇见数据集

compact-alignments

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

compact-alignments 是一个专注于圣经文本词对齐的数据集,提供逐节(per-verse)的细粒度对齐信息。其核心特点是仅存储对齐的位置索引(源语素序号和目标令牌位置),而不包含任何实际的圣经文本内容,从而确保数据集体积小巧且无版权问题。数据集旨在补充 lexeme-alignments,恢复词对齐中的具体位置信息,适用于机器翻译对齐、词分类及圣经文本的跨语言研究。数据内容与结构包含两个关键部分:1) 共享的源语素序列文件(_index/<BOOK>_lexemes.json),为每卷圣经书提供按节排列的希伯来语/希腊语内容语素(lexeme)列表;2) 每个译本每卷书的紧凑数组文件(<iso[0]>/<iso>/<edition>/<BOOK>_<hash>.json),其中每个元素是一个紧凑字符串,表示对齐关系。数据规模由圣经的节数决定,支持多种语言译本,源语言固定为希伯来语旧约(WLC 版本)和希腊语新约(Nestle1904 版本)。使用本数据集需要配合相应译本的圣经文本,并按照指定的令牌化规则处理目标文本。数据集采用 CC0-1.0 许可证。

compact-alignments is a dataset focused on word alignment for biblical texts, providing fine-grained alignment information per verse. Its core feature is that it only stores alignment position indices (source lexeme indices and target token positions) without including any actual biblical text content, ensuring the dataset is compact and free from copyright issues. The dataset aims to supplement lexeme-alignments by restoring specific position information in word alignment, making it suitable for machine translation alignment, word classification, and cross-linguistic research on biblical texts. The data content and structure consist of two key parts: 1) shared source lexeme sequence files (_index/<BOOK>_lexemes.json), which provide per-verse lists of Hebrew/Greek content lexemes for each biblical book; 2) compact array files for each translation and book (<iso[0]>/<iso>/<edition>/<BOOK>_<hash>.json), where each element is a compact string representing the alignment relationship. The dataset scale is determined by the number of biblical verses, supporting multiple language translations, with fixed source languages being Hebrew Old Testament (WLC version) and Greek New Testament (Nestle1904 version). Using this dataset requires accompanying biblical texts from corresponding translations and processing target texts according to specified tokenization rules. The dataset is licensed under CC0-1.0.

创建时间:
2026-07-26
原始信息汇总

数据集概述:compact-alignments

该数据集是基于内容寻址的、按章节粒度的紧凑型对齐数据,为圣经翻译研究提供源语(希伯来语/希腊语)与目标语译本之间的词级对齐信息。

  • 主要功能:记录特定圣经译本中,每个章节里希伯来语/希腊语内容词(content lexeme)与目标语译文的具体词对应关系。
  • 核心特点:数据集不包含任何圣经原文,仅存储整数(源词序号与目标词位置),因此遵守 CC0-1.0 许可,且体积小。
  • 关键来源:源语文本固定使用 WLC(西敏寺列宁格勒法典) 作为希伯来语旧约底本,Nestle1904 作为希腊语新约底本,均来自 Clear-Bible 项目。

数据结构与文件类型

数据集包含两类关键文件:

1. 共享的源语言内容词序列文件 (_index/<BOOK>_lexemes.json)

  • 作用:为每卷书提供按章节排列的原始语言内容词词位(lexeme)列表。
  • 格式:JSON 对象,键为“书卷 章:节”(如 "RUT 1:1"),值为该节所有内容词的词位 ID 数组(如 ["1961", "3117", ...])。
  • 重要性:此文件是解析紧凑字符串中 srcOrd(源词序号)所必需的,且独立于具体译本,一次生成后所有译本均可复用。

2. 按译本、按卷的紧凑数组文件 (<iso[0]>/<iso>/<edition>/<BOOK>_<hash>.json)

  • 作用:为特定译本的特定书卷提供每节经文的紧凑对齐字符串。
  • 格式:JSON 数组,长度与该卷书的 _lexemes.json 文件中的键数量一致,数组元素 i 对应第 i 个键(章节引用)的紧凑字符串。
  • 紧凑字符串格式:例如 "0:1 1:2 2:5 3:5-6 4:12 ..."。各部分含义如下:
符号/模式 含义
空格 分隔不同的对齐条目,每个条目对应一个源语言内容词
srcOrd:targetSpan srcOrd 是源语言内容词在该节中的序号(从0开始,仅计数内容词);targetSpan 是目标语中与之对应的词位置
- 连续范围(如 5-6 表示位置5和6)
, 非连续离散位置(如 4,6 表示位置4和6)
srcOrd 该内容词在此译本中无对齐
"" (空字符串) 该节无对齐内容词,或译本在该节无内容

目标文本的分词规则

对齐基于特定的分词方法。分词规则为:一个词由最大连续序列的 Unicode 字母(L 类别)或组合标记(M 类别)构成。其余字符(标点、空格、数字等)均为分隔符,不产生词。

  • 重要陷阱:源文本中的数字(如“40”)会被视为分隔符,若按 naive 规则分词(将数字视为独立词),则后续所有位置序号会错位。

内容哈希与文件命名

每个紧凑数组文件名末尾包含一个 5 字符的十六进制哈希(如 RUT_101a1.json),该哈希基于该卷书可译文本的内容(不含脚注、标题等)生成。

  • 算法:对每节经文形成 "章:节:文本" 字符串,按章节升序用换行符连接所有字符串,UTF-8 编码后取 SHA-256 摘要的后 5 个字符。
  • 目的:当译本文本发生任何修改(如修正拼写、重新分节)时,哈希值会变化,从而避免使用过时的对齐数据。客户端可通过自行计算哈希来验证数据匹配性。

许可与可重现性

  • 许可CC0-1.0(数据集不包含受版权保护的经文原文)。
  • 可重现性:对齐算法(eflomal)的非确定性意味着两次运行同一译本可能产生约 1% 的结果漂移。文件名哈希固定的是源文本,而非对齐结果本身。
搜集汇总
数据集介绍
compact-alignments 数据集图片
构建方式
compact-alignments数据集旨在为圣经研究提供跨版本的细粒度词对齐信息。其构建核心在于将每个圣经版本中每一节经文里的源语言(希伯来文或希腊文)内容词,与目标语言译文的对应标记位置建立精准映射。数据集中存储的是整数对,分别代表源语言内容词序数及目标语言标记位置,而非任何可受版权保护的圣经文本本身,从而确保数据集遵循CC0协议,保持小巧且无版权风险。
特点
该数据集一个显著特点在于其内容寻址机制:文件名中包含基于圣经书卷可翻译文本生成的哈希值,确保只有与原始对齐文本完全一致的版本才能使用该对齐数据,从而避免因文本修订导致的静默错误。此外,其紧凑的字符串格式通过空格、连字符及逗号,优雅地编码了从单个词对齐到分散的、非连续目标位置之间的对齐关系,并提供了索引文件以辅助解析源语言词序,使得数据查询直观而高效。
使用方法
使用该数据集时,研究者需同步获取固定的源语言版本(希伯来文WLC或希腊文Nestle1904)以解析srcOrd。操作流程为:首先,从_index/BOOK_lexemes.json文件中提取特定书卷的经文章节列表,并据此从对应版本的JSON数组中索引各节的对齐字符串。随后,通过自定义的tokenize函数(根据Unicode字母与组合标记进行分词)处理目标译文,从而将字符串中的位置信息还原为具体的词汇,实现精确的词对齐关系解读。
背景与挑战
背景概述
compact-alignments数据集由Clear-Bible团队于近年来构建,旨在为圣经翻译与跨语言对齐研究提供细粒度的词汇级对齐资源。该数据集聚焦于希伯来文(旧约西敏斯特列宁格勒抄本)和希腊文(新约Nestle1904)与多语言译本之间的词对齐任务,通过整数序列记录每个经文中内容词(lexeme)与目标语言译词的位置对应关系。其核心研究问题在于解决圣经文本中同形异义词、功能词过滤及跨版本修订带来的对齐不稳定性问题。作为lexeme-alignments的补充,该数据集保留了词位在具体经文中的出现位置信息,为机器翻译评估、古典语言计算语言学及数字人文学研究提供了精确的基准资源。数据集采用CC0-1.0许可,不包含任何受版权保护的圣经文本,显著降低了法律风险,推动了开放科学实践。
当前挑战
compact-alignments面临双重挑战。在领域问题层面,圣经翻译对齐需处理希伯来语和希腊语的复杂形态学特征,如西缅语中直接宾语标记与同形名词的区分,以及跨译本中因翻译策略差异导致的词对齐稀疏性。构建过程中,团队需解决eflomal非确定性对齐算法导致的约1%结果波动,以及不同版本经文的版本修订问题——文本中任何单词或经节划分的变更(如《使徒行传》1:3中数字标点差异)均会使旧对齐结果失效。此外,词元解析需要依赖统一的词法分类标签(MACULA class)而非Strong编号,以避免同形词误判,而目标语言的分词规则(如Unicode字母与组合标记的最大连续片断)必须严格一致,否则将引发系统性位置偏移错误。
常用场景
经典使用场景
在计算语言学和数字人文领域,compact-alignments数据集为精准的跨语言词对齐研究提供了不可或缺的基石。该数据集专为圣经文本的逐节、逐书对齐而设计,存储了原始语言中的内容词素与目标语言译本中具体词元之间的位置映射关系。研究人员可利用这一数据集开展基于位置的词对齐分析,探索希伯来文或希腊文原文与其多种语言译本间的词汇对应模式,尤其适用于那些需要区分同形异义词、排除虚词干扰的细粒度对齐任务。其紧凑的整数编码格式免除了版权困扰,使得学界能够自由地复用和验证对齐结果。
解决学术问题
该数据集巧妙解决了依赖传统对齐框架时面临的两大核心难题:其一,它通过仅存储词素编号和目标位置而非具体文本,规避了圣经译本复杂的版权限制,使得跨语种对齐数据得以在CC0许可下无障碍共享;其二,它提供了按内容寻址的哈希文件名机制,确保对齐数据始终与特定版本的源文本精确绑定,避免了因译本修订或重标章节而引发的对齐失效问题。这一设计大幅提升了数据复用的可靠性和可复现性,为圣经语料库的对比语言学、翻译普遍性研究以及低资源语言对齐技术的开发提供了坚实可靠的数据支撑,其影响远超宗教文本领域,惠及整个词对齐研究社群。
衍生相关工作
围绕compact-alignments的核心理念,学术界已衍生出多项重要工作。其姊妹数据集lexeme-alignments提供了聚合层面上的词素对齐信息,二者形成互补,共同服务于细粒度与宏观翻译模式的双重研究视角。基于该数据集的存储和寻址模型,研究者已进一步开发出针对其他宗教或古典文献的领域特定对齐工具,将位置映射与内容寻址的混合方案推广至更多低资源语言。同时,该数据集的compact字符串格式启发了对轻量级、去文本化对齐表示方法的探索,促进了在保留对齐精度的前提下,对齐数据压缩与高效发布领域的新范式,推动了开放科学中可复用数据基础设施的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务