compact-alignments
收藏资源简介:
compact-alignments 是一个专注于圣经文本词对齐的数据集,提供逐节(per-verse)的细粒度对齐信息。其核心特点是仅存储对齐的位置索引(源语素序号和目标令牌位置),而不包含任何实际的圣经文本内容,从而确保数据集体积小巧且无版权问题。数据集旨在补充 lexeme-alignments,恢复词对齐中的具体位置信息,适用于机器翻译对齐、词分类及圣经文本的跨语言研究。数据内容与结构包含两个关键部分:1) 共享的源语素序列文件(_index/<BOOK>_lexemes.json),为每卷圣经书提供按节排列的希伯来语/希腊语内容语素(lexeme)列表;2) 每个译本每卷书的紧凑数组文件(<iso[0]>/<iso>/<edition>/<BOOK>_<hash>.json),其中每个元素是一个紧凑字符串,表示对齐关系。数据规模由圣经的节数决定,支持多种语言译本,源语言固定为希伯来语旧约(WLC 版本)和希腊语新约(Nestle1904 版本)。使用本数据集需要配合相应译本的圣经文本,并按照指定的令牌化规则处理目标文本。数据集采用 CC0-1.0 许可证。
compact-alignments is a dataset focused on word alignment for biblical texts, providing fine-grained alignment information per verse. Its core feature is that it only stores alignment position indices (source lexeme indices and target token positions) without including any actual biblical text content, ensuring the dataset is compact and free from copyright issues. The dataset aims to supplement lexeme-alignments by restoring specific position information in word alignment, making it suitable for machine translation alignment, word classification, and cross-linguistic research on biblical texts. The data content and structure consist of two key parts: 1) shared source lexeme sequence files (_index/<BOOK>_lexemes.json), which provide per-verse lists of Hebrew/Greek content lexemes for each biblical book; 2) compact array files for each translation and book (<iso[0]>/<iso>/<edition>/<BOOK>_<hash>.json), where each element is a compact string representing the alignment relationship. The dataset scale is determined by the number of biblical verses, supporting multiple language translations, with fixed source languages being Hebrew Old Testament (WLC version) and Greek New Testament (Nestle1904 version). Using this dataset requires accompanying biblical texts from corresponding translations and processing target texts according to specified tokenization rules. The dataset is licensed under CC0-1.0.
数据集概述:compact-alignments
该数据集是基于内容寻址的、按章节粒度的紧凑型对齐数据,为圣经翻译研究提供源语(希伯来语/希腊语)与目标语译本之间的词级对齐信息。
- 主要功能:记录特定圣经译本中,每个章节里希伯来语/希腊语内容词(content lexeme)与目标语译文的具体词对应关系。
- 核心特点:数据集不包含任何圣经原文,仅存储整数(源词序号与目标词位置),因此遵守 CC0-1.0 许可,且体积小。
- 关键来源:源语文本固定使用 WLC(西敏寺列宁格勒法典) 作为希伯来语旧约底本,Nestle1904 作为希腊语新约底本,均来自 Clear-Bible 项目。
数据结构与文件类型
数据集包含两类关键文件:
1. 共享的源语言内容词序列文件 (_index/<BOOK>_lexemes.json)
- 作用:为每卷书提供按章节排列的原始语言内容词词位(lexeme)列表。
- 格式:JSON 对象,键为“书卷 章:节”(如
"RUT 1:1"),值为该节所有内容词的词位 ID 数组(如["1961", "3117", ...])。 - 重要性:此文件是解析紧凑字符串中
srcOrd(源词序号)所必需的,且独立于具体译本,一次生成后所有译本均可复用。
2. 按译本、按卷的紧凑数组文件 (<iso[0]>/<iso>/<edition>/<BOOK>_<hash>.json)
- 作用:为特定译本的特定书卷提供每节经文的紧凑对齐字符串。
- 格式:JSON 数组,长度与该卷书的
_lexemes.json文件中的键数量一致,数组元素i对应第i个键(章节引用)的紧凑字符串。 - 紧凑字符串格式:例如
"0:1 1:2 2:5 3:5-6 4:12 ..."。各部分含义如下:
| 符号/模式 | 含义 |
|---|---|
| 空格 | 分隔不同的对齐条目,每个条目对应一个源语言内容词 |
srcOrd:targetSpan |
srcOrd 是源语言内容词在该节中的序号(从0开始,仅计数内容词);targetSpan 是目标语中与之对应的词位置 |
- |
连续范围(如 5-6 表示位置5和6) |
, |
非连续离散位置(如 4,6 表示位置4和6) |
无 srcOrd |
该内容词在此译本中无对齐 |
"" (空字符串) |
该节无对齐内容词,或译本在该节无内容 |
目标文本的分词规则
对齐基于特定的分词方法。分词规则为:一个词由最大连续序列的 Unicode 字母(L 类别)或组合标记(M 类别)构成。其余字符(标点、空格、数字等)均为分隔符,不产生词。
- 重要陷阱:源文本中的数字(如“40”)会被视为分隔符,若按 naive 规则分词(将数字视为独立词),则后续所有位置序号会错位。
内容哈希与文件命名
每个紧凑数组文件名末尾包含一个 5 字符的十六进制哈希(如 RUT_101a1.json),该哈希基于该卷书可译文本的内容(不含脚注、标题等)生成。
- 算法:对每节经文形成
"章:节:文本"字符串,按章节升序用换行符连接所有字符串,UTF-8 编码后取 SHA-256 摘要的后 5 个字符。 - 目的:当译本文本发生任何修改(如修正拼写、重新分节)时,哈希值会变化,从而避免使用过时的对齐数据。客户端可通过自行计算哈希来验证数据匹配性。
许可与可重现性
- 许可:CC0-1.0(数据集不包含受版权保护的经文原文)。
- 可重现性:对齐算法(eflomal)的非确定性意味着两次运行同一译本可能产生约 1% 的结果漂移。文件名哈希固定的是源文本,而非对齐结果本身。





