遇见数据集

lexeme-alignments

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

lexeme-alignments数据集是一个多语言圣经词汇对齐资源,专注于从目标语言表面词形到源语言词位(lexeme)的映射关系。它覆盖12种语言(阿拉伯语、阿萨姆语、孟加拉语、英语、法语、豪萨语、印地语、印尼语、俄语、西班牙语、瑞典语、斯洛伐克语),通过三种对齐方法(eflomal统计对齐、gloss词典对齐、gapfill覆盖填充)挖掘得到。数据集采用词位锚定原则,以MACULA词位ID为核心标识,组织方式为可加性联合,保留所有对齐方法的原始证据,支持完整的来源追溯。它还支持多版本圣经译本合并,允许用户分析跨版本一致性。数据集质量经过Clear-Bible手动标注验证,在词位粒度上的top-1准确率约为89-92%,并包含四个配套参考资源文件。数据集本身采用CC0-1.0许可,但表面词形来自的源译本保留各自原始许可证。

The lexeme-alignments dataset is a multilingual biblical vocabulary alignment resource focusing on mapping from target language surface word forms to source language lexemes. It covers 12 languages (Arabic, Assamese, Bengali, English, French, Hausa, Hindi, Indonesian, Russian, Spanish, Swedish, Slovak) and is derived through three alignment methods: eflomal statistical alignment, gloss dictionary alignment, and gapfill coverage filling. The dataset employs a lexeme anchoring principle, using MACULA lexeme IDs as core identifiers, and is organized in an additive joint manner to retain original evidence from all alignment methods, ensuring full traceability. It supports merging multiple biblical translation versions, allowing users to analyze cross-version consistency as a strong confidence signal. Dataset quality is validated via Clear-Bible manual annotations, achieving a top-1 accuracy of approximately 89-92% at the lexeme granularity, and includes four supporting reference resource files. The dataset itself is licensed under CC0-1.0, but the surface word forms from source translations retain their original licenses.

创建时间:
2026-07-13
搜集汇总
数据集介绍
lexeme-alignments 数据集图片
构建方式
Lexeme-alignments数据集的构建基于对齐器从目标语言表层词形到源语言词素(lexeme)的映射挖掘,锚定于固定的原始语言版本——旧约采用西敏寺列宁格勒抄本(WLC),新约采用Nestle1904希腊文本。每条记录以MACULA词素标识符(如hbo:0430)为锚点,而非粗粒度的Strong's编号,后者可通过词素无损推导。数据集采用三种对齐方法(eflomal统计模型、gloss词典匹配、gapfill填补未覆盖位置)的加性联合,每种方法独立标注,不进行合并或优胜劣汰,确保每条事实的完整溯源。同一语言支持多个译本池化(如英语含BSB和YLT),以base_text字段区分,跨译本的加性结构保留每个版本的独立翻译特征。
特点
该数据集的核心特点在于溯源诚实与信噪分离。每条记录包含method(对齐方法)、base_text(译本来源)、count(对齐频次)和hi_conf(高置信度比例)四个维度,用户可根据精度-召回率需求自由选择过滤阈值。跨方法一致性(如同一词素被eflomal和gloss同时支持)和跨译本一致性(被多个独立译本映射)提供可量化的置信信号。数据集不预设通用最低阈值,保留count=1的弱证据行,确保原始信息不因噪声过滤而丢失。伴随资源light_lexemes.json标记约545个语义宽泛的轻词素(如系动词),提示对这类词素的单方法证据需谨慎对待。
使用方法
用户可通过三个独立信号组合调整操作点:按method过滤排除gapfill覆盖层(method!='gapfill'),按base_text筛选单一译本,或按跨方法/跨译本一致性保留可信事实。推荐平衡默认设置为每个(surface, method)组内基于argmax的share值且count≥2。share(条件概率P(lexeme|surface))和hi_conf(高分比例)提供证据强度和可靠性指标,而count标识支持频次。派生脚本strongs_view.py支持按Strong's编号聚合生成词表,merged最佳选择视图(通过contest_rule.json的争议解决规则)适用于需要单答案每词元的场景,但需注意该视图为有损合并,无法从此数据集的聚合行直接还原。
背景与挑战
背景概述
lexeme-alignments数据集由Clear-Bible等机构的研究人员开发,旨在为多语言圣经翻译提供基于词位(lexeme)的精确对齐资源。该数据集创建于近年,覆盖阿拉伯语、英语、法语等12种语言,核心研究问题是通过将目标语言表层面词形式锚定到原始希伯来语(WLC)和希腊语(Nestle1904)的固定词位,实现跨语言可比较的细粒度翻译对齐。其创新之处在于以MACULA词位而非粗粒度的Strong's编号作为锚点,同时采用多种对齐方法(eflomal统计对齐、gloss词典匹配、gapfill模型填充)并保留完整溯源,不进行合并过滤。这一设计对圣经文本的语言学分析、机器翻译评测和多语种交叉验证具有重要影响力,为下游工具提供了高精度的对齐基准。
当前挑战
该数据集面对的核心领域挑战是圣经翻译中多源文本的不一致性:不同语言版本对同一词位的翻译呈现高度变异,且现有对齐方法在低资源语言或语义模糊场景下精度不足。为此,数据集通过保留多种对齐方法的独立证据、引入跨版本一致性信号以及提供置信度指标(hi_conf、count、share)来应对。构建过程中面临的主要挑战包括:1) 协调不同目标语言版本的版权和许可问题,需依赖内容寻址方式管理多版本池化;2) 处理希伯来语词位到Strong's编号的映射异常,需人工验证并维护修正文件;3) 统计对齐器的随机性导致结果不可完全复现,故采用内容哈希固定发布版本;4) 确保gapfill低置信度层的透明标记,避免其混入高精度证据中误导下游应用。
常用场景
经典使用场景
在跨语言圣经研究中,lexeme-alignments 数据集为研究者提供了一种精密的词素级对齐资源。其核心用途在于将目标语言的表层词形(surface word-forms)映射至原始语言(希伯来文与希腊文)的词典单元(lexeme),并通过严格的溯源机制(如 eflomal 统计对齐、gloss 字典对齐与 gapfill 填充层)透明呈现对齐过程。该数据集以 MACULA 词素标识符为锚点,避免使用粗粒度的 Strong 编号,从而支持多语言间逐词素的横向比较。研究者可通过多重过滤策略(如跨方法验证、跨版本验证)灵活调整精确度与覆盖度,适用于需要高保真词素级别翻译对应关系的学术分析。
解决学术问题
该数据集从根本上解决了圣经翻译研究中词素级对齐数据缺乏一致性与透明度的长期难题。传统对齐资源常忽视对齐方法的差异或合并多源信息,导致可信度难以评估。lexeme-alignments 通过保留每一条对齐事实的方法来源与证据强度(count、hi_conf),使研究者能够区分统计推测、字典映射与填充结果,从而避免因方法混同而产生的结论偏差。此外,数据集统一使用固定的原始语言版本(WLC 与 Nestle1904),消除了跨语言比较时版本不一致导致的基线混乱。这一设计为评估翻译质量、分析译词选择模式以及构建精准的多语言圣经词库提供了可靠的实证基础,显著提升了计算语言学研究在圣经文本领域的可重复性与科学性。
衍生相关工作
基于 lexeme-alignments 数据集的开放结构与精细溯源设计,已有若干衍生的经典工具与工作得以诞生。其中,strongs_view.py 脚本实现了从词素标识符向 Strong 编号的可靠转换,并生成简洁的高频词表,便于与依赖 Strong 编号的生态工具(如经文汇编软件)对接。merge_align 模块则提供了一种可选的单答案优选合并方案,尽管其过程不可完全复现,但为需要简洁答案的下游任务提供了实用接口。此外,配套发布的 light_lexemes.json 与 hebrew_lexeme_strong.json 等参考资源,分别针对语义空泛词素与编号歧义情况提供了额外线索,共同构成了一个围绕该数据集的知识补充体系。这些衍生工作充分体现了数据集以溯源为核心的设计理念,推动了更透明、可控的圣经对齐分析实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务