遇见数据集

aligned-mwe

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

该数据集名为 aligned_mwe,旨在为每个圣经词条(lexeme)提供其对应的连续多词目标短语(multi-word expression)。数据来源于圣经文本的词语对齐,使用 eflomal 的 grow-diag-final-and 对称化对齐算法,从每个经文的词对齐位置中提取连续的目标词片段(即目标词位置连续,满足 max-min+1 == len),过滤掉分散的对齐。每条记录包含:词条 ID(lexeme,如 hbo:2545)、汇总的 Strong 编号(strong,如 H2545)、连续的多词短语(phrase,小写)、短语中的词数(n_words)、该词条到该短语的对齐次数(count)、该次数占该词条所有对齐次数的比例(share),以及 contig 字段(始终为真,表示连续性)。数据采用 Parquet 格式存储,许可证为 CC0-1.0。适用于翻译、词对齐、多词表达分析等任务。

The dataset named aligned_mwe is designed to provide continuous multi-word target phrases for each Bible lexeme. The data is derived from word alignment of biblical texts, using the eflomal grow-diag-final-and symmetrization alignment algorithm to extract continuous target word segments from the word alignment positions of each verse (i.e., target word positions are consecutive, satisfying max-min+1 == len), filtering out scattered alignments. Each record contains: lexeme ID (e.g., hbo:2545), aggregated Strong number (e.g., H2545), continuous multi-word phrase (lowercase), number of words in the phrase (n_words), alignment count from the lexeme to the phrase (count), the proportion of this count to all alignments of the lexeme (share), and a contig field (always true, indicating continuity). The data is stored in Parquet format, licensed under CC0-1.0. It is suitable for tasks such as translation, word alignment, and multi-word expression analysis.

创建时间:
2026-07-28
原始信息汇总

数据集概述

aligned_mwe 是一个专注于圣经文本中多词表达(Multi-Word Expressions)对齐的数据集,由 bcv-commons 组织发布。

核心内容

该数据集与 lexeme-alignments 数据集互补,后者按表层词元(token)逐行组织,而本数据集则按词汇素(lexeme)聚合,每个词汇素对应一个连续的多词短语。数据来源于对齐器在每节经文中的 t_idx 位置,仅保留目标语言中位置连续(max−min+1 == len)的片段;分散链接到同一词汇素的词元会被丢弃,并在清单中记为 scattered_dropped,确保透明。对齐方法基于 eflomal 的 grow-diag-final-and 对称化对齐。

数据模式(Schema)

列名 含义
lexeme MACULA 词汇素锚点(如 hbo:2545 / grc:0026
strong 汇总的 Strongs 编号(如 H2545 / G0026
phrase 实际出现的连续多词表达(小写)
n_words 片段中的词元数量
count 该(词汇素 → 短语)对齐出现的次数
share count / 该词汇素的总计数
contig 恒为 true(连续性为纳入标准)

许可与生成

  • 许可证:CC0-1.0(公有领域)
  • 数据内容:仅包含短语、计数和公共标识符(Strongs / MACULA 词汇素),不含 MACULA 分析列
  • 语言来源:每种语言的源翻译保留各自的条款,详见各语言 manifest.json 中的 source 指针
  • 重新生成命令python -m lexeme_aligner.export_mwe --iso <iso> --method merged
  • 发布方式:批量 Parquet 文件在 Git 外发布,仓库仅提交 manifest.json(含每语言元数据和 content_sha256)及本数据卡

任务与标签

  • 任务类别:翻译(translation)、词元分类(token-classification)
  • 标签:圣经(bible)、词对齐(word-alignment)、Strongs、多词表达(multiword-expression)、逐行对照(interlinear)
搜集汇总
数据集介绍
aligned-mwe 数据集图片
构建方式
该数据集源于对圣经多语种平行语料中词汇对齐关系的深度挖掘,聚焦于将单一词位(lexeme)映射至连续多词短语(contiguous multi-word phrase)的跨语言对应现象。其构建依托eflomal对齐工具生成的grow-diag-final-and对称化对齐结果,通过逐节(per-verse)提取目标词位对应的源语言token位置区间,并严格遵循连续性准则:仅当目标端token位置构成连续区间(即最大与最小位置差加一等于区间长度)时,该多词短语才被保留。散落非连续的token关联则被剔除并计入清单中,确保数据纯净无噪声。最终以每一词位与对应短语的组合为一行,形成结构化表格,涵盖词位标识、Strong编号、短语内容、词数、对齐频次及占比等字段。
使用方法
此数据集适用于多种自然语言处理与语言学任务。在机器翻译领域,可作为短语表(phrase table)的补充资源,提升多词表达的翻译一致性;在词义消歧与词典编纂中,通过查询特定词位,可获取其跨语言的多词对应形式,辅助语义分析;在跨语言信息检索中,该数据可帮助识别不同语言间等价的复合概念。使用时,用户可借助HuggingFace datasets库加载Parquet格式数据,按需筛选特定语言(通过ISO代码路径)或词位,亦可结合manifest.json中的元数据进行定制处理。该数据可直接用于训练对齐模型或作为评估基准,其开放许可更允许商业应用与二次开发。
背景与挑战
背景概述
多词表达(Multi-Word Expressions, MWEs)作为自然语言处理领域中的一项核心难题,其自动识别与对齐长久以来困扰着研究者。aligned-mwe数据集应运而生,由bcv-commons团队于2023年倾力打造,旨在精准捕捉圣经文本中每个词素(lexeme)所对应的连续多词短语,如希伯来语חֶסֶד对应印尼语'kasih setia'。该数据集基于eflomal对齐工具的grow-diag-final-and对称化策略,从逐节t_idx位置中精心挖掘,确保仅保留目标端词元位置连续的对齐片段,从而为跨语言词素-短语映射提供高置信度的基准。其CC0-1.0许可协议与高度透明的构建流程,使其在圣经多语语料库研究及词级对齐领域产生了深远影响,为机器翻译和跨语言词汇语义研究开辟了新的数据维度。
当前挑战
该数据集所应对的核心挑战在于,多词表达的识别与对齐常因目标端词组间存在非连续或零散对齐而失准,传统统计方法易产生噪声。aligned-mwe通过严格的连续性准则(max−min+1 == len)剔除非连续token,将零散对齐标记为scattered_dropped并在manifest中显式记录,从而保证了数据纯净性。构建过程中,团队面临语料库规模庞大、多语言差异显著以及计算资源限制等难题,为此采用分语言导出与批量Parquet存储策略,并利用内容哈希(content_sha256)确保可复现性。这些努力有效提升了数据集的可靠性与可用性,为后续研究奠定了坚实基础。
常用场景
经典使用场景
aligned-mwe数据集专为跨语言多词表达(MWE)的对齐研究而设计,其核心场景聚焦于从词素到连续短语的映射分析。在圣经文本的机器翻译与计算语言学领域,该数据集提供了珍贵的对齐资源,使研究者能够精准考察希伯来语和希腊语词素如何在目标语言中实现为多词短语。其独特之处在于仅保留目标位置连续的对齐片段,剔除了分散性关联,从而保证了短语的完整性与一致性。这一特性使其成为训练和评估词对齐模型、探究多词表达内部结构以及跨语言短语归纳的经典基准,尤其适用于需要严格连续性约束的对齐任务。
解决学术问题
该数据集有效解决了多词表达对齐中普遍存在的非连续性问题,为学术研究提供了一个严格筛选的、连续多词短语对齐的语料库。传统对齐方法常因散乱对应而引入噪声,而aligned-mwe通过连续性标准(max−min+1 == len)净化数据,使研究者能够聚焦于真正紧凑的短语映射,从而更准确地进行词素-短语概率建模、多词表达识别及跨语言词汇语义相似度计算。它弥补了现有资源在精细连续对齐上的空白,为验证新提出的对齐算法和语言学假设提供了可靠的数据支撑,推动了多词表达处理的理论进展。
实际应用
在实际应用中,aligned-mwe数据集可用于提升圣经翻译辅助工具的准确性和效率。翻译记忆库和术语管理系统可借助该数据的词素-短语对应关系,为译员提供参考译法,尤其在处理固定搭配和习语时。此外,该数据集支持跨语言信息检索和多语种词典编纂,通过连续的短语对齐自动提取双语词典条目。在低资源语言场景下,其作为种子数据可辅助训练神经机器翻译模型,增强对多词单位的覆盖,从而改善翻译流畅度。该数据集以CC0许可发布,允许商业和非商业应用,降低了使用门槛。
数据集最近研究
最新研究方向
在计算语言学与圣经文本数字人文研究交融的前沿地带,多词表达的对齐与解析正成为提升机器翻译与跨语言语义理解精度的关键环节。该数据集聚焦于连续多词短语与词汇单元间的系统性映射,通过严格的连续性筛选与对称化对齐策略,摒弃了传统基于单词对齐的零散关联,为细粒度的词汇-短语对齐研究提供了全新基准。其基于经典语料库的构建模式,不仅助力于古代语言(如希伯来语、希腊语)的形态句法分析,也为低资源语言的神经机器翻译模型训练提供了高质量的训练与评估资源。在当前大语言模型盛行却对罕见语言支持不足的背景下,此类对齐资源对于促进多语种语义等价的深度建模、以及验证跨语言知识迁移的有效性具有不可忽视的基石作用,引领着圣经翻译工程与现代自然语言处理技术的融合创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务