遇见数据集

synoptiq-corpus

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

SynoptiQ Corpus是一个专为对观福音问题(Synoptic Problem)的计算研究设计的词汇级数据集。该问题探讨《新约圣经》中马太、马可、路加三卷福音书之间的文学关系,是圣经研究领域持续两个多世纪的经典议题。数据集以科因希腊语呈现对观福音书文本,旨在为训练基于Transformer的模型提供支持,以检测文本的抄袭方向、编辑倾向和来源关系。数据集包含49,061个词汇级样本,覆盖马太福音(18,329词)、马可福音(11,286词)和路加福音(19,446词)。每个样本标注了词形、词性标签、形态学解析(CCAT编码)和所属Aland段落编号。数据集基于170个Aland段落组织,包括88个三重传统段落、17个双重传统段落、18个马太特有段落、45个路加特有段落和2个马可特有段落。关键特征提供词汇级平行对齐信息,使用Needleman-Wunsch算法计算了马太-马可、马太-路加、马可-路加之间的235组成对词汇对齐,产生8,855个对齐词汇对和45,029个间隙位置。数据基于SBLGNT批判版本文本和MorphGNT形态学注释,并在段落级别进行分层划分(60/20/20),确保训练集、验证集和测试集之间无经文重复。适用于科因希腊语NLP模型训练与评估、文本批评、作者研究、教学辅助和历史语言领域适应基准测试。

The SynoptiQ Corpus is a lexical-level dataset designed for computational research on the Synoptic Problem, which investigates the literary relationships among the Gospels of Matthew, Mark, and Luke in the New Testament, a classic issue in biblical studies spanning over two centuries. The dataset presents the synoptic gospel texts in Koine Greek, aiming to support training Transformer-based models to detect textual plagiarism directions, editorial tendencies, and source relationships. It contains 49,061 lexical samples covering the Gospel of Matthew (18,329 words), Mark (11,286 words), and Luke (19,446 words). Each sample (i.e., a word) is annotated with its lemma, part-of-speech tag, detailed morphological parsing (CCAT encoding, including person, tense, voice, mood, case, number, gender, degree), and Aland paragraph number. The dataset is organized based on 170 Aland paragraphs, including 88 triple tradition paragraphs (shared by all three gospels), 17 double tradition paragraphs (shared only by Matthew and Luke), 18 Matthew-specific paragraphs, 45 Luke-specific paragraphs, and 2 Mark-specific paragraphs. A key feature is the provision of lexical-level parallel alignment information. For all shared paragraphs, using the Needleman-Wunsch global alignment algorithm based on (lemma, part-of-speech) pairs, 235 pairwise lexical alignments are computed among Matthew-Mark, Matthew-Luke, and Mark-Luke, resulting in 8,855 aligned word pairs and 45,029 gap positions. This enables models to learn directly from corresponding structures. The data is based on the standard SBLGNT (Society of Biblical Literature Greek New Testament) critical edition text, incorporating morphological annotations from MorphGNT. The data is split at the paragraph level in a stratified manner (60/20/20), ensuring no overlap of scripture between the training set (101 paragraphs), validation set (33 paragraphs), and test set (36 paragraphs). The dataset is suitable for various tasks and applications, including training and evaluation of NLP models for Koine Greek (e.g., part-of-speech tagging, lemmatization, morphological analysis), textual criticism (detecting scribal tendencies, editorial fatigue, textual dependency patterns), stylometric and authorial studies of New Testament texts, as a teaching aid for Koine Greek, and as a benchmark for historical language domain adaptation techniques.

创建时间:
2026-07-02
原始信息汇总

数据集概要

SynoptiQ Corpus 是一个面向计算语言学分析的 Koine 希腊语对观福音书(马太、马可、路加)词元级数据集,专为训练基于 Transformer 的模型以研究对观福音问题(Synoptic Problem)而设计。

核心特性

  • 49,061 个词元:马太福音 18,329 个,马可福音 11,286 个,路加福音 19,446 个。
  • 170 个 Aland 编修段(Pericopes):包含 88 个三重传统(三段福音均包含)、17 个双重传统(仅马太-路加)、18 个马太独有、45 个路加独有、2 个马可独有。
  • 235 对逐对词元对齐:基于共享编修段,采用 Needleman-Wunsch 全局对齐算法(依据词元与词性配对),产生 8,855 个对齐词元对和 45,029 个缺口位置。
  • 2,739 个独立词元:附带 MorphGNT 形态标注(词性、时态、语态、语气、格、数、性)。
  • 分层 60/20/20 划分:按编修段级别划分为 101 个训练集、33 个验证集、36 个测试集,确保无经文跨划分。
  • 文本来源:采用 SBLGNT 标准校勘本(CC-BY 授权)与 MorphGNT 形态标注(CC-BY-SA 授权)。

数据来源

来源 描述 许可证
SBLGNT 圣经文学学会希腊文新约(Holmes 2010) CC-BY
MorphGNT 形态标注版 SBLGNT(Tauber 2017) CC-BY-SA
Aland Synopsis Quattuor Evangeliorum 编修段编号与经文映射(Aland 1963) 学术引用

局限性

  • 仅包含对观福音书,不包括约翰福音。
  • 约 96% 的词元被分配到编修段,约 1,984 个词元(4%)未分配。
  • 形态标注基于 MorphGNT 单一学术分析,未包含其他解析方案。
  • Needleman-Wunsch 对齐采用固定缺口惩罚,不同参数可能产生略微不同的对齐结果。

预期用途

  • Koine 希腊语 NLP 模型训练与评估(词性标注、词形还原、形态分析)
  • 经文鉴别学:检测抄写倾向、编辑疲劳及文本依赖模式
  • 文体计量分析与新约文本作者研究
  • Koine 希腊语教学工具
  • 历史语言领域自适应技术基准测试

数据集结构

主表:词元级数据(data/*.parquet

数据集按训练、验证、测试分为三个 Parquet 文件。每行代表一个词元,包含以下字段:

  • token_id:稳定标识符(如 Matthew.1.1.0
  • book:福音书名称(MatthewMarkLuke
  • chapter:章号(从 1 开始)
  • verse:节号(从 1 开始)
  • position:词元在节内的位置(从 0 开始)
  • text:SBLGNT 中的表面形式
  • normalized:NFD 标准化、去除重音后的形式
  • lemma:MorphGNT 字典主词
  • pos:词性标签(如 N- 名词、V- 动词、RA 冠词等)
  • morph:8 字符 CCAT 形态标签
  • pericope_id:Aland 编修段编号
  • tradition:传统分类(tripledoublematthean_uniquelukan_uniquemark_unique
  • genre:体裁(narrativediscoursewisdompassionother
  • books_in_pericope:JSON 数组,列出该编修段包含的福音书
  • is_punctuation:布尔值,始终为 false

辅助文件

  • pericopes.parquet:编修段级元数据(170 行),包含编修段 ID、传统分类、体裁、所含书籍、词元数、对齐对数及划分归属。
  • alignments.json:词元级 Needleman-Wunsch 对齐对,键格式为 pericope_id|book_a|book_b,值为 [idx_a, idx_b] 列表,null 表示缺口。

使用示例

python from datasets import load_dataset

加载词元级数据集

dataset = load_dataset("ainouche-abderahmane/synoptiq-corpus")

筛选三重传统数据

triple = dataset["train"].filter(lambda x: x["tradition"] == "triple")

提取马太福音的所有词元

matthew_lemmas = dataset["train"].filter(lambda x: x["book"] == "Matthew")["lemma"]

对齐格式

alignments.json 中的键格式为 pericope_id|book_a|book_b,例如:

json { "018|Matthew|Mark": [ [0, null], [1, 0], [null, 1] ] }

  • [0, null]:马太词元 0 在马可中无对应(缺口)
  • [1, 0]:马太词元 1 与马可词元 0 对齐
  • [null, 1]:马可词元 1 在马太中无对应(缺口)

索引引用该编修段内按(章、节、位置)排序的逐书词元序列。

相关模型

  • KoineFormer:基于 GreTa 模型进行 LoRA 适配,在 Koine 希腊语上训练,并使用本数据集评估。

许可证

本数据集采用 CC-BY-SA 4.0 许可证。

版本历史

版本 日期 变更
1.0.0 2026-07 初始发布:合并 SBLGNT 与 MorphGNT,分配 Aland 编修段,进行 Needleman-Wunsch 对齐,提供分层划分。
搜集汇总
数据集介绍
synoptiq-corpus 数据集图片
构建方式
SynoptiQ Corpus的构建基于对符类福音书(马太、马可、路加)的希腊文文本进行精细的词汇层级标注。研究团队整合了SBLGNT标准校勘本与MorphGNT形态分析资源,为每个词元标注了词干、词性、形态分析和Aland pericope编号。在平行段落中,利用Needleman-Wunsch全局比对算法以(词干、词性)为配准键,实现了三卷福音书两两间的词汇级对齐,共生成235组比对结果。数据按照pericope层级进行了分层抽样,划分为训练集、验证集和测试集,确保任何经文片段仅出现在一个子集中。
特点
该数据集共包含49,061个词元,覆盖170个Aland pericope段落,其中88个为三卷共有。词汇层面拥有2,739个独立词干,并配套了完整的形态标注信息。其独特价值在于提供了8,855个已对齐的词元对与45,029个空缺位置,能够直接用于训练基于Transformer的模型以探究对观福音书间的文本依赖关系。数据集还详尽标注了每个词元所属的传统类别、文学体裁及跨书卷覆盖关系,为计算历史语言学和数字人文学研究提供了结构化、可复用的基础资源。
使用方法
开发者可通过HuggingFace Datasets库直接加载该数据集,按需调用训练、验证或测试子集。典型应用包括基于词性标注和词形还原的序列标注任务,以及利用词汇对齐信息进行抄本方向检测的文本批评研究。用户可借助datasets.filter()方法依据传统类别或书卷名称快速遴选子集,也可配合Transformers库中的Tokenizer对文本进行掩码语言建模前的预处理。此外,alignments.json辅助文件支持用户将比对结果与词元表格关联,从而在pericope层级进行细粒度的统计分析或模型性能评估。
背景与挑战
背景概述
SynoptiQ Corpus是一个专为对观福音问题(Synoptic Problem)的计算研究而构建的高质量标注数据集,由Ainouche Abderahmane于2026年创建,旨在为古希腊语共观福音书(马太、马可、路加)提供机器可读的细粒度表示。该数据集的核心研究问题在于借助自然语言处理和深度学习模型,从文本对齐与形态分析的角度揭示三部福音书之间的文学依赖关系,进而推动数字人文学科中源批判研究的方法论革新。基于SBLGNT标准文本与MorphGNT形态标注,数据集融合了Aland旁经划分与Needleman-Wunsch全局对齐算法,覆盖近五万个标记和一百七十个旁经段落,成为连接古典语文学与现代计算语言学的桥梁性资源。其对对观福音研究的深远影响体现在:首次以逐词对齐的层级化结构支撑神经网络模型学习抄写方向与编辑倾向,为圣经文本的客观分析提供了可复现的基准。
当前挑战
该数据集所解决的领域挑战主要在于对观福音问题中文学依赖方向的自动推断,传统文本批评依赖学者经验性判断,缺乏可规模化验证的量化模型,而本数据集通过逐词对齐与形态标注使模型能够从平行段落中捕捉词汇与句法层面的抄写模式。构建过程中的挑战则包括:多源异构数据的融合,需将版权不同的SBLGNT文本、形态注释以及Aland旁经编号统一为一致架构;对齐算法的选择与参数调优,固定空位罚分无法完全适配古语文本的语序变异;约百分之四的标记因旁经表覆盖不全而遗漏段落标识,需审慎处理缺失值;此外,形态注释仅采单一家学术分析路径,未涵盖备选解析,限制了数据集的解析多样性。这些挑战要求在使用时注意对齐偏差与范围局限,确保模型评估的严谨性。
常用场景
经典使用场景
在数字人文与新约研究的交叉领域中,SynoptiQ Corpus为探究符类福音书之间的文学依赖关系提供了标准化的计算平台。该数据集以词元级别呈现马太、马可、路加三卷福音书的古希腊语科因文本,融合了MorphGNT的形态学标注与Aland pericope边界划分,并采用Needleman-Wunsch全局比对算法构建了三组两两配对的对齐关系。研究者可借助这些标注直接训练基于Transformer的模型,用于检测文本的抄写方向、编辑倾向及源流关系,从而将传统的符类问题研究纳入可量化、可复现的计算框架。
解决学术问题
该数据集的问世有效回应了新约学术研究中长期存在的两大难题:一是缺乏机器可读、多层级标注的符类福音书语料库,二是传统来源批判方法的可验证性不足。SynoptiQ Corpus通过提供统一的词元对齐与形态学解析,使研究者得以系统性地建模抄经者的编辑模式、文体疲劳现象及文本依赖网络。其在pericope层面实施的分层抽样策略确保了训练-验证-测试集的独立性,为评估模型泛化能力提供了严谨基准。这一资源不仅推动了计算文本批评学的方法论革新,也为数字人文学科中低资源古老语言的自然语言处理研究树立了典范。
衍生相关工作
围绕SynoptiQ Corpus已涌现出若干启发性工作。其中KoineFormer是直接基于该数据集微调的代表性模型,它采用LoRA技术适配GreTa预训练模型于科因古希腊语,并在本语料库上完成了掩码语言模型的评测,验证了pericope分层采样对于下游任务的有效性。未来衍生工作可进一步拓展至跨福音书的文本生成模型,以模拟抄经者的语言风格。在算法层面上,该数据集提供的精准词元对齐图谱也为改进序列比对算法——例如引入基于语义的多序列比对策略——提供了实验依据。此外,基于该语料库的高斯过程与变分推断方法有望揭示符类福音书之间的深层结构性关系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务