遇见数据集

sphragis

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

Sphragis 是一个用于古希腊语作者归属的基准数据集(Beta 0.3.2 版本)。它结合了经过许可、人工注释的依存树库(来自 AGDT 2.1、UD Perseus、UD PROIEL、UD PTNK、Gormans Greek Dependency Trees、Pedalion、Harrington Trees 等)和格律注释的 Hypotactic 语料库(Chamberlain 2023)。数据集提供了固定的训练、验证和测试划分,支持文本分类任务。数据集包含9个配置,分为散文(prose)和诗歌(verse)两大类,每类根据最小样本块大小(1、10、100)分为三种配置。诗歌配置进一步分为句级(verse_sentence)和行级(verse_metre)两种,且成对出现。所有配置的划分均采用随机种子776,并按作者/作品组进行分层抽样,大致保持80%训练、10%验证、10%测试的比例。主要列包括:id、author、work、work_id、genre、text、conllu、cts_urn、passage、treebank_source、source_records、licenses、dedup_key、split。其中 genre 字段仅有三个值:prose、verse_sentence、verse_metre。诗歌配置还包含 metrical_line_ids、metrical_lines、parent_sentence_ids、alignment_component_id 等额外列。去重策略:对散文部分进行了基于归一化文本的精确去重,去除了13,510条重复行,并处理了作者标签冲突。诗歌部分通过严格的边界对齐算法确保行与句子的对应关系。依赖表示方面,保留了原始UD数据,并将AGDT/Arethusa树转换为CoNLL-U格式,同时保留原生关系标签。XPOS被归一化为九位古希腊语AGDT/Perseus标签约定。数据集来源包括多个已知语料库,许可为混合许可(包含非商业和共享许可)。作者归属政策保守,排除了匿名、未知作者、伪作、有争议的作品等,保留的作品如《伊利亚特》、《奥德赛》、赫西俄德的《神谱》和《工作与时日》、埃斯库罗斯的《波斯人》和《七将攻忒拜》等。

Sphragis is a benchmark dataset for authorship attribution in Ancient Greek (Beta 0.3.2). It combines licensed, manually annotated dependency treebanks (from AGDT 2.1, UD Perseus, UD PROIEL, UD PTNK, Gormans Greek Dependency Trees, Pedalion, Harrington Trees, etc.) and a metrically annotated Hypotactic corpus (Chamberlain 2023). The dataset provides fixed train, validation, and test splits for text classification tasks. It includes 9 configurations, divided into prose and verse categories, each with three sub-configurations based on minimum sample chunk sizes (1, 10, 100). The verse configurations are further split into sentence-level (verse_sentence) and line-level (verse_metre) pairs. All splits are stratified by author/work group with a random seed of 776, maintaining roughly 80% train, 10% validation, and 10% test proportions. Main columns include id, author, work, work_id, genre, text, conllu, cts_urn, passage, treebank_source, source_records, licenses, dedup_key, split. The genre field has only three values: prose, verse_sentence, verse_metre. Verse configurations also include additional columns like metrical_line_ids, metrical_lines, parent_sentence_ids, alignment_component_id. Deduplication: exact deduplication based on normalized text for prose, removing 13,510 duplicate rows and resolving author label conflicts. Verse deduplication uses strict boundary alignment algorithms. Dependency representation retains original UD data and converts AGDT/Arethusa trees to CoNLL-U format with native relation labels. XPOS is normalized to the nine-category Ancient Greek AGDT/Perseus tag convention. Data sources include multiple known corpora, with mixed licenses (non-commercial and share-alike). Authorship attribution policy is conservative, excluding anonymous, unknown, pseudepigrapha, and disputed works, while retaining works such as Iliad, Odyssey, Hesiods Theogony and Works and Days, Aeschylus Persians and Seven Against Thebes, etc.

创建时间:
2026-08-17
原始信息汇总

Sphragis 数据集概述

基本信息

  • 数据集名称: Sphragis
  • 语言: 古希腊语 (grc)
  • 许可证: 混合许可证(other),包含非商业性和共享相同方式许可的数据
  • 任务类型: 文本分类(text-classification)
  • 标签: 作者归属(authorship attribution)、古希腊语、CoNLL-U格式、依存句法分析、韵律、格律分析

数据集简介

Sphragis 是一个用于古希腊语作者归属研究的基准数据集(Beta 0.3.2版本),结合了人工标注的依存句法树库和格律标注的Hypotactic语料库,提供固定的训练、验证和测试集划分。

配置与数据规模

数据集包含9种配置,按单元类型和最小作者保留规模(后缀1/10/100)区分:

配置名称 单元 作者数 训练集 验证集 测试集
prose_1 去重后的树库句子 32 33,172 4,146 4,146
prose_10 去重后的树库句子 29 33,051 4,131 4,131
prose_100 去重后的树库句子 12 25,730 3,216 3,216
verse_sentence_1 完整格律对齐的树库句子 5 12,568 1,570 1,570
verse_sentence_10 完整格律对齐的树库句子 4 12,547 1,568 1,568
verse_sentence_100 完整格律对齐的树库句子 2 11,914 1,489 1,489
verse_metre_1 完整句法对齐的扫描行 5 22,922 2,866 2,866
verse_metre_10 完整句法对齐的扫描行 4 22,895 2,862 2,862
verse_metre_100 完整句法对齐的扫描行 2 21,818 2,727 2,727

所有配置均保持约80/10/10的总体划分比例。后缀表示支持的最小文本块规模,_1配置保留完整的精选数据集。

主要数据列

所有配置包含:

  • idauthor(作者)、work(作品)、work_idgenre(体裁)、text(文本)
  • conllu(CoNLL-U格式句法分析)、cts_urnpassagetreebank_source(树库来源)
  • source_records:包含所有上游记录的JSON,含版本、URL、许可证、标注溯源和句法方案
  • licenses(许可证)、dedup_key(去重键)、split(划分标记)

verse_sentence额外包含metrical_line_ids和完整重叠metrical_lines的JSON列表;verse_metre包含parent_sentence_idsbookpoem_sequenceline_number、格律、扫描及音节级标注。两个韵文配置均包含alignment_component_id

genre字段仅有三个值:proseverse_sentenceverse_metre

数据来源

语料库来自以下数据源:

  • AGDT 2.1(Perseus树库)
  • UD Perseus、UD PROIEL、UD PTNK
  • Gorman的希腊语依存树
  • Pedalion树
  • Harrington树
  • Hypotactic(格律标注语料库)

涵盖作品范围

韵文材料涵盖:《伊利亚特》、《奥德赛》、赫西俄德的《神谱》和《工作与时日》、埃斯库罗斯的《波斯人》和《七将攻忒拜》,以及Semonides的作品。有争议的《七将攻忒拜》段落(861-874和1005-1078行)在完整对齐组件边界处被排除。

数据划分方法

划分使用随机种子776,在每个作者/作品组内独立分层,约80%训练、10%验证、10%测试。3-9行的组获得一行验证和一行测试;少于3行的组保留在训练集中。

作者归属政策

基准优先保障可靠的训练标签而非覆盖面。排除了匿名及未知作者、Pseudo-*及传统归属、片段标记作品、公司或媒介作者身份,以及归属存在重大争议的作品或段落。

搜集汇总
数据集介绍
sphragis 数据集图片
构建方式
Sphragis数据集的构建植根于古典语文学与计算语言学的交叉领域,旨在为古希腊语作者归属研究提供标准化基准。其构建过程融合了多源数据,包括人工标注的依存树库(如AGDT、UD Perseus等)以及格律标注的Hypotactic语料库。通过严格的包含规则,仅保留树库与格律注释在归一化文本上完全对齐的连续片段,并排除争议性作者及作品,确保标注的可靠性与纯净度。数据集按最小语料块大小(1、10、100)划分出九个配置,涵盖散文与韵文两种体裁,并采用固定的随机种子进行分层划分,形成80/10/10的训练、验证与测试集。
使用方法
该数据集通过HuggingFace Datasets库便捷加载,用户可按需选择特定配置,如`prose_10`或`verse_metre_100`。每个配置均预设了标准的训练、验证与测试划分,便于直接进行文本分类或作者归属任务的模型训练与评估。由于行级记录未预先合并,研究者可动态构建任意长度的文本块,灵活适配不同粒度的分析需求。对于韵文数据,`verse_metre`配置包含格律扫描及音节级注释,可用于韵律分析或跨模态任务;而`verse_sentence`配置则关联对应的格律行,便于探索句法与格律的交互。所有数据均附带完整的许可及溯源信息,遵循各源数据的合规要求。
背景与挑战
背景概述
Sphragis数据集诞生于古典语文学与计算语言学交叉的前沿领域,由来自Urdatorn的研究团队于2023年构建,旨在为古希腊语 authorship attribution(作者归属)任务提供首个系统化的基准测试平台。该数据集整合了带人工标注的依存句法树库与基于格律注释的Hypotactic语料库,覆盖散文与诗歌两大文体,包含九种配置,支持从句子到篇章的多粒度分析。其核心研究问题在于,如何利用语言结构与格律信息精准区分古典文本的作者身份,从而推动数字人文学科中文本归因研究的方法论革新。作为Beta版本,Sphragis的发布不仅为后续的最终版本设计奠定了基础,更在古典语料库构建领域树立了新的标杆,其严谨的拆分策略与详尽的数据溯源记录,为相关研究提供了可复现且高可信度的数据支撑。
当前挑战
Sphragis数据集面临的挑战多维且深刻。在领域问题层面,古希腊语作者归属任务本身便受限于文本的碎片化、作者风格的交叠以及历史传承中的文本变异,尤其对于争议性文本(如伪作或合作作品)的判定,需要算法具备超越表面词汇特征的文化与历史洞察力。在数据构建过程中,团队需应对跨多个树库资源(如AGDT、UD)的格式统一与依存关系映射的复杂性,确保格律与句法对齐的精确性,同时处理因版本差异导致的重复文本与作者标签冲突。此外,混合许可证与非商业限制、争议性作者作品的审慎取舍,以及训练、验证、测试集在保证统计均衡与作者独立性的双重约束,共同构成了数据构建的严密挑战,体现了基准测试严谨性与实际语料复杂性之间的平衡艺术。
常用场景
经典使用场景
Sphragis数据集是专为古希腊语作者归属判定(authorship attribution)设计的基准测试集,其核心应用场景在于文本分类任务。该数据集整合了人工标注的依存句法树库与格律标注的Hypotactic语料,提供了多种配置(如prose_1、verse_sentence_100等),分别针对散文和韵文的不同粒度(句子或诗行)进行划分,支持研究者构建跨句法、格律信息的作者识别模型。通过固定的训练、验证和测试集划分,Sphragis为古希腊语文学计算研究提供了标准化、可复现的实验平台,尤其适合评估算法在古典文本上的泛化能力。
解决学术问题
该数据集有效解决了古典语文学中长期存在的作者身份争议问题,特别是在作品归属模糊、传统 attribution 存在分歧的场景下。通过保守的作者标注策略,排除了匿名、伪作及争议段落,确保了训练标签的可靠性,为计算语言学提供了高质量的金标准。其学术意义在于,首次将依存句法树与格律注释进行精确对齐,使得研究者能够同时利用句法结构和韵律特征进行作者风格分析,推动了数字人文学科中文体计量学(stylometry)的发展,并为跨文本的语体变异研究奠定了数据基础。
实际应用
在实际应用中,Sphragis支持多种下游任务,如自动作者识别系统、古典文献的数字编辑与校勘,以及教育领域中的古典文本辅助分析工具。图书馆和数字人文项目可利用其进行文本归属的初步筛选,辅助学者处理存疑文献。此外,该数据集的格律注释(scansion)可用于诗歌朗诵的自动生成或教学中的韵律分析,其依存句法结构则服务于古典希腊语的语法解析和机器翻译研究。其模块化配置设计(如按最小文本块大小筛选)便于适应不同计算资源和研究需求。
数据集最近研究
最新研究方向
在数字人文学科与计算语言学交叉领域,古希腊语作者归属研究正依托大规模、多模态标注语料库的构建而迈向新阶。Sphragis基准数据集以其精细的语篇分层、严谨的作者过滤策略及对争议文本的审慎处理,为自然语言处理模型在古典语言风格分析、句法依存与韵律对齐等前沿课题提供了标准化评估平台。该数据集整合了人类标注的依存树库与格律注释语料,不仅推动了作者身份鉴定技术的鲁棒性检验,亦为探索古希腊文学作品中句法结构与韵律模式的共变关系开辟了实证路径。其设计理念强调数据可复现性与来源透明度,响应了计算古典学领域对高质量、规范化基准的迫切需求,对促进跨学科合作与文化遗产的数字化研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务