遇见数据集

sphragis-metre

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

Sphragis Metre 是 Urdatorn/sphragis 数据集的扫描行版本,专为古希腊语作者归因任务设计。该数据集结合了人工韵律标注与依存句法标注,支持从精确的1行、10行和100行单元进行作者归属分析。数据涵盖15位古希腊诗人(包括埃斯库罗斯、阿波罗尼乌斯、阿拉图斯、卡利马科斯、赫西奥德、荷马(伊利亚特)、荷马(奥德赛)、吕科弗隆、尼坎德、诺努斯、奥皮安、品达、昆图斯·斯米纳乌斯、忒奥克里托斯、忒奥格尼斯),共计84,300行原子行,并按固定比例划分训练集(68,500行)、验证集(7,900行)和测试集(7,900行)。数据集提供三个配置:verse_metre_1(每行一个样本)、verse_metre_10(每10行一个块)、verse_metre_100(每100行一个块),所有配置共享相同的源行。每个样本包含文本(text)、CoNLL-U格式的依存句法分析(conllu)、韵律标注(metre)以及音节级人工标注(syllables)。句法标注部分来自黄金树库,部分由预训练模型预测,并标注了来源。数据集的构建过程保留了原始音节转录,并对所有结果进行了CoNLL 2018加载器验证。该数据集适用于文本分类任务,特别是古希腊诗歌的作者归因研究。

Sphragis Metre is a scanned line version of the Urdatorn/sphragis dataset, designed for authorship attribution of ancient Greek texts. It combines manual prosodic annotations with dependency syntactic annotations, supporting authorship analysis from precise units of 1 line, 10 lines, and 100 lines. The dataset covers 15 ancient Greek poets (including Aeschylus, Apollonius, Aratus, Callimachus, Hesiod, Homer (Iliad), Homer (Odyssey), Lycophron, Nicander, Nonnus, Oppian, Pindar, Quintus Smyrnaeus, Theocritus, Theognis), totaling 84,300 atomic lines, divided into training set (68,500 lines), validation set (7,900 lines), and test set (7,900 lines) with a fixed ratio. It provides three configurations: verse_metre_1 (one sample per line), verse_metre_10 (a block of 10 lines), and verse_metre_100 (a block of 100 lines), all sharing the same source lines. Each sample contains text, CoNLL-U format dependency parsing (conllu), prosodic annotation (metre), and syllable-level manual annotations (syllables). Part of the syntactic annotations come from a gold treebank, and part are predicted by a pre-trained model, with sources indicated. The construction process preserves the original syllable transcription, and all results are validated by the CoNLL 2018 loader. The dataset is suitable for text classification tasks, especially authorship attribution of ancient Greek poetry.

创建时间:
2026-08-22
原始信息汇总

Sphragis Metre 数据集概述

基本信息

  • 数据集名称:Sphragis Metre
  • 语言:古希腊语(grc)
  • 许可证:其他(other)
  • 任务类别:文本分类(text-classification)
  • 标签:作者归属(authorship-attribution)、古希腊语(ancient-greek)、CoNLL-U格式(conllu)、格律(metre)

数据集简介

Sphragis Metre 是 Urdatorn/sphragis 数据集的扫描行(scanned-line)配套版本,通过结合人工格律注释与依存注释,支持基于精确的1行、10行和100行单位的古希腊语作者归属研究。数据集保留了黄金树库(gold treebank)分析(在精确对齐允许的情况下),其余经过整理的 Hypotactic 段落则使用固定的 Ericu950/Stoicheia-tagger-parser 检查点进行解析。

配置与规模

配置 作者数 行单位 训练行数 验证行数 测试行数
verse_metre_1 15 扫描行 68,500 7,900 7,900
verse_metre_10 15 10行块 6,850 790 790
verse_metre_100 15 100行块 685 79 79

所有分割均固定在配置后缀上。_1_10_100 包含完全相同的源行总数;基于种子的余数移除由100行任务决定,并在各任务规模间复用。

作者标签与行数分布

15个保留标签为:Aeschylus、Apollonius Rhodius、Aratus、Callimachus、Hesiod、Homeric-Iliad、Homeric-Odyssey、Lycophron、Nicander、Nonnus、Oppian、Pindar、Quintus Smyrnaeus、Theocritus 和 Theognis。

诗人标签 训练 验证 测试 总计
Aeschylus 1,600 200 200 2,000 (2.4%)
Apollonius Rhodius 4,600 500 500 5,600 (6.6%)
Aratus 900 100 100 1,100 (1.3%)
Callimachus 1,100 100 100 1,300 (1.5%)
Hesiod 1,400 100 100 1,600 (1.9%)
Homeric-Iliad 12,500 1,500 1,500 15,500 (18.4%)
Homeric-Odyssey 9,600 1,200 1,200 12,000 (14.2%)
Lycophron 1,100 100 100 1,300 (1.5%)
Nicander 1,200 100 100 1,400 (1.7%)
Nonnus 17,100 2,100 2,100 21,300 (25.3%)
Oppian 4,500 500 500 5,500 (6.5%)
Pindar 2,700 300 300 3,300 (3.9%)
Quintus Smyrnaeus 7,000 800 800 8,600 (10.2%)
Theocritus 2,100 200 200 2,500 (3.0%)
Theognis 1,100 100 100 1,300 (1.5%)
所有诗人 68,500 7,900 7,900 84,300 (100.0%)

数据表示

  • textconllumetre 是 JSON 列表,每个组成行对应一个元素。
  • syllables 是嵌套 JSON 列表:外层列表按相同顺序包含行,每个内层列表包含该行的音节。
  • 原子 _1 行包含一个外层元素,而 _10_100 保留10或100个可明确区分的行,而非扁平化音节。
  • 每个黄金 CoNLL-U 单元被裁剪到对应的格律行。对于没有黄金树的段落,先跨连续格律行重建标点分隔的句子,并使用 Stoicheia 完整解析。每个句子树再裁剪回其组成行的边界。因此,行断点不会成为人为的解析器句子边界。
  • 如果一行包含多个句子的内容,其单个 JSON conllu 单元按顺序包含这些有效的 CoNLL-U 句子块。上下文窗口回退分割(如有需要)仅发生在行之间。
  • 所有结果均使用官方 CoNLL 2018 加载器验证。
  • syllables 包含人工音节级格律注释。源 Hypotactic HTML 中音节后的字面空白保留为该音节 features 列表中的 caesura 成员;行末音节从不接收该标记。冗余的 scansion 字段未发布。
  • 源音节转录被保留而非静默纠正。14行保留行包含上游文本-音节转录不匹配;此审计计数记录在 metadata/build_report.json 中。
  • syntax_annotation 对于原子行为 goldpredicted,对于块可能为 mixed
  • treebank_sourcesource_records 提供确切来源,对于预测行,固定 Stoicheia 修订版本 cd8ae1658c364874c3b6f4df37bd1d46313e3cea
  • 在共享100行瓶颈后,_1 包含28,183行黄金语法行和56,117行预测语法行。

使用注意事项

黄金和预测的依存分析在方法上不完全相同。当作者的黄金覆盖率不同时,使用 conllu 的模型可能学习到注释来源伪影。因此,结果应报告是否使用了语法;建议将仅格律/文本分析及按来源分层分析作为对照。

元数据与来源

模型面对的 CoNLL-U 注释和 MISC 字段不包含句子ID、CTS URN、源文件名、作者或作品标题。完整的审计溯源信息保留在专用元数据列中。源修订版本、分割清单、排除项和验证结果记录在 metadata/ 目录下。

加载方式

python from datasets import load_dataset

metre = load_dataset("Urdatorn/sphragis-metre", "verse_metre_10")

搜集汇总
数据集介绍
sphragis-metre 数据集图片
构建方式
该数据集作为古典语文学与计算语言学交叉领域的创新性资源,旨在支撑古希腊语 authorship attribution 任务。其构建基于对15位诗人(涵盖荷马史诗至教谕诗等)作品的精密处理,将原始文本按照1行、10行及100行的粒度切分为独立单元,形成三种配置。每一行的文本均配备对应的 CoNLL-U 依存句法标注与人工校订的韵律音节标注。对于缺乏金标准句法树的部分,则利用固定的 Stoicheia 解析器进行预测,并严格确保行边界与句子边界的一致性,避免人为切分造成的语法断裂。所有数据经过官方 CoNLL 2018 验证器校验,保证了标注的规范性与可靠性。
使用方法
数据集以HuggingFace datasets库直接加载,例如`load_dataset("Urdatorn/sphragis-metre", "verse_metre_10")`即可获取10行粒度的数据。每条记录包含`text`、`conllu`、`metre`、`syllables`等字段,均为JSON列表,对应每行或聚合块。用户可根据任务需求选择不同配置:`verse_metre_1`用于逐行级分析,`verse_metre_10`与`verse_metre_100`则适用于篇章级特征提取。由于gold与predicted句法标注存在方法学差异,建议在使用`conllu`特征时进行来源分层控制,或仅采用文本与韵律特征以避免标注伪影。数据集内metadata目录提供了详细的构建报告与审计信息,便于用户深入理解数据构成。
背景与挑战
背景概述
Sphragis Metre数据集由Urdatorn团队创建,旨在支持古希腊语文学作品的作者归属研究,通过结合人类韵律标注与依赖句法标注,为精准的文本分析提供基础。该数据集涵盖了15位古代诗人(如荷马、品达等)的84,300行诗句,并提供了1行、10行和100行三种粒度的配置,以适应不同尺度的分析需求。其核心研究问题在于利用韵律特征进行作者识别,这在古典语文学中具有重要意义,因为韵律是古希腊诗歌风格的重要标志。该数据集的发布为计算语言学与古典学交叉领域提供了宝贵资源,推动了基于韵律的作者归属方法的发展,对后续研究具有开创性影响。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,古希腊诗歌的作者归属极具难度,因为不同诗人的风格可能相似,且文本传承过程中可能产生变异,导致韵律特征不够显著。其次,在构建过程中,数据集的创建需整合多种来源的文本,处理文本与音节转录的不一致(如14处不匹配),并确保句法解析的准确性,尤其在没有金标准(gold treebank)的段落中,依赖预测模型可能引入偏差。此外,不同作者的金标准句法覆盖率不同,可能导致模型学习到注释来源的伪影。最后,数据集的规模与类别不平衡(如荷马与诺努斯占比高)也是挑战,需要谨慎设计实验以避免偏颇结果。
常用场景
经典使用场景
该数据集聚焦于古希腊语诗歌的格律与作者归属分析,为古典语文学与计算语言学的交叉研究提供了独特资源。其核心使用场景在于基于精确的格律标注(如音节划分、诗行断句)进行文本分类任务,尤其适用于作者归属(authorship attribution)研究。数据集提供了1行、10行和100行三种粒度的配置,支持从微观到宏观的多尺度分析,便于研究者探索格律特征对作者身份识别的贡献。
解决学术问题
该数据集解决了古希腊语诗歌研究中长期存在的作者归属难题,尤其是面对残缺或匿名文本时,传统基于词汇或句法特征的方法往往受限于数据稀疏性。通过融合人工格律标注与依存句法分析,数据集为模型提供了丰富的语言学特征,有助于区分风格相近的诗人(如荷马史诗与赫西俄德)。其固定划分的训练/验证/测试集确保了实验的可重复性,推动了文本分类方法在古典语料上的标准化评估,对计算语文学的实证研究具有重要方法论意义。
实际应用
在实际应用中,该数据集可用于数字人文项目中的自动作者识别工具开发,帮助古典学者快速标注或鉴定新发现的残篇。例如,针对博物馆或图书馆的未署名纸草文献,模型可基于格律模式辅助判断其可能归属。此外,数据集中的依存句法注释可用于构建古希腊语教学资源,或为古籍数字化平台提供高质量的句法分析支持,促进古典文献的智能检索与深度挖掘。
数据集最近研究
最新研究方向
随着数字人文与计算语言学的深度融合,古典语料库的智能解析成为前沿热点。Sphragis Metre数据集开创性地将古希腊诗歌的格律标注与依存句法相结合,为作者归属这一经典难题提供了跨尺度(1行、10行、100行)的精细数据支撑。其设计兼顾了人类学者的金标准与自动化解析的扩展性,并巧妙规避了句法来源差异对模型训练的潜在干扰。该资源不仅推动了低资源古典语言建模的基准建立,也为探究史诗、戏剧等文类的计量风格特征开辟了新路径,对理解古希腊文学传统的量化演进具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务