遇见数据集

ganjoor-ipa-scansion

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集名为“Ganjoor波斯古典诗歌——韵律与音位转写”,包含从Ganjoor API收集的124,404首古典波斯诗歌,并为每首诗增加了两种信息:1) 韵律格律(阿鲁兹/瓦兹恩),包括格律脚和二进制韵律扫描,其中约21%原本未标注的诗歌通过波斯脚重建获得;2) 音位转写,使用Homo-GE2PE模型将每个半句转换为拉丁字母和IPA音标。数据集包含225位诗人,共1,437,436联句(2,874,436个半句),涵盖16种基本格律。每行代表一首诗,存储为原生嵌套列表结构,包含诗ID、诗人ID、诗人名称(波斯语和拉丁语)、标题、Ganjoor URL、联句数、韵律元数据(包括节奏ID、格律字符串、名称、基本格律、波斯脚、拉丁脚扫描、韵律扫描、来源和已知标志)以及诗句列表(每个联句包含索引、波斯语文本、两种转写表示和IPA)。适用任务包括文本生成、波斯诗歌分析、字素到音素转换、韵律分析等。数据集采用CC BY 4.0许可,诗歌本身属于公共领域。

This dataset, titled "Ganjoor Persian Classical Poetry — Meter and Phonetic Transcription", contains 124,404 classical Persian poems collected from the Ganjoor API. Two types of supplementary information are provided for each poem: 1) Prosodic meters (Aruz/Arūḍ / Vazn), including metrical feet and binary prosodic scans; approximately 21% of the originally unannotated poems were reconstructed via Persian prosodic feet. 2) Phonetic transcriptions: the Homo-GE2PE model is used to convert each hemistich into Latin script and IPA phonetic transcription. The dataset covers 225 poets, with a total of 1,437,436 couplets (2,874,436 hemistichs) and encompasses 16 basic meters. Each entry represents a single poem, stored as a native nested list structure containing: poem ID, poet ID, poet names (Persian and Latin), title, Ganjoor URL, number of couplets, prosodic metadata (including meter ID, meter string, name, basic meter, Persian feet, Latin foot scan, prosodic scan, source, and known flag), as well as a list of verses (each couplet contains index, Persian text, two transcription representations, and IPA). Applicable tasks include text generation, Persian poetry analysis, grapheme-to-phoneme conversion, prosodic analysis, and more. The dataset is licensed under CC BY 4.0, while the poems themselves are in the public domain.

创建时间:
2026-07-29
原始信息汇总

数据集概述

名称: Ganjoor Persian Classical Poetry — Meter & Phonemic Transliteration
地址: https://huggingface.co/datasets/nafisehNik/ganjoor-ipa-scansion
许可证: CC BY 4.0
语言: 波斯语(fa)、阿拉伯语(ar)
任务类别: 文本生成
标签: 波斯语、诗歌、古典波斯语、Ganjoor、字素到音素转换、G2P、音素化、IPA、音译、韵律学、诗律、阿鲁兹、瓦兹恩
数据规模: 100K<n<1M


核心内容

该数据集包含 124,404 首古典波斯诗歌,通过 Ganjoor API 收集,并为每首诗补充了以下两类信息:

  1. 韵律学信息(ʿarūż / vazn):包括每个诗歌的格律脚(metrical feet)和二进制韵律分析(binary scansion),其中约 21% 的诗歌原本未被 Ganjoor 标记韵律,此处根据波斯格律脚进行了重建。
  2. 音素转写:每半句(hemistich)均有拉丁字母和 IPA 两种音素转写,由 Homo-GE2PE 字素到音素模型生成。

数据集中每一行对应一首诗,诗句以嵌套的 list<struct> 原生类型存储,完整保留结构。


快速统计

项目 数值
诗歌数量(行数) 124,404
诗人数量 225
诗句数量(beyts) 1,437,436
半句数量(mesraʿ) 2,874,436
不同基础格律 16

数据加载方式

支持直接使用 Hugging Face datasets 库加载:

python from datasets import load_dataset

ds = load_dataset("nafisehNik/ganjoor-vazn-phonemes", split="train") ds[0]["meter"]["scansion"] # 例如 u––– u––– u–– ds[0]["verses"][0]["ipa_1"] # 第一半句的音素 IPA

也可通过 PyArrow 直接读取 Parquet 文件(文件按 base_meter_part=<meter> 进行 Hive 分区)。


数据模式(Schema)

顶层字段(每行对应一首诗)

列名 类型 描述
poem_id int64 Ganjoor 诗歌 ID
poet_id int32 Ganjoor 诗人 ID
poet_name_fa string 诗人姓名(波斯语)
poet_name_lat string 诗人姓名(拉丁字母拼音)
title string 诗歌标题(波斯语)
poem_url string Ganjoor 网站上的原始 URL
verse_count int32 诗句(beyt)数量
meter struct 韵律学元数据,详见下表
verses list<struct> 诗节数据,详见下表
corpus string 固定值为 "ganjoor"
translit_model string 固定值为 "homo-ge2pe"

meter 结构体字段

字段名 类型 描述
rhythm_id int32 Ganjoor 韵律 ID
rhythm_fa string 完整的波斯语格律字符串(音步 + 名称)
rhythm_name_fa string 波斯语格律名称
rhythm_name_lat string 拉丁语格律名称(如 hazaj maḥẕūf
base_meter string 基础格律家族(如 hazajramalrubāʿī
feet_fa list<string> 波斯语格律脚(arkān),如 ["مفاعیلن","مفاعیلن","فعولن"]
feet_lat list<string> 每个音步的韵律分析,˘=短音节 ¯=长音节 ˜=可长可短
scansion string 扁平化的韵律分析,u=短音节 =长音节 x=可长可短
source string feet_lat 来源:ganjoorderived
known bool 拉丁格律是否已解析(此处始终为 true

verses[] 结构体字段(每个元素对应一个 beyts,每个 beyts 含两个半句 _1 / _2

字段名 类型 描述
verse_index int32 在诗歌中的 0 基位置
fa_1, fa_2 string 半句 1 / 半句 2 的原始波斯语文本
repr1_1, repr1_2 string Homo-GE2PE 的表示形式 1(罗马化)
repr2_1, repr2_2 string Homo-GE2PE 的表示形式 2(模型原始输出)
ipa_1, ipa_2 string 音素 IPA 转写

构建方法

  • 数据来源:通过 Ganjoor API 获取诗歌及其格律元数据。
  • 格律解析:Ganjoor 为约 79% 的诗歌提供了 feet_lat;对于其余约 21% 仅有波斯语格律脚(feet_fa)的诗歌,利用已标注部分的参考数据,逐音步重建拉丁格律分析,并针对行尾的可变音节(anceps)进行位置感知处理。最终所有诗歌均获得拉丁格律分析,meter.source 字段标记来源为 ganjoorderived
  • 音素转写:每个半句通过 Homo-GE2PE(在 HomoRich 数据集上微调的 T5 模型,用于同形异义词消歧)生成 "表示形式 2";repr1ipa 由 "表示形式 2" 确定性映射得到。

转写表示示例

波斯语 repr2 repr1 ipa
شهر $/hr Sahr ʃæhr
دوست dust dust duːst

已知限制

  • 阿拉伯语诗句:部分诗歌(例如 tadhkira 类文本)中包含阿拉伯语书写行,这些行同样由同一波斯语 G2P 模型进行音素转写。

许可与致谢

  • 许可协议:CC BY 4.0。
  • 诗歌版权:内容为公有领域(古典波斯诗人已远超版权保护期限),Ganjoor 不主张版权并公开其数据库。
  • 致谢

引用

若使用此数据集,请引用 Ganjoor 作为文本来源,并引用相关论文(引用信息见原始页面)。

搜集汇总
数据集介绍
ganjoor-ipa-scansion 数据集图片
构建方式
该数据集基于Ganjoor API系统收集了124,404首波斯古典诗歌,并针对每首诗进行了两项核心增强:韵律格律(aruz/vazn)标注与音位转写。韵律标注方面,对于Ganjoor已提供格律脚的约79%诗歌直接采用原有数据,而对于缺失的约21%,则依据已标注部分学习参考模型,结合波斯格律脚近乎固定的音长模式,逐脚重建格律,并特别处理行末的anceps位置,最终为每首诗生成拉丁转写的格律标记,并记录来源。音位转写方面,每个半句通过Homo-GE2PE(基于T5的G2P模型)生成音位表示,模型输出原生符号集repr2,再确定性映射为替代罗马化repr1和宽式音位IPA。所有数据以Hive分区Parquet格式存储,每行对应一首诗,诗句以嵌套list<struct>形式保留完整结构,字段类型明确标注。
特点
数据集规模宏大,涵盖225位诗人的1,437,436联诗句和2,874,436个半句,具备丰富的层次化结构。每条记录包含诗作元数据(诗人、标题、URL)、韵律结构(包括节奏ID、波斯语/拉丁语格律名、基米、格律脚及扫描标记)以及逐联的音位转写(波斯原文、两种罗马化表示和IPA)。韵部信息中,base_meter区分了16种基础格律类型,feet字段提供了波斯语和拉丁语对照,scansion以简洁符号(u、–、x)呈现。转写部分,repr1、repr2与IPA三种表示并存,便于不同应用场景。数据分区依据base_meter,便于按格律筛选。此外,数据集明确标注了韵律来源(ganjoor或derived),且所有诗歌的拉丁格律均已解析,保证了完整性。
使用方法
该数据集可通过HuggingFace datasets库直接加载,使用load_dataset("nafisehNik/ganjoor-vazn-phonemes", split="train")即可获取,每一行是一首诗,访问meter.scansion获取格律,访问verses[0].ipa_1获取首个半句的IPA。亦可用PyArrow直接读取Parquet文件,Hive分区允许按base_meter_part列进行高效过滤。适用于多种自然语言处理任务,如古典诗歌的格律分析、文本生成(给定格律生成诗作)、音位转写研究(G2P)、诗体分类(基于base_meter)以及诗作搜索(按韵脚或格律)。数据以CC BY 4.0协议发布,诗歌文本属于公有领域,使用时需注明Ganjoor为文本来源及Homo-GE2PE为转写模型。
背景与挑战
背景概述
在计算诗学与自然语言处理的交叉领域,古典波斯诗歌的韵律与音系结构研究长期面临数据匮乏的困境。此数据集由研究者于2024年构建,依托伊朗数字人文项目Ganjoor的开放API,汇聚了124,404首古典波斯诗歌,覆盖225位诗人及逾140万联句,系统性地补充了约21%此前缺失的诗歌韵律标注,并引入基于Homo-GE2PE模型的音位转写。该资源旨在弥合传统诗律学中‘阿鲁兹’韵律体系与现代计算分析之间的鸿沟,为韵律自动识别、诗歌生成及跨语言诗学比较提供了大规模、结构化的基准,显著推动了数字人文学科中对波斯文学遗产的量化研究。
当前挑战
该数据集应对的核心挑战源于古典波斯诗歌韵律的复杂性和数据构建的技术壁垒。领域层面,波斯诗歌采用基于音节长短的‘阿鲁兹’韵律,其独特于音节结构,存在众多韵律变体及‘安塞普斯’等不确定位置,使得从文本自动推断韵律尤为困难;同时,阿拉伯语借词及方言差异加剧了音位转写的不确定性。构建层面,尽管Ganjoor提供了约79%诗作的韵律脚标注,剩余部分需从波斯语韵律脚出发,结合已标注样本习得的参考模式进行重构,并需精细处理行尾位置的安塞普斯。此外,音位转写模型需应对波斯语中大量同形异义词,通过基于T5的G2P模型进行消歧,其原生符号集还需经确定性映射以生成标准IPA,这一系列环节共同构成了数据构建中的主要挑战。
常用场景
经典使用场景
该数据集以波斯古典诗歌的韵律与音位转写为核心,为计算诗学、数字人文及自然语言处理研究提供了大规模、结构化的语料支撑。其经典使用场景聚焦于韵律学(ʿarūż)的自动分析与生成,涵盖格律识别、韵律脚(arkān)标注、以及基于二进制韵律模式(如u/–/x)的诗歌结构解析。研究者可借此数据集训练模型,实现从波斯文诗句到拉丁转写及IPA音位序列的端到端映射,进而推动韵律感知的诗歌生成、机器翻译中诗歌韵律保持,以及跨语言诗歌风格迁移等前沿课题。
衍生相关工作
该数据集的衍生工作已催生多个研究方向。其韵律标注与音位转写的一体化设计,启发了将诗歌生成任务与韵律控制耦合的序列到序列模型,如韵律条件化的GPT式波斯语诗歌生成器。同时,基于其全标注的韵律脚序列,学术界发展出韵律不变式表示学习,用于跨韵律的诗歌风格转换与抄袭检测。此外,该数据集亦成为评估波斯语音位转换(G2P)系统性能的基准,促进了对同音词消歧算法的持续改进,并间接推动了多语种诗歌韵律建模的联合训练框架的出现。
数据集最近研究
最新研究方向
该数据集聚焦于波斯古典诗歌的韵律与音位转写,代表了数字人文与计算诗学的前沿交叉方向。其核心创新在于将格律(ʿarūż)分析与字素-音素转换(G2P)技术融合,构建了覆盖12.4万首诗歌的大规模语料库。当前研究热点包括:利用深度学习模型自动重建缺失的韵律标注,提升对非标准阿拉伯语诗句的处理能力;结合多模态数据(如手稿、语音)开展跨语言诗歌比较研究;以及探索韵律特征在诗歌风格分类、作者身份识别中的应用。该数据集的开放性与规范性为波斯语自然语言处理、古典文献数字化及计算文学研究提供了宝贵资源,推动文本分析从语义层面向语音与节奏维度深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务