ganjoor-data
收藏数据链接:
官方服务:
资源简介:
Ganjoor诗歌内容的数据集导出,包含诗人、分类和诗歌,不包含用户账户相关数据(评论、书签、编辑历史等)。当前追踪234位诗人、132591首诗。
Dataset export of poetry content from Ganjoor, which includes poet information, poetic categories and individual poems, and excludes all user account-related data such as comments, bookmarks, and edit histories. Currently, this dataset covers 234 poets and a total of 132,591 poems.
创建时间:
2026-08-14
原始信息汇总
数据集概述
该数据集是Ganjoor诗歌网站的公开、Git追踪导出内容,包含波斯诗歌的诗人、分类和诗作,不包含任何与用户账户相关的数据(如评论、书签、编辑历史等)。数据集由GanjoorService生成,当前追踪234位诗人和132591首诗作,生成时间为2026年8月16日。
数据集内容
- 诗人信息:ID、昵称、路径
- 诗作分类:诗歌分类结构
- 诗作内容:完整的诗歌文本
使用指南
manifest.json:包含所有诗人的完整列表(ID、昵称、路径),以及数据集的模式版本和其他文件类型的URL模板,是构建客户端时的起点。API.md:说明如何通过HTTPS(通过jsDelivr)获取任何数据,包括如何将纯数字ID解析为路径。
未包含内容
- 评论、书签、阅读历史、编辑/更正历史以及任何与用户账户关联的数据均不包含在内。各文件类型包含与不包含的内容详见
API.md。
在线演示
该数据集支持一个完全基于此数据构建的最小阅读应用,完全在浏览器端运行,无需服务器。可访问演示页面体验。
其他说明
- 数据集是从GanjoorService导出的,如需了解导出该数据的应用程序或要在本地使用此数据运行自己的Ganjoor副本,请参阅该仓库。
搜集汇总
数据集介绍

构建方式
该数据集源自Ganjoor诗歌库的公开内容,通过GanjoorService导出并经由Git版本控制追踪。构建过程中严格过滤,确保不包含任何与用户账户关联的数据,如评论、书签、编辑历史等,仅保留诗人、分类和诗歌等核心文学内容。数据集以结构化的JSON格式组织,包含manifest.json清单文件,列出全部诗人的ID、笔名及路径,并提供统一资源标识符模板,便于程序化访问。目前涵盖234位诗人及132591首诗歌,生成时间戳明确,保证了数据的时效性和可追溯性。
使用方法
使用者可从manifest.json入手,获取诗人ID与路径的映射关系,进而通过API.md中定义的HTTPS请求模板,利用数值ID解析对应资源。数据支持纯客户端解析,可在浏览器环境中直接加载,便于构建轻量级阅读应用或进行离线分析。对于开发者,可借助jsDelivr加速数据访问,无需自建服务器。此外,该数据集允许本地化部署,通过GanjoorService复现完整Ganjoor实例,满足个性化需求。使用时应严格遵守许可条款,确保数据用途的合规性。
背景与挑战
背景概述
ganjoor-data数据集由Ganjoor项目团队创建,旨在提供波斯诗歌的公共、可追踪的开放数据资源。该数据集于2026年8月16日生成,包含234位诗人和132,591首诗歌,覆盖了从古典到现代的广泛波斯文学作品。作为Ganjoor.net网站内容的精简导出,数据集剔除了所有与用户账户相关的数据,如评论、书签和编辑历史,确保了数据的纯净性和隐私合规性。该数据集的核心研究问题在于为自然语言处理、计算文学和数字人文领域提供结构化的波斯诗歌语料,支持诗歌分类、韵律分析、作者识别等研究。其影响力体现在为全球研究者提供了一个统一、可访问的波斯诗歌数据基准,促进了跨学科研究的发展,并推动了波斯文化遗产的数字化保存与传播。
当前挑战
ganjoor-data数据集面临的挑战涵盖多个层面。在领域问题方面,波斯诗歌的复杂韵律、隐喻和语义多样性对自然语言处理模型提出了高要求,现有技术难以完全捕捉诗歌的深层美学和语境特征,导致自动分类和情感分析等任务精度受限。在构建过程中,团队需处理大规模文本的清洗与标准化,以消除拼写变体、历史语域差异和手稿勘误带来的噪声;同时,确保数据集的版权合规和隐私保护,严格过滤用户生成内容,这对数据治理架构提出了严格的技术与伦理标准。此外,持续更新的数据版本(如当前生成的日期)要求维护高效的版本控制与分发机制,以确保研究可复现性和数据一致性。
常用场景
经典使用场景
ganjoor-data数据集作为波斯诗歌数字人文研究的基石,其经典使用场景在于构建轻量级的诗歌阅读应用与文本分析工具。凭借其结构化、无用户关联数据的特性,研究者可依托manifest.json清单快速定位234位诗人及逾13万首诗歌的元数据,进而开发客户端应用或进行语料库建设。该数据集通过纯HTTPS接口即可访问,无需服务器支持,极大降低了技术门槛,使文学研究者能够便捷地进行诗歌检索、分类与版本对比,成为波斯文学数字化的标准数据源。
解决学术问题
该数据集有效解决了波斯诗歌领域数字化资源分散、元数据不统一及访问受限等核心学术难题。通过提供公开、git追踪且定期更新的结构化语料,它支持了大规模诗篇的计量分析、诗人创作风格的历史演变研究以及诗歌互文性探索。其不含用户关联数据的严格过滤机制,保障了文本纯粹性,规避了隐私伦理争议,为文学计算、语料库语言学及数字人文学科提供了可靠、可复现的基础设施,推动了波斯诗歌研究的量化与实证转向。
实际应用
在实际应用层面,ganjoor-data数据集驱动了多种波斯诗歌数字产品与服务。其轻量级设计支持在浏览器端运行的纯客户端阅读应用,如演示版مینگنجور,无需后端即可实现流畅的诗歌浏览体验。此外,数据集的公开性和版本控制特性,使其成为教育平台、移动应用及诗歌推荐系统的底层语料来源。在文化遗产保护领域,该数据集亦被用于构建高保真数字档案,辅助诗歌的语音合成与多语言翻译,显著拓展了波斯诗歌的全球传播与可及性。
数据集最近研究
最新研究方向
在数字人文与波斯古典文学研究交汇的前沿,ganjoor-data作为一份纯净、结构化的波斯诗歌语料库,正驱动着多维度创新。其最新研究方向聚焦于利用该数据构建无服务器化的小说阅读应用,实现浏览器端的即时交互,展现了开放数据在文化传播中的巨大潜力。与此同时,研究者们依托其涵盖234位诗人、逾13万首作品的庞大文本集,结合自然语言处理与机器学习技术,探索波斯诗歌的风格计量学、情感分析与主题建模,旨在揭示文学演变的内在规律。该数据集的公开性与可追溯性,为跨学科合作提供了范式,促进了对波斯文化遗产的数字化保护与智能化解读,成为连接传统诗学与现代计算方法的桥梁。
以上内容由遇见数据集搜集并总结生成



