遇见数据集

Chinese Poetry Dataset (诗词数据)

收藏
github2026-05-03 更新2026-05-27 收录
官方服务:

资源简介:

格式化的中国古典诗词数据集,包含1,197,883首诗,时间跨度从先秦到近现代。数据以JSON格式存储,每个诗作对象包含标题、作者、朝代、内容、来源和版本字段。数据集经过解析、规范化、简繁转换、去重和排序处理,来源于三个开源诗歌集合。

A formatted Chinese classical poetry dataset containing 1,197,883 poems, spanning the period from the Pre-Qin Dynasty to modern times. The data is stored in JSON format, with each poem object comprising fields including title, author, dynasty, content, source and version. The dataset has undergone parsing, standardization, simplified-to-traditional Chinese character conversion, deduplication and sorting, and is sourced from three open-source poetry corpora.

创建时间:
2026-05-03
原始信息汇总

数据集概述:Chinese Poetry Dataset (诗词数据)

  • 名称: Chinese Poetry Dataset (诗词数据)
  • 规模: 总计 1,197,883 首 诗词,其中包含 118,915 首 多版本诗词。
  • 时间跨度: 从 先秦近现代
  • 文件大小: 439 MB,共 16个 文件。
  • 数据格式: JSON

数据结构

每条诗词数据为一个 JSON 对象,包含以下字段:

字段 描述
title 诗词标题(宋词为词牌名合并)
author 作者名(未知作者为"佚名")
dynasty 标准化的朝代名称
content 完整诗词正文,以换行符分隔
source 来源数据集
version 0 = 唯一版本, >0 = 重复/版本变体

示例: json { "title": "静夜思", "author": "李白", "dynasty": "唐", "content": "床前明月光, 疑是地上霜。 举头望明月, 低头思故乡。", "source": "Poetry/唐.csv", "version": 0 }

朝代分布

朝代 诗词数量 对应文件
先秦 942 先秦.json
两汉 363 两汉.json
魏晋 3,046 魏晋.json
南北朝 4,586 南北朝.json
1,642 隋.json
361,530 唐_01.json, 唐_02.json
五代 543 五代.json
320,498 宋_01.json, 宋_02.json
2,741 金.json
22 辽.json
67,036 元_01.json
254,656 明_01.json
118,175 清_01.json
近现代 62,103 近现代_01.json

数据来源

数据集合并自三个开源诗词集合:

  1. chinese-poetry — 来自 github.com/chinese-poetry/chinese-poetry
  2. Poetry (Werneror) — 来自 github.com/Werneror/Poetry
  3. poetic-mao — 来自 github.com/cdn0x12/poetic-mao

数据处理流程

  1. 解析: 从三个来源解析 JSON / CSV / Markdown 格式数据。
  2. 标准化: 统一标题、作者、朝代、正文等字段。
  3. 繁简转换: 使用 OpenCC 将繁体中文转换为简体中文。
  4. 去重: 完全匹配的诗词合并,不同版本通过 version 字段保留。
  5. 排序: 按朝代时间顺序分组存储。

许可协议

MIT 许可证 —— 合并后的数据集继承自原始数据源的许可证。

搜集汇总
数据集介绍
Chinese Poetry Dataset (诗词数据) 数据集图片
构建方式
该数据集通过整合三个开源诗歌语料库(chinese-poetry、Poetry、poetic-mao)构建而成,覆盖从先秦至近现代逾百万首诗词。构建流程包括多格式解析(JSON/CSV/Markdown)、字段归一化(标题、作者、朝代、内容)、繁简转换(OpenCC)、去重合并(精确匹配合并,异文以版本字段区分)以及按朝代时间顺序分组存储,最终生成16个JSON文件,总计439 MB。
使用方法
数据集以JSON格式直接可用,用户可通过编程语言(如Python)加载各朝代文件进行数据分析、文本挖掘或模型训练。特别地,该数据集已集成至AstrBot平台的astrbot_plugin_poetry_games插件,使用时将全部JSON文件置于插件data目录下,首次运行自动构建支持FTS5全文搜索的SQLite数据库,便于快速检索与应用开发。
背景与挑战
背景概述
中华古典诗词作为中华文明的重要瑰宝,承载着数千年的文化积淀与情感表达。然而,传统诗词研究多依赖于人工整理的零散文献,缺乏系统化、规模化的数字资源支撑。Chinese Poetry Dataset(诗词数据集)正是在此背景下应运而生,由开发者整合自chinese-poetry、Werneror/Poetry及poetic-mao三个开源诗库,于近期构建完成。该数据集收录了从先秦至近现代共计逾119万首诗词,涵盖14个朝代,规模庞大且历经标准化处理、繁简转换与去重优化,为计算语言学和数字人文研究提供了坚实的数据基础。其出现推动了古典诗词在自然语言处理、生成式AI及文化传承等领域的广泛应用,成为连接传统文学与现代科技的重要桥梁。
当前挑战
该数据集主要面临双重挑战。在领域问题层面,古典诗词语言高度凝练、意象丰富,且格式(如格律、对仗、平仄)复杂多变,现有模型难以精准捕捉其美学与语义特征,导致自动生成或理解任务难以达到人类创作水平。在构建过程中,挑战更为显著:原始诗源来自多个异构格式(JSON、CSV、Markdown),需设计统一解析与归一化流程;繁体字向简体字转换(OpenCC)时存在部分歧义处理难题;大规模去重既要识别精确重复,又要区分同一诗作的不同版本(如异文),确保数据完整性;此外,将词牌名与标题合并、处理佚名作者等细节,均需要精细的工程设计与人工校验,以维护数据质量的一致性。
常用场景
经典使用场景
中国古典诗词数据集(Chinese Poetry Dataset)汇聚了从先秦至近现代逾百万首诗词,涵盖唐、宋、明、清等主要朝代的经典作品。该数据集最经典的使用场景在于训练和评估自然语言处理模型在古汉语文本上的理解与生成能力,例如诗词续写、格律校验、作者归属识别以及唐诗宋词的情感分析等任务。研究者可基于其统一的JSON格式和朝代标签,轻松构建序列到序列模型或预训练语言模型,探索古典文学的语言规律与文化内涵。
解决学术问题
该数据集有效解决了古典诗词领域因数据零散、格式不一、版本混乱而难以开展大规模量化研究的学术困境。通过融合多个开源诗库并实施标准化清洗、繁简转换与去重处理,它为计算语言学与数字人文学科提供了高质量、高覆盖度的数据基座。研究者借此可系统考察诗词风格的历时演变、作者用词偏好、格律规则的统计特征,以及跨朝代文化主题的变迁,推动了古典文学研究的可计算化与交叉创新。
实际应用
在实践层面,该数据集被广泛应用于智能教育、文化传播与创意内容生成等场景。例如,虚拟诗词教学助手可借助数据训练出的模型,实现自动对诗、押韵建议或古风文本辅助创作;博物馆与文化平台可利用检索与推荐功能,帮助用户按朝代、作者或意象快速定位经典作品;此外,针对AstrBot等对话系统开发的诗词游戏插件,通过构建全文搜索引擎,实现了实时对诗、飞花令等沉浸式交互体验,增强了传统文化的趣味性与可及性。
数据集最近研究
最新研究方向
该数据集覆盖了从先秦至近现代的逾119万首诗词,为自然语言处理与数字人文交叉领域提供了丰沛的语料基础。当前前沿研究聚焦于基于深度学习的古典诗词自动生成、风格迁移与情感分析等方向,尤其借助大规模预训练模型(如GPT、BERT)探索诗词语义的韵律建模与作者风格复现。该数据集的精细结构——包括朝代、多版本标注与统一JSON格式——使得模型训练可在标准化条件下高效进行,同时推动了古典诗词数字化保护与AI文化创意应用的热点发展,为文化遗产的智能传播与教育创新开辟了新的可能性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务