遇见数据集

诗云语料库

收藏
github2026-06-27 更新2026-07-07 收录
官方服务:

资源简介:

一个独立、完整、带来源标注的简体中文古典诗词语料库,包含诗、词、曲,不收古文,完整不删字,保留原文标点,每条可溯源、可审计、可回滚。数据集通过统一、清洗和标注多个上游父库构建,提供干净、完整、可复用的标注语料,并包含公开层和隔离层以处理不同版权状态的数据。

An independent, complete, source-annotated simplified Chinese classical poetry corpus encompassing poems, ci (classical Chinese lyric verses), and qu (melody-regulated lyrical works), while excluding classical prose. It retains all original characters without deletion and preserves the original punctuation marks. Each entry in the corpus is traceable, auditable, and rollback-capable. This corpus is constructed by unifying, cleaning, and annotating multiple upstream parent corpora, providing clean, complete and reusable annotated data. It also includes a public layer and an isolated layer to handle data with varying copyright statuses.

创建时间:
2026-06-27
原始信息汇总

诗云语料库 (shiyun-corpus) 概述

1. 核心定义

诗云语料库是一个独立、完整、带 provenance(来源)标注的简体中文古典诗词语料库。它扮演着“上游父库”与“下游消费者”之间的中间层角色,旨在提供干净、完整、可复用的标注语料,不受任何下游应用(如3D星图可视化“诗云”)的约束。

2. 设计铁律

  • 完整不删字:收录不受任何下游字库限制,包含生僻字、词、曲。
  • 保留原文body 字段保留原始标点;保留原始朝代串 dynasty_raw
  • 简体唯一:当前版本使用简体中文。
  • 来源优先 (Provenance-first):每条数据都标注来源,可审计、可回滚。
  • 不破坏式:对互见、重出的内容不删除,通过 dup_group 标记,将去重判断交给消费者。
  • 不杜撰:所有补录和订正均来自权威出处。
  • 只收诗词曲:不收录古文、散文、赋、序记及外语诗歌。

3. 内容与格式

  • 文件格式data/poems.<朝代>.jsonl(JSON Lines,UTF-8 编码),每行一首诗。
  • 记录 Schema:每条记录包含 idtitleauthordynastydynasty_rawbodygenredup_groupprovenance 字段。其中 provenance 记录了 type(来源类型:上游父库或我方新增·订正)、source(具体来源文件)、license(许可协议)和 note(备注说明)。
  • 朝代标识:使用 15 个规范键值,包括 xianqinqinhanweijinnanbeichaosuitangwudaisongliaojinyuanmingqingjinxiandaidangdai

4. 目录结构

  • 主要文件README.mdSOURCES.mdREPORT.mdLICENSE
  • 脚本scripts/build.mjs(构建脚本)、scripts/validate.mjs(校验与报告生成脚本)。
  • 校勘层curated/additions.jsonl(补录)和 curated/corrections.jsonl(订正)。
  • 数据文件
    • data/poems.<朝代>.jsonl公开层,包含古典公有领域(PD)诗词。
    • data/poets.jsonl公开层诗人聚合。
    • data/_restricted/隔离层,默认不纳入公开仓,包含现代或版权状况复杂的作者作品。

5. 版权与许可

  • 公开层:古典文本,属于公有领域 (PD),可自由发布。
  • 隔离层:包含现代、在册作者的作品,其著作权状态复杂,每条数据会单独标注 license(如 Apache-2.0、非商用、在版权期内等),默认不公开。
  • 代码与元数据:代码、校勘标注和文档遵循 MIT 许可。

6. 数据来源

数据主要来自三个上游父库:Werneror、yuxqiu、sheepzh,并声明混合许可。详细来源及许可信息见 SOURCES.md

7. 用法

  • 构建npm run build(需本地已克隆上游父库)。
  • 校验npm run validate(生成全量校验报告 REPORT.md)。
  • 全流程npm run all
  • 要求:零 npm 依赖,Node.js 版本 ≥ 18。
搜集汇总
数据集介绍
诗云语料库 数据集图片
构建方式
诗云语料库是一个独立、完整且带provenance标注的简体中文古典诗词语料库。其构建方式基于多个上游父库(Werneror、yuxqiu、sheepzh)的统一清洗与规范化处理。系统通过内置构建脚本自动读取上游数据,执行朝代映射、字段标准化、体裁分类与重出标记,同时融入校勘层中的人工补录与订正条目,最终按朝代分片输出为JSONL格式文件。构建过程强调不删字、保留原始标点与朝代串,并通过校验脚本确保schema与编码的完整性,实现数据的可审计与可回滚。
使用方法
使用者可通过npm命令直接使用本语料库。在本地克隆上游父库后,运行`npm run build`即可从上游读取数据并自动生成按朝代分片的JSONL文件与构建报告;运行`npm run validate`可执行全量schema、朝代、编码及provenance校验并生成REPORT.md。零npm依赖且支持Node≥18环境,构建脚本已内置大内存配置。下游项目如诗云星图可直接摄取公开层快照,并根据自身需求过滤字库、聚合或移除标点,实现灵活复用。校勘层中的补录与订正条目存储在curated目录下,可自动并入构建流程,不随上游重拉而丢失。
背景与挑战
背景概述
诗云语料库(shiyun-corpus)诞生于2023年,由独立开发者团队构建,旨在解决古典诗词语料在开源生态中碎片化、难复用的痛点。该数据集整合了Werneror、yuxqiu、sheepzh等多个上游父库的古典诗词曲文本,通过统一清洗、结构化和provenance(来源)标注,形成了一个完整、可审计的简体中文语料库。其核心研究问题在于:如何在尊重上游版权和原始文本的前提下,为下游应用(如诗云3D星图可视化)提供干净、稳定且可追溯的标注数据。该语料库对古典文献数字化和NLP领域具有基石价值,尤其推动了诗词曲在自然语言处理中的标准化进程,其设计铁律(如不删字、保留标点、provenance-first)为同类语料库建设树立了新范式。
当前挑战
诗云语料库面临的核心挑战包括:领域问题层面,古典诗词曲的文本复杂性与版权模糊性——生僻字、互见重出文本、跨朝代作者身份确认等问题,需要在不破坏原始信息的前提下统一清洗规则,同时严格区分公有领域(PD)文本与受著作权保护的现代作品(如叶嘉莹诗词),避免法律风险。构建过程中,挑战在于多源异构数据的融合与校验:上游父库的编码格式、朝代分类标注不一致,需设计15个canonical key朝代表映射;校勘层(curated/)的补录与订正必须依赖权威出处,并逐条记录修正痕迹,确保可回滚;此外,构建脚本需兼容不同父库路径,且在全量校验时需处理超过45MB的大文件分片,维持零npm依赖的轻量架构与性能平衡。
常用场景
经典使用场景
诗云语料库最经典的使用场景在于为古典诗词的自然语言处理研究提供高质量、可溯源的语料基础。作为上游父库与下游消费者之间的桥梁,它统一了Werneror、yuxqiu、sheepzh等多个来源的诗词数据,通过严格的清洗流程保留了原始标点与生僻字,并采用内容寻址的id实现跨重建的稳定性。研究人员可以直接加载按朝代分片的JSONL格式文件,用于诗词的断句、格律分析、作者识别以及文本生成等任务,其完整的provenance标注确保了每一次实验的可审计与可复现。
解决学术问题
该数据集解决了古典诗词数字化研究中长期存在的语料碎片化与不可追溯问题。此前,研究者常受限于上游数据源的删字、去标点、合并重出等预处理行为,导致模型训练时丢失原始文本的细微特征。诗云语料库通过设计铁律——完整不删字、保留原始标点、标注dup_group而不破坏性去重、逐条标注来源与许可——为学术研究提供了一个干净、完整且可复用的语料基准。其贡献在于将数据清洗从黑箱操作转变为透明的构建流程,使得对于诗词互见、文本校勘、生僻字处理等学术问题的探讨有了统一的评价基础,并推动了数字人文领域的可重复性革命。
实际应用
在实际应用中,诗云语料库最为人所知的是作为诗云3D星图可视化系统的底层数据供应。诗云项目通过本库的快照构建起恢弘的诗词宇宙,让用户以交互方式探索历代诗作的关联网络。此外,该语料库还可支撑古典诗词教育平台的开发,例如生成包含标点与朝代信息的标准诗卷,或作为古籍数字化整理工具的后端字典。其公开层与隔离层的双层设计兼顾了版权合规与学术自由,使得商业性诗词应用(如文创产品、诗词问答机器人)可以安全地取用公有领域文本,而现代作品则被妥善隔离,这一架构范式为文化遗产类数据集的实际部署提供了可复制的模板。
数据集最近研究
最新研究方向
当前古典诗词语料库研究的前沿焦点,正从简单的文本数字化存储,转向构建具备可溯源、可审计、可复用的高质量结构化知识基础设施。诗云语料库的诞生,完美回应了这一趋势。它通过融合多个上游父库,设计了独创的provenance-first元数据标注体系,为每条记录标注来源、许可证与校勘信息,实现了跨库数据的稳定整合与版本回滚。这一突破性的设计,不仅解决了传统诗词库因字库限制而删字、因去重而丢失互见关系、因无声明而版权混乱的痛点,更通过“公开层与隔离层”的版权分化策略,理清了公有领域文本与在册作者作品的法律边界。该语料库的建立,为古典文学的数字人文研究、AI诗歌生成及大规模古籍校验,提供了迄今最严谨、最完整的底层数据支撑,标志着古籍语料库建设迈入了一个强调“可信赖”与“可组合”的新纪元。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务