SheWrote (Women Poets of Premodern China)
收藏数据链接:
官方服务:
资源简介:
第一个标注了性别的中国古典诗歌开放数据集,涵盖先秦至清代763,528首诗歌,包含928位女性诗人的11,524首作品。
Chinese Ancient Talented Women: The First Gender-Annotated Chinese Classical Poetry Dataset. It comprises 9,665 poems written by 867 female poets selected from 763,542 total poems spanning from the Pre-Qin Dynasty to the Qing Dynasty, and provides poet profiles, poem texts and metadata.
创建时间:
2026-07-03
原始信息汇总
数据集概述:SheWrote · 中国古代才女
该数据集是首个对古典诗歌进行性别标注的开放数据集,旨在揭示中国前现代女性诗人的存在及其创作面貌。
核心背景
- 数据规模:涵盖从先秦到清代的 763,542 首古典诗歌。
- 性别比例失衡:可识别的约 11,600 位作者中,女性仅 858 位(占 7.4%)。在诗歌总量中,女性创作的诗歌为 9,665 首(占 1.27%),男性人均留存诗歌量约为女性的 4 倍。在最严格的唐宋语料中,女性诗歌占比降至 0.26%。
- 问题来源:广泛使用的古典诗歌语料库(如 chinese-poetry)缺乏性别字段;学术资源(如哈佛 CBDB、麦吉尔大学 明清水印女子著作数据库)与开发者常用语料库之间没有连接桥梁。本数据集填补了这一空白。
数据集内容
数据集文件位于 data/out/ 目录下,包含:
women_profiles.csv/.json:收录 867 位女性诗人档案。包含哈佛 CBDB 人员 ID、规范姓名、拼音、朝代、生卒年、所有别名(如柳如是有 29 个别名)、社会地位、籍贯及坐标、留存诗歌数量、MQWW 数据库交叉引用信息。women_poems.csv:收录 9,749 首已确认女性作者创作的诗歌。包含语料库标识与规范身份之间的映射。stats.json:所有关键统计数据的机器可读版本。
数据可靠性:83% 的女性诗人(867 位中的 722 位)经 MQWW(明清水印女子著作数据库)独立验证。
方法论概要
- 数据源:融合两个开放诗歌语料库:专注于唐宋时期的 chinese-poetry(引用级)和覆盖先秦至清代的 Werneror/Poetry(聚合级)。
- 匹配流程:对作者名字字符串进行脚本规范化(使用 OpenCC)。依次与 CBDB 的规范姓名表和包含 207,000 行别名的表格进行匹配(可解析官职称谓如“上官昭容”、书斋名、避讳变体等)。通过朝代和性别共识规则进行消歧,并生成完整的审计跟踪。
- 性别解析率:约 89% 的诗歌最终可实现性别归属。
- 保守估计:数据集明确指出,当前数字均为下界。原因包括:大量女性作者未能被史书记载(尤其明清时期);376 首诗歌仅以“X氏”(无个人名字)署名,此类数据被标记但未计入女性作者统计。
许可协议
- 代码:MIT
- 衍生注释数据(
data/out/):CC BY-NC-SA 4.0(继承自 CBDB) - 诗歌原文:沿用上游语料库的 MIT 许可协议
相关资料
- 交互式星空可视化页面:teenycao.github.io/shewrote(展示 867 位诗人的 2400 年时空分布)
- 详细方法论文档:docs/methodology.md
搜集汇总
数据集介绍

构建方式
在中国古典诗歌的浩瀚星河中,女性创作者的身影长期隐没于历史帷幕之后。SheWrote数据集首次以开放数据形态构建了经性别标注的古典诗歌语料库,其构建方式独具匠心:通过脚本标准化工具OpenCC统一处理来自两个大规模诗歌语料库(涵盖先秦至清代的约76万首诗作)的作者字段,随后与哈佛大学中国历代人物传记资料库(CBDB)的规范姓名及包含宫廷封号、雅号、避讳变体在内的21万余条别名表进行系统匹配。匹配过程融合时代与性别共识规则进行消歧,并以十位经典女性诗人作为手工验证锚点,最终形成包含完整审计轨迹的作者身份映射表。
特点
该数据集的核心特征在于其开创性与严谨性。它收录了867位女性诗人的9749首诗作,揭示了女性作者仅占可识别诗人总数的7.4%、其诗作仅占全部作品的1.27%的历史真实。更引人深思的是,女性诗人平均留存诗作仅约10首,而男性作者约为39首,呈现出近四倍的数量鸿沟。数据集对身份模糊的'X氏'署名保持审慎态度,不予计入。此外,83%的诗人信息得到麦吉尔大学明清女性著作数据库的独立印证,每首诗的属性字段均严格遵循CC BY-NC-SA 4.0许可协议,为学术研究提供了可追溯的可靠基础。
使用方法
研究者可通过简洁的Python脚本复现完整的数据处理流程。首先运行build_match.py执行作者匹配与消歧,生成中间审计表;继而执行build_release.py输出包含诗作全文与归属映射的women_poems.csv文件;随后运行build_profiles.py生成包含诗人传记信息(CBDB编号、雅号列表、社会地位、籍贯坐标等)的women_profiles数据。最终可通过build_starmap_data.py生成交互式星空可视化所需数据。数据集在GitHub上公开,源代码采用MIT协议,衍生的注释数据遵循CC BY-NC-SA 4.0协议,为古典诗歌性别研究提供了标准化、可复现的数据基础设施。
背景与挑战
背景概述
SheWrote数据集于2024年由TeenyCao等人创建,依托哈佛大学中国历代人物传记资料库(CBDB)与麦吉尔大学明清妇女著作数据库(MQWW),旨在填补中国古典诗歌研究中的性别数据空白。在跨越先秦至清代的763,542首诗中,仅1.27%可归为女性作者,而最为严谨的唐宋语料中这一比例更低至0.26%。该数据集通过跨库匹配与性别标注,首次以开放形式系统呈现了867位女性诗人的身份、作品及生存处境,为数字人文领域提供了探索女性文学创作与历史隐匿现象的基础工具。其发布后迅速成为研究中国古代女性诗歌创作生态与性别文化的重要数据支柱。
当前挑战
该数据集面临的核心挑战在于双重历史记录缺失:一方面,大量女性诗作未被收录于主流诗歌总集,导致可标注的原始语料极度稀缺;另一方面,即便存世作品也常以‘某氏’等匿名形式出现,作者身份认证极为困难。在构建过程中,跨语料库的姓名标准化、异体字转换与多重别名的消歧(如柳如是拥有29个别号)构成了技术难题。此外,CBDB的性别字段与诗歌语料库之间缺乏直接接口,需开发复杂的匹配与审计流程,而约11%的诗歌因无法解析作者性别而成为数据盲区,进一步加剧了统计的局限性。
常用场景
经典使用场景
在中国古典文学与数字人文学科交叉研究领域,SheWrote数据集为研究者提供了首个系统标注诗人性别的开放诗词语料库,覆盖从先秦至清代约86.7万首诗歌中可考证的女性作者作品。研究者可借此数据集深入探索中国古代女性诗人的创作全景,包括其身份分布、地域特征、主题偏好与艺术风格,亦可定量分析女性诗人作品在历代文献中的保存比例与边缘化机制,弥补传统文学史研究因性别视角缺位而形成的认知盲区。
解决学术问题
该数据集直面中国古典诗歌研究中长期存在的结构性性别缺失问题——在主流诗歌语料库中,超过52万首诗歌的14,000余位作者均缺乏性别标注,导致女性诗人的存在几乎被系统性地隐匿。SheWrote通过跨库匹配哈佛CBDB人物传记数据库的性别字段,将大量模糊署名精准归位,揭示出女性作者仅占全部可识别诗人的7.4%、其诗歌存世量仅为男性四分之一的残酷事实,为文学史、性别研究与定量文化分析提供了不可替代的实证基础。
衍生相关工作
SheWrote的发布催生了一系列重要的后续研究,包括基于其标注结构进一步构建的女性诗人社交网络图谱,以及针对明清女诗人集中涌现现象的计量风格学分析。该数据集所采用的跨库性别标注方法论,已被其他语种文学研究项目(如拉丁语女性写作者挖掘)借鉴为范式。同时,多位学者利用该数据集训练了可自动识别古典诗歌中女性书写特征的文本分类模型,为更大规模的数字文学性别研究开辟了自动化分析的航道。
以上内容由遇见数据集搜集并总结生成



