遇见数据集

gujilab/chinese-classical-corpus

收藏
Hugging Face2026-05-14 更新2026-05-31 收录
官方服务:

资源简介:

中国古典文献结构化语料集,含完整十三经 + 说文解字 + 资治通鉴 + 二十四史前 15 部,以及 197 万条古译今/今译古/断句指令对。全部 CC0 公有领域,可商用、可改用、无附加限制。该数据集旨在通过提供统一schema的清洁古典文本和大量指令对,让任何想补强中文古典能力的模型(开源或商业)都有一个可直接喂的训练材料底盘,并配套评测基准以量化中文古典文献在LLM中的能力。

license: CC0 1.0 language: - zh task_categories: - 文本生成(text-generation) - 机器翻译(translation) tags: - 中国古典文献(chinese-classical) - 古文 - 文言文 - 指令微调(instruction-tuning) - 大语言模型(LLM) size_categories: - 100万<n<1000万 configs: - config_name: corpus data_files: - split: train path: "corpus.jsonl" - config_name: translate data_files: - split: train path: "translate.jsonl" - config_name: punctuate data_files: - split: train path: "punctuate.jsonl" # 中国古典文献语料集 > 🔗 **源代码与构建脚本**: [github.com/gujilab/chinese-classical-corpus](https://github.com/gujilab/chinese-classical-corpus) — 完整抽取流水线、14个Python脚本、验证套件 > 🎯 **配套评测基准数据集**: [gujilab/chinese-classical-bench](https://huggingface.co/datasets/gujilab/chinese-classical-bench) — 500道题×5任务,用于评测大语言模型的古典文献处理能力(题目均来自本语料集抽样) 中国古典文献结构化语料集,收录完整十三经、《说文解字》、《资治通鉴》、二十四史前15部典籍,以及197万条古译今/今译古/断句指令微调对。 **本数据集全部采用CC0公有领域授权,可商用、可修改,无任何附加限制。** ## 项目初衷 中文(尤其是文言文)常被认为具备「高密度优势」,本语料集与配套评测基准旨在将这一论断转化为可量化验证的实证结果——**明确其适用场景与局限边界**。 ### 分词器(Tokenizer)层面:确有优势 针对7款主流分词器(Tokenizer)开展的横向评测([tokenizer_study](https://github.com/gujilab/chinese-classical-bench/blob/main/tokenizer_study/report.md))结果如下: - 在DeepSeek-V3、Qwen2.5、Qwen3等模型上,**文言文的Token用量约为英文的0.57倍** - 旧版GPT-3.5/4(采用cl100k_base分词器)**对中文的Token消耗反而比英文高19%** ### 提示词(Prompt)与任务层面:存在差异 另有3组对照实验([experiments/](https://github.com/gujilab/chinese-classical-bench/tree/main/experiments))结果显示: | 场景 | 字符/Token消耗变化 | 准确率/生成质量变化 | 结论 | |---|---|---|---| | **英文提示词 → 文言文提示词** | **字符量减少74%** | **准确率提升2个百分点** | **效果显著提升** | | **现代中文提示词 → 文言文提示词(同一任务)** | 字符量减少4.7% | **准确率下降11.3个百分点** | 并非无成本收益 | | **典故式提示词 vs 字面展开式提示词(盲评140组样本)** | Token用量减少25% | 字面展开式得分率49% > 典故式38% | 可节省Token,但会牺牲部分生成质量 | ### 校准结论 > 中文的高密度优势**仅体现在分词器(Tokenizer)层面**,而非大语言模型(LLM)任务层面的无成本收益。 > 将英文提示词替换为文言文提示词可大幅提升效果;若替换为现代中文提示词或采用典故压缩方式,虽能节省Token,但会牺牲生成质量。 但当前大语言模型(LLM)训练语料中,中文古典文献占比极低,公开评测也几乎仅关注现代中文能力。本语料集提供**具备统一Schema的标准化古典文本与197万条指令微调数据对**,旨在为所有希望补强中文古典文献处理能力的模型(开源或商用)提供可直接接入的训练数据集底座。 配套评测基准数据集[gujilab/chinese-classical-bench](https://huggingface.co/datasets/gujilab/chinese-classical-bench)包含6类任务共600道题目与4组论点验证实验。两个仓库的目标一致:**使中文古典文献成为大语言模型时代可量化、可对比、可用于模型训练的能力评估维度**。 ## 快速上手 python from datasets import load_dataset # 源语料(共12005条章节级记录,总计1720万字) corpus = load_dataset("gujilab/chinese-classical-corpus", "corpus", split="train") # 古文-现代文双向翻译指令数据(共1924378条) translate = load_dataset("gujilab/chinese-classical-corpus", "translate", split="train") # 古文断句加标点指令数据(共46546条) punctuate = load_dataset("gujilab/chinese-classical-corpus", "punctuate", split="train") print(corpus[0]) # {'id': 'shuowen#1', 'source': '说文解字', 'author': '许慎', 'era': '汉', # 'category': '字书', 'char': '一', 'radical': '一部', ...} ## 数据集配置说明 ### `corpus` — 源语料数据集 包含12005条章节、篇章或卷级别的标准化文本,覆盖30部经典古籍: | 类别 | 收录典籍 | 备注 | |---|---|---| | 字书 | 《说文解字》(收录9831个字头) | 已完成21%字头的修复,剩余3.6%未修复的字头通过[shuowenjiezi/shuowen](https://github.com/shuowenjiezi/shuowen)项目的CJK Ext B-G字符库交叉补全 | | 经部(十三经) | 《论语》《孟子》《大学》《中庸》《诗经》《尚书》《礼记》《周易》《春秋左传》《春秋公羊传》《春秋穀梁传》《孝经》《尔雅》 | 全本收录 | | 史部 | 《史记》《汉书》《后汉书》《三国志》《晋书》《宋书》《南齐书》《梁书》《陈书》《魏书》《北齐书》《周书》《南史》《北史》《隋书》(二十四史前15部) | 全本收录 | | 编年体 | 《资治通鉴》294卷 | 全本收录 | **通用字段**:`id`、`source`、`author`、`era`、`category`、`content` **特定类型附加字段**:字书类额外包含`char/radical/pinyin/fanqie`字段;经类额外包含`chapter/section`字段;史类额外包含`volume`字段 ### `translate` — 古文-现代文双向翻译数据集 包含1924378条指令样本,覆盖97部古籍。数据来源于[NiuTrans/Classical-Modern](https://github.com/NiuTrans/Classical-Modern)(MIT许可证)双语语料库。 json { "id": "instruct#1", "task": "c2m", "instruction": "将下列古文翻译成现代汉语:", "input": "子曰:学而时习之,不亦说乎?", "output": "孔子说:学了知识然后按一定的时间复习它,不也是很愉快吗?", "source": "论语·学而篇", "category": "经" } - `task`:取值为`c2m`(古文转现代文)或`m2c`(现代文转古文) - 采用6种古文转现代文指令模板与4种现代文转古文指令模板轮换生成 - 其中798条样本带有`_has_box: true`标记,包含古籍散佚导致的`□`占位符(详见下文说明) ### `punctuate` — 古文断句加标点数据集 包含46546条样本,均从`corpus`数据集中抽取章节段落,移除原有标点作为输入,保留原文作为输出。覆盖14部正史与经传典籍。 json { "id": "punct#1", "task": "punctuate", "instruction": "为下列古文添加标点:", "input": "夫天地者万物之逆旅也光阴者百代之过客也", "output": "夫天地者,万物之逆旅也;光阴者,百代之过客也。", "source": "晋书", "category": "史" } ## 关于`□`占位符 在[NiuTrans/Classical-Modern](https://github.com/NiuTrans/Classical-Modern)源数据中,共有1266条样本包含`□`占位符(占指令数据的0.06%),可分为两类: 1. **可恢复占位符(已修复678条)**:通过chtxt繁体版语料库交叉补全。示例:`营昭阳殿,□令监造` → `营昭阳殿,𠡠令监造`(`𠡠`为CJK Ext B区块U+2086D的「敕」异体字) 2. **不可恢复占位符(798条样本标记为`_has_box: true`)**:对应古籍散佚(如《逸周书》)、出土文献残损(如《孙膑兵法》竹简)、帛书整理重建(如《黄帝四经》)或礼乐仪式符号(如《礼记》中的节奏记号) 训练时可按需过滤此类样本:`ds.filter(lambda x: not x.get("_has_box", False))` ## 数据来源 - [殆知阁古代文献](https://github.com/garychowcmu/daizhigev20) — 核心语料来源 - [chinese-poetry](https://github.com/chinese-poetry/chinese-poetry) — 《诗经》与四书五经相关语料 - [zh.wikisource.org](https://zh.wikisource.org) — 《春秋穀梁传》等典籍补全 - [ctext.org](https://ctext.org) — 《尚书》《周易》缺漏部分补全 - [shuowenjiezi/shuowen](https://github.com/shuowenjiezi/shuowen) — 《说文解字》占位符修复 - [chtxt](https://github.com/JasonWade001/chtxt) — 二十四史清洁版繁体转简体(9部典籍) - [NiuTrans/Classical-Modern](https://github.com/NiuTrans/Classical-Modern) (MIT) — 古文-现代文对齐语料与《南史》76卷 - [zh.wikisource.org/wiki/南史](https://zh.wikisource.org/wiki/南史) — 《南史》卷2、7、68、74补全 ## 已知数据瑕疵 - **《说文解字》仍有356个字头为`□`占位符(占比3.6%)**:跨多个参考源均无法完成歧义消解 - **《资治通鉴》卷258**:原文中作者姓氏误写为`寀`(读音cǎi),实际应为`宋`(读音sòng) - ~~**《南史》第76、80卷**:NiuTrans上游语料缺失最后4卷~~ **已在v1.3版本修复**:缺失的卷2、7、68、74已从维基文库补全,现《南史》80卷完整收录 - **生僻字ASCII化问题**:极少数CJK Ext G区块字符在数据转换过程中可能丢失 ## 开发路线图 - v1.3:补充二十四史剩余9部(《旧唐书》《新唐书》《旧五代史》《新五代史》《宋史》《辽史》《金史》《元史》《明史》及《清史稿》) - v1.x:新增部首/字形分解维度(整合cjkvi-ids语料库,构建表意建模辅助数据集) - v2.0:新增古文阅读理解问答数据集(由大语言模型辅助生成) ## 引用格式 bibtex @misc{chinese-classical-corpus, title = {Chinese Classical Corpus}, author = {gujilab}, year = {2026}, url = {https://huggingface.co/datasets/gujilab/chinese-classical-corpus} } **代码仓库**:https://github.com/gujilab/chinese-classical-corpus ## 许可证 **CC0 1.0 Universal**:本数据集采用公有领域授权,无任何附加限制。源典籍本身已属于公有领域;本团队对其进行的结构化处理同样以CC0协议释出。 底层依赖项目的各自许可证详见[LICENSE](LICENSE)文件。

提供机构:
gujilab
二维码
社区交流群
二维码
科研交流群
商业服务