遇见数据集

中医古籍数据库 (TCM Ancient Books Database)

收藏
github2026-06-07 更新2026-06-21 收录
官方服务:

资源简介:

这是一个包含848册中医古籍的数据集,文件格式为UTF-8编码的.txt文件,分为15个大类,每本书包含书名、作者、朝代、年份等元信息。数据来源整合了多个开源项目,并经过系统性整理与质量优化,包括编码统一、去重清理、作者修正等。

This is a dataset containing 848 volumes of ancient Chinese medical classics. The files are stored as UTF-8 encoded .txt documents, and the dataset is divided into 15 major categories. Each volume includes metadata such as the book title, author, historical dynasty, publication year and other relevant information. The data source integrates multiple open-source projects, and the dataset has undergone systematic organization and quality optimization, including unified encoding, deduplication cleaning, author information correction and other processing steps.

创建时间:
2026-06-06
原始信息汇总

中医古籍数据库 (TCM Ancient Books Database)

该数据库收录了848本中医古籍,所有文件以UTF-8编码的.txt格式存放于tcm/子目录下。数据库基于多个开源项目整合优化而成,并进行了系统性整理与质量优化。

基本信息

  • 古籍总数:848本
  • 文件格式:UTF-8编码的.txt文件
  • 分类数量:15大类
  • 编号体系:分类前缀 + 3位数字(按成书年代排序)
  • 元信息:每本书包含书名、作者、朝代、年份

分类体系

分类 代码 数量 说明
医经基础 Y 45 《黄帝内经》《难经》等经典医著
本草方药 B 64 《神农本草经》《本草纲目》等药学著作
伤寒 S 56 伤寒论及各家注疏
金匮 J 13 金匮要略及衍化著作
方剂 F 122 从《五十二病方》到《验方新编》
针灸经络 Z 36 《针灸甲乙经》《针灸大成》等
温病内科 N 16 温病瘟疫及内科杂症
五官科 K 19 眼科、喉科、口齿科
外科伤科 W 28 外科、伤科、跌打损伤
妇科 G 43 从《产宝》到《竹林女科》
儿科 E 31 《颅囟经》《小儿药证直诀》等
推拿养生 T 16 养生导引、推拿按摩
医案医话 A 64 从《石山医案》到现代医案
诊法 D 21 《脉经》《濒湖脉学》等诊断著作
综合 O 274 医论、医史、杂著等未细分内容

文件命名规范

文件名格式为:{分类代码}-{3位序号}-{书名}.txt,例如:

  • B-001-神农本草经.txt
  • S-001-伤寒论.txt
  • F-001-五十二病方.txt

同一分类内按成书年代升序排列。

元信息格式

每个文件包含以下元信息头:

<篇名>本草纲目 书名:本草纲目 作者:李时珍 朝代:明·万历六年 年份:公元1578年

整理历史

主要工作包括:

  1. 编码统一:所有文件转为UTF-8编码,解决GBK乱码问题。
  2. 去重清理:删除404占位文件、训练标注文件、异体字重复文件。
  3. 内容去重:删除格式不同但内容相同的重复副本,保留格式统一版本。
  4. 作者修正:核查并修正作者、朝代、年份元信息,共修复150+处错误。
  5. 分类编号:按学科分类+成书年代重新编号,消除编号空缺。
  6. 命名规范:统一文件名格式,修正错别字、乱码字符。
  7. 目录导出:生成古籍目录.csv便于检索。

其他说明

  • 部分古籍作者标注为"佚名"或"佚名(托名XXX)",表示原作者不可考。
  • 日本医家著作标注为"日·江户"朝代。
  • 年份标注范围(如1644-1911年)表示成书年代不确定,仅知大致范围。
  • 古籍内容中保留原文中的缺字占位符(□)、校勘标记等古籍特征。

目录文件

  • 古籍目录.csv:全库书目清单,可用Excel/Numbers打开。
搜集汇总
数据集介绍
中医古籍数据库 (TCM Ancient Books Database) 数据集图片
构建方式
中医古籍数据库以多个开源项目为基础,整合了殆知阁古籍语料库、中华医典古籍数据及中医古籍收藏等资源,经过系统化整理与质量优化而成。整理工作包括编码统一为UTF-8格式以解决乱码问题,删除重复或无效文件,核查并修正作者、朝代、年份等元信息,按学科分类与成书年代重新编号,规范文件名格式,并生成《古籍目录.csv》以方便检索。最终形成了包含848本古籍、覆盖15大类的结构化数据集。
特点
该数据库特色在于构建了精细的分类体系与编号规则,古籍被划分为医经基础、本草方药、伤寒、金匮、方剂等15个类别,每类以特定代码标识,文件命名采用“分类代码-序号-书名.txt”格式,序号按成书年代升序排列。每部古籍文件内嵌篇名、作者、朝代、年份等元信息头,保留了原书中的缺字占位符和校勘标记等古籍特征,同时收录了日本医家著作与年代不确定的文献,体现了内容的历史多样性与学术严谨性。
使用方法
使用者可直接从GitHub仓库的tcm/子目录下载所有UTF-8编码的txt文件,按文件名中的分类代码筛选特定学科古籍,或通过《古籍目录.csv》快速定位所需书籍。数据集适用于中医文献研究、文本挖掘、自然语言处理等任务,例如运用在古籍文本分类、实体识别或知识图谱构建中。元信息头为用户提供了结构化的作者与年代数据,便于进行历史文献分析或跨学科对比研究。
背景与挑战
背景概述
中医古籍是承载数千年中医药理论与实践智慧的珍贵典籍,然而其数字化进程长期面临版本分散、编码混乱、元数据缺失等困境。中医古籍数据库(TCM Ancient Books Database)由多位开源社区贡献者共同创建,整合了殆知阁古籍语料库、中华医典古籍数据等项目资源,于近年完成系统化整理。该库收录848本古籍,涵盖医经、本草、方剂、针灸等15大分类,并建立以分类前缀与成书年代为序的编号体系。通过统一UTF-8编码、去重清理、修复150余处元信息错误等操作,构建了结构化、可检索的古籍资源库,为中医药文本挖掘、知识图谱构建及智能辅助诊疗研究提供了可靠数据基座。
当前挑战
该数据集所解决的领域问题在于,传统中医古籍分散于不同载体且缺乏统一标准,研究者难以高效获取与比对文献,制约了中医知识的现代转化与跨学科研究。而构建过程中的挑战尤为突出:一是原始数据存在多源异构问题,需整合GBK乱码、格式冲突及内容重复;二是元信息(作者、朝代、年份)错误频发,部分古籍作者托名或佚名需人工校勘;三是古籍内容保留缺字占位符与校勘标记,增加了自动清洗与结构化难度;四是分类体系需兼顾学科传统与年代顺序,确保检索逻辑清晰且覆盖全面。
常用场景
经典使用场景
中医古籍数据库为自然语言处理与知识图谱构建提供了高质量的古籍语料支撑。研究者在文本挖掘中,常利用该库进行古文分词、命名实体识别(如药名、病症、穴位)以及语义关系抽取等经典任务。以《伤寒论》诸家注疏为例,通过对比不同版本条文,可开展文本对齐与版本演变分析。此外,该数据库的分类体系(如医经、方剂、针灸等15大类)为跨类别主题建模提供了天然标注,使其成为中医古籍数字人文研究的核心数据基石。
衍生相关工作
基于该数据库已衍生出一系列重要学术成果。在知识图谱领域,有研究以其方剂类目(F类122部古籍)为数据源,构建了中医方剂语义网络,实现了从《五十二病方》到《验方新编》的跨代际用药规律可视化。在自然语言处理方面,研究者利用医案医话类(A类)内容训练古文语义嵌入模型,显著提升了中医古籍文本的检索与自动摘要效果。此外,综合类目(O类274本)中的医论杂著,被用于训练历史语言模型以复原缺字占位符(□)所代表的疑难字词。这些工作共同推动了中医古籍知识在人工智能时代的活态传承。
数据集最近研究
最新研究方向
当前,随着人工智能与传统医学的深度融合,中医古籍数据库的数字化与结构化处理成为前沿热点。本数据集整合了848本涵盖医经、本草、方剂、针灸等15大类的古籍,经过去重、编码统一与元信息校正,为自然语言处理和知识图谱构建提供了高质量语料。研究者可基于该库开展典籍自动分类、方剂关联挖掘及名医诊疗模式识别等任务,助力《黄帝内经》《伤寒论》等核心经典的智能解读。该工作不仅推动了中医知识的系统传承,更在新冠疫情等公共卫生事件中为挖掘古代防疫经验提供了数据支撑,具有显著的学术价值与时代意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务