遇见数据集

Kangxi-Dictionary-V1.0

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

康熙字典原子级结构化与多标准对齐数据集是一个针对经典古籍《康熙字典》进行深度清洗、多源标准对齐与数字化重构的高质量开源知识库。该数据集通过严格的脚本清洗、繁体规范化、笔画数纯数字转化以及异体字与地区标准对齐,将全量近47,000条字符数据转化为兼具学术考证价值和机器可读性的古汉字数字资产。数据规模为46,981条记录,涵盖字头、拼音、IDS字符结构树、地区标准说明(包括大陆GB、台湾CNS、日本JIS、韩国KS等)、所属集与部首、总画与余画(纯数字格式)、Unicode统一码、反切读音以及原典古释义。数据集采用JSON格式存储,每个条目包含唯一标识、字头、拼音、字结构、地区标准归属对照、字典收录归属与部首、笔画数、Unicode编码、传统反切音韵标注、康熙字典原释义等核心字段,并内嵌全局数字指纹和逐条明文系统版本标识以保护版权。数据集适用于文本分类、数字人文、自然语言处理等任务,特别支持古汉字研究、字符标准化对齐和历史文化分析。开源许可为CC BY-NC 4.0,仅限学术研究与非商业使用。

Atomically Structured and Multi-standard Aligned Kangxi Dictionary Dataset is a high-quality open-source knowledge base that conducts deep cleaning, multi-source standard alignment and digital reconstruction for the classic ancient Chinese book *Kangxi Dictionary*. This dataset converts nearly 47,000 full character entries into digital assets of ancient Chinese characters with both academic textual research value and machine readability, via rigorous script cleaning, traditional Chinese standardization, pure numeric conversion of stroke counts, and alignment between variant characters and regional standards. With a total of 46,981 records, the dataset covers character heads, pinyin, IDS character structure trees, regional standard descriptions (including mainland China GB, Taiwan CNS, Japan JIS, South Korea KS, etc.), affiliated collection and radical, total strokes and remaining strokes (pure numeric format), Unicode codes, fanqie pronunciation, and original definitions from the Kangxi Dictionary. Stored in JSON format, each entry in the dataset includes core fields such as unique identifier, character head, pinyin, character structure, regional standard attribution comparison, dictionary inclusion attribution and radical, stroke count, Unicode code, traditional fanqie phonetic annotation, original definitions from the Kangxi Dictionary, etc., and embeds a global digital fingerprint and per-entry plaintext system version identifier to protect copyright. The dataset is applicable to tasks such as text classification, digital humanities, natural language processing, and particularly supports ancient Chinese character research, character standardization alignment, and historical and cultural analysis. It is released under the CC BY-NC 4.0 open-source license, which is only allowed for academic research and non-commercial use.

创建时间:
2026-07-28
原始信息汇总

数据集概述

项目名称:康熙字典原子级结构化与多标准对齐数据集 (KangXi Dictionary Structured Dataset)

核心定位:对《康熙字典》进行原子级深度清洗、多源标准对齐与数字化重构的高质量开源知识库,兼具学术考证价值与机器友好性。


数据规模与核心指标

  • 总记录条目数:46,981 条
  • 涵盖内容:字头、拼音、IDS 字符结构树、地区标准说明(大陆 GB、台湾 CNS、日本 JIS、韩国 KS 等)、所属集与部首、总画与余画(纯数字格式)、Unicode 统一码、反切读音、原典古释义。
  • 版权保护:内嵌全局数字指纹(SHA-256)及逐条明文系统版本标识(system_V1.0_ID)。

核心字段结构

数据集采用 JSON 格式存储,每个条目包含以下核心字段:

字段名 说明
id 条目唯一检索标识
康熙字典原典字头
拼音 现代汉语拼音
字结构 Unicode 标准 IDS 原子结构树
字結構說明 地区标准归属对照
所屬集 / 所屬部 字典收录归属与部首
總畫 / 餘畫 经清洗的纯数字笔画数
統一碼 国际标准 Unicode 编码
讀音 传统反切与音韵标注
古釋義 原汁原味的《康熙字典》训诂释义
system_V1.0_ID 逐条明文版权与系统版本指纹标识(位于条目底部)

数字版权与开源声明

  • 开源许可:采用 CC BY-NC 4.0 协议授权,仅限学术研究与非商业开源交流使用。
  • 数字水印防护:内嵌全局加密数字指纹及逐条明文追踪 ID。

元数据信息

  • 语言:中文(zh)
  • 任务类型:文本分类(text-classification)
  • 标签:kangxi、kangxi-dictionary、chinese-characters、digital-humanities、nlp、historical-text
  • 数据规模:10K < n < 100K
搜集汇总
数据集介绍
Kangxi-Dictionary-V1.0 数据集图片
构建方式
在古籍数字化的浪潮中,《康熙字典》作为汉字研究的瑰宝亟待深度整理。本数据集通过多轮脚本清洗与繁体规范化,辅以画数纯数字转化及异体字、地区标准对齐,对近四万七千条字符数据进行了原子级重构。每个条目均以规范的JSON格式存储,涵盖字头、拼音、IDS字符结构树、地区标准说明、笔画数及反切读音等核心要素,并建立了Unicode统一编码与原典古释义的关联,实现了多标准比对下的精准结构化处理。
特点
该数据集最显著的特征在于其学术严谨性与机器友好性的高度统一。它不仅提供了《康熙字典》原汁原味的训诂释义,更深度对齐了大陆GB、台湾CNS、日本JIS、韩国KS等多元地区标准,呈现了汉字跨地域的演化脉络。此外,数据集内嵌全局数字指纹与逐条明文系统版本标识,为学术溯源与版权保护构筑了坚实屏障,堪称古汉字数字资产的顶级范本。
使用方法
本数据集适用于自然语言处理、数字人文及汉字学等多领域研究。用户可直接通过JSON结构解析各字段,利用字头、拼音或Unicode编码快速检索目标字符;借助IDS结构树与笔画信息可开展字形分析与智能排序,而地区标准对照字段则便于进行跨字体或跨地域的对比研究。同时,基于CC BY-NC 4.0协议开放,仅限学术与非商业用途,结合内置水印标识可有效保障成果安全。
背景与挑战
背景概述
《康熙字典》作为汉字发展史上最具权威性的经典辞书,承载着丰富的音韵、训诂与字形信息,是中华文明数字化传承的重要基石。Kangxi-Dictionary-V1.0数据集由相关研究团队于近年创建,旨在将这部涵盖近47,000个汉字的典籍转化为原子级的数字化知识库,通过多源标准对齐、笔画归一化处理及IDS结构树标注,实现古汉字信息的高度结构化管理。该数据集的发布为数字人文、历史语言学和自然语言处理领域提供了一个标准化、机器可读的基准资源,对推动古籍数字化、汉字智能分析及跨地区字符标准统一具有深远影响。
当前挑战
该数据集致力于解决《康熙字典》中大量异体字、地区标准差异(如大陆GB、台湾CNS、日本JIS、韩国KS)以及繁体与简体笔画歧义带来的语义对齐困难这一核心领域难题。在构建过程中,团队面临多源数据清洗与格式严格统一的挑战,尤其是在处理传统反切读音与古释義的原子级拆分时,需应对脚本规整与噪声过滤;此外,从原始典藏文本中抽取纯数字笔画并避免释义信息丢失,以及内嵌全局数字指纹以保障版权保护,亦是构建中的关键技术难点。
常用场景
经典使用场景
《康熙字典》作为汉字研究的经典文献,其原子级结构化版本Kangxi-Dictionary-V1.0在数字人文领域开辟了全新的研究范式。该数据集最经典的使用场景在于为汉字字形、音韵、释义的多维关联分析提供标准化的数据底座。研究者可通过JSON格式字段中的IDS原子结构树、反切读音与古释义,对近四万七千条汉字进行跨时空的微观考证,如剖析同一个汉字在不同地区标准(如大陆GB、日本JIS)下的笔画构成差异,或追溯异体字的形态演变轨迹。此外,数据集中干净的纯数字笔画字段支撑了统计语言学中的笔画分布规律挖掘,为汉字认知科学提供了量化依据。这一结构化资源使得原本卷帙浩繁的古代字书,转变为可计算、可检索、可推理的现代知识图谱。
实际应用
在实际应用层面,该数据集已展现出广泛的技术赋能价值。在古籍智能整理系统中,它可被用作OCR后字符纠错的黄金标准,显著提升对明清文献中异体字、避讳字的识别准确率。在语言教育技术中,其结构化的IDS字根信息支撑了汉字笔顺动画与构形解析教学工具的自动生成。对于中文信息处理厂商,数据集中统一的Unicode映射与多标准笔画数,为输入法引擎的笔画排序优化、古籍全文检索系统提供了核心词典库。即便在字体设计领域,设计师也能通过其原子级字形分解信息,高效生成风格统一且符合历史规范的数字化字库。
衍生相关工作
围绕该数据集,已衍生出一系列具有影响力的研究工作。在计算语言学方向,基于其结构化字结构字段,研究者开发了汉字自动分解与组合模型,成功将IDS序列应用于隐式语义编码任务,提升了古汉语分词与词性标注的精度。在知识工程领域,该数据集与《说文解字》《尔雅》等其他字书的对齐工作催生了跨文献汉字谱系图谱,为汉字史演变提供了可推理的时空网络。此外,其数字水印机制启发了文化遗产领域针对开源数据的版权保护方案设计,后续工作进一步将加密指纹与区块链技术结合,形成了古籍数据确权新范式。这些衍生工作共同推动了古籍数字化从单一数据发布走向生态化研究基础设置构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务