遇见数据集

hanji

收藏
github2026-08-23 更新2026-08-24 收录
数据链接:
官方服务:

资源简介:

中国大陆、香港、台湾、日本、韩国五地常用汉字的字表,包含字形对照和差异分析。

A character table of commonly used Chinese characters across five regions: Mainland China, Hong Kong, Taiwan, Japan and South Korea, featuring glyph comparisons and differential analyses of character forms.

创建时间:
2026-08-20
原始信息汇总

汉智(Hanji)数据集概述

项目定位

汉智(Hanji)是一个用于对照中国大陆、香港、台湾、日本、韩国五地汉字印刷字形差异的静态应用与数据集。它将同一汉字在五地的字形并排展示,涵盖通用黑体与宋体中的印刷字形,默认按字频排序,也可按笔画或码点排序,并按差异模式筛选。项目中“Hanji”的命名源自各地对“汉字”称呼各差一个字母的组合,同时也是闽南语“汉字”的实际读音。

收录规模与范围

  • 收录五份字表(《通用规范汉字表》2013、臺灣《常用國字標準字體表》1982、香港《常用字字形表》、日本《常用漢字表》2010、韩国《漢文教育用基礎漢字》2000)的并集,韩国字表含 1,800 个常用汉字。
  • 将跨码点对应的简繁、日本新旧字体和韩式异体合并后,共 8,449 行,其中 1,692 行五地字形完全一致,129 行五地各不相同。
  • 台湾《次常用國字表》仅为已有行提供二级收录状态和候选,不参与生成新行。

数据结构与语义

  • 每一行表示一个字组,五列分别为大陆、香港、台湾、日本和韩国的展示形。
  • 跨码点候选主要来自 OpenCC,韩式异体采用 Unicode IRG 收录提案所列对应,并由地区字表约束。
  • 每个地区格有 primary(主条目)、glossed(括注异体)或 unlisted(未收录)状态;alternatives 保存该地区收录且明确属于当前字组的其他形式;aka 表示字组的其他名称;未确认关系仅用于“另见”,不进入搜索、网址别名、字典引用或字体集合。

字形差异判定方法

  • 使用 Adobe Source Han Sans 与 Source Han Serif 作为判定字体,页面用同源的 Noto Sans CJK 与 Noto Serif CJK 显示。
  • 判定基于 Adobe 公开的“Unicode 码点 → 字形编号(CID)”映射,两地映射到同一 CID 即视为同形。
  • 最终判定取黑体与宋体结果的并集,可排除只出现在单款字体中的设计细节。
  • 页面会按判定结果重新分组,被判为同形的格子统一借用组内一个地区的 Noto 字体,确保屏幕显示与判定一致。
  • 构建时自动收集 Noto 缺少的码点,生成内置的补充 WOFF2 子集(黑体取 Plangothic P1,宋体取 WenJin Mincho P2),并保留真正的 Unicode 文本。

已知局限

  • 仅比较通用黑体与宋体中的印刷字形,不涵盖手写习惯或教科书体示范字形。
  • 判定对象是 Source Han 的地区字形设计,是高质量代理,并非各地标准本身。
  • Source Han 的香港字形覆盖不完整,“只有香港不同”一类可能少报。
  • 未收录格显示的是传承参考形,不表示该地区实际采用或规范收录该形。

数据来源与许可

  • 主要数据来源包括 Adobe Source Han 字体、Noto CJK 字体、OpenCC、AnimCJK、Unihan、Unicode IRG、五地标准字表以及来自不同渠道的字频排名数据,各来源许可不一(SIL OFL 1.1、Apache-2.0、MIT、CC BY 4.0、Public Domain 等)。
  • 项目原创代码与文档采用 MIT 许可;原创的数据库结构、数据选择与编排及原创元数据采用 CC BY 4.0;第三方数据及其派生字段继续适用各自来源许可。
  • “汉智”“Hanji”及官方 Logo 和品牌标识不属于上述授权,未经许可不得用于修改版本、Fork 或独立部署。

数据获取方式

  • 字表文件 app/assets/data/chars.json 由构建脚本生成,不提交至仓库。
  • 静态生成后,字表会复制到固定地址 https://hanji.sxzz.moe/data/chars.json 供外部网站引用,该地址已设置 CORS 跨域访问,缓存 1 小时,过期后可继续使用旧版本 1 天。
  • 每个字组详情页的地址是它的行名(如 /char/着),五地展示形、akaalternatives 也可作为地址由客户端跳到所属行。

声明与使用建议

本应用是基于公开资料制作的字形对照工具,不是各地的规范、词典或教学材料。页面展示的是本应用采用的数据与自动规则所得的结果,不能据此断定某个字在当地只有一种“正确”形式。正式场合请以原始规范与词典为准,每个字的详情页都列有相应地区的字典链接。

搜集汇总
数据集介绍
hanji 数据集图片
构建方式
汉智(Hanji)数据集以中国大陆、香港、台湾、日本、韩国五地官方常用汉字字表的并集为收录基准,涵盖《通用规范汉字表》《常用國字標準字體表》《常用字字形表》《常用漢字表》及《漢文教育用基礎漢字》等权威字表。通过OpenCC等工具整合跨码点异体对应,并引入Unicode IRG提案数据以处理韩式异体。字形差异判定依托Adobe Source Han Sans与Serif的CMap映射,以黑体与宋体的并集结果为准,确保严谨性。最终生成8,449行字组数据,其中包含完全一致与各地殊异的丰富类型。
特点
该数据集以印刷字形为核心,细致比对了五地汉字在通用黑体与宋体中的异同,且对字形完全相同的字亦予收录,使其成为全面的资料表而非单纯差异清单。每个字组包含主条目、括注异体及未收录状态,并辅以笔画数、读音和频率排序。数据判定采用同源字库并辅以补充字体,确保显示一致性。此外,数据集提供稳定的URL访问和跨域支持,便于外部引用,并在细节上兼顾了日本旧字体等特殊映射关系。
使用方法
使用者可通过应用内界面按字频、笔画或码点排序,并根据差异模式筛选查看五地字形对比。每个字组拥有独立详情页,支持别名跳转与规范地址映射。数据文件以JSON格式提供,可通过固定URL fetch或XHR跨域取用,并遵循开源许可。构建过程依赖pnpm脚本,可自动化生成字表、字体子集和静态站点,便于二次开发与本地验证。测试套件确保字体轮廓与判定结果的一致性,保障数据可靠性。
背景与挑战
背景概述
汉字作为中华文化圈的核心书写系统,其字形在不同国家和地区经历了各自的演变与规范化。随着全球化进程的加深,跨地区汉字交流日益频繁,而大陆、香港、台湾、日本与韩国之间在汉字印刷字形上的细微差异,常被忽视却影响深远。汉智(Hanji)数据集由开发者Kevin Deng于近年创建,旨在系统性地整理并可视化这一跨地域字形差异。其核心研究问题在于,如何基于权威字表与同源字体,科学地判定五地汉字字形的同异,并构建一个可交互的对照工具。该数据集整合了五份官方常用字表(如《通用规范汉字表》、《常用漢字表》等),共计8449个字组,并借助Adobe Source Han系列字体的标准化字形映射,实现了对字形差异的客观量化。其影响力体现在为语言文字研究、字体设计及跨文化沟通提供了极具参考价值的基础数据,推动了数字人文领域对汉字地域变体的关注。
当前挑战
该数据集面临多重挑战。首先,在领域层面,汉字字形差异的判定极为复杂,涉及历史演变、地区规范与字体设计等多个维度,数据集的构建需兼顾权威性与可操作性。例如,仅通过两款通用字体(黑体与宋体)的CID映射来判定“同形”,可能忽略其他字体或手写体中的细微差别,且香港字形覆盖不完整可能导致“香港独有”差异被低估。其次,在数据构建过程中,需处理跨码点异体字(如简繁、日本新旧字体)的对应关系,并解决不同字表间的冲突,如OpenCC映射需结合多地区证据,否则保守拆分,这增加了数据语义的复杂性。此外,还需维护约302 MiB的第三方原始数据(包括字体、字频、笔顺等),确保校验和一致性,任何来源更新都可能导致数据重构,工程挑战显著。最后,可扩展性与标准化问题同样棘手,如韩语读音仅基于Unihan推荐,不结合语境,限制了其应用场景。
常用场景
经典使用场景
汉智(Hanji)数据集的核心使用场景在于对汉字字形在东亚五个主要使用地区——中国大陆、香港、台湾、日本与韩国——之间的细微差异进行系统性的对比与分析。研究人员与语言学者可借助这一工具,直观地审视同一汉字在不同地区的标准印刷体(黑体与宋体)中所呈现的形态变化,从而深入理解汉字在跨区域传播与演变过程中形成的文化多样性和标准化差异。该数据集通过并排展示、差异模式筛选及字频、笔画数排序等功能,为汉字字形比较研究提供了便捷而严谨的数字化平台。
实际应用
在实际应用层面,汉智数据集展现出广泛的实用价值。对于字体设计师而言,它可作为校验和开发多地区版本字体的重要参考,确保产品在覆盖中、港、台、日、韩等市场时能够精准呈现符合当地规范的字形细节。对于语言教育工作者,该工具能帮助学生和公众直观认知不同地区汉字书写的规范差异,促进跨文化理解。此外,该数据集还以JSON格式提供跨域访问接口,便于网络开发者将其集成至各类汉字学习应用、词典软件或书法艺术展示平台,从而实现字形差异知识的普及与传播。
衍生相关工作
汉智项目本身作为一项开创性的工作,其数据构建方法和分析思路已为后续研究打下基础。其自动化的字形差异判定流程,基于Adobe字体CMAP映射与逻辑推理,为同类研究提供了可复用的技术范式。项目整合了Unicode IRG、OpenCC及众多字表数据,并建立了严格的关联规则与数据验证机制,其衍生的数据处理流程和规范化策略,可被借鉴用于构建其他东亚文字或方言地区的比较语料库。此外,汉智所渲染的静态字形数据及字表JSON文件,为计算语言学中的汉字字形聚类分析、历史演变建模以及跨字体渲染一致性测试等前沿课题提供了高价值的数据素材,激发了学界对汉字地区性差异的系统性量化探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务