遇见数据集

HCSU

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

HCSU(细粒度历史书法风格理解数据集)是首个专为细粒度历史书法风格理解设计的大规模数据集和评估基准。该数据集旨在解决现有大型视觉语言模型在书法艺术领域‘有知识但无感知’的困境,即缺乏对书法作品微观笔法、墨法和结构的精细感知能力。通过一套开创性的严格数据处理流程,HCSU成功地将真实的墨迹本(帖)与石刻拓本(碑)解耦,彻底解决了长期困扰数字文化遗产领域的‘模态混淆’问题。数据集包含39,307张经过精心标注的高清汉字图像(统一归一化为256×256分辨率),并附有专家级的层次化美学描述。数据覆盖了从三国到近现代的10个主要历史朝代,囊括了49位中国艺术史上具有里程碑意义的书法名家,并全面涵盖了篆、隶、楷、行、草五种主要书体。根据数据来源和处理程度,HCSU划分为三个子域:1) 墨迹本(帖):3,780张图像,高度保留了真实的墨韵动态(如墨色浓淡、飞白纹理);2) 石刻拓本(碑):3,240张图像,提取了纯粹的几何结构和笔画张力;3) 野生数据:32,287张图像,为未经后续严格处理流程的原始书法作品字符图像。HCSU引入了超越传统‘扁平标签’的多维度、可解释的层次化注释框架。每个数据实例提供丰富的元数据:1) 语义与上下文真值:包括字符ID、书法家、朝代、来源媒介和保存质量;2) 细粒度视觉属性分解:具体描述墨法风格(墨色浓淡、枯润、渗化、飞白纹理)、笔法风格(微观笔触特征,如中锋、藏锋、方折)和字法结构(整体空间布局与几何比例);3) 专家自然语言描述:由书法鉴赏专家撰写的专业美学评述(50字以内),作为生成任务的真实参考。数据集适用于图像分类和图像到文本任务,特别是细粒度视觉识别、风格理解、文化遗产数字化分析和可解释人工智能等领域的研究。数据采用CC BY-NC 4.0许可,仅供学术和非商业研究使用。

HCSU (Fine-Grained Historical Calligraphy Style Understanding Dataset) is the first large-scale dataset and evaluation benchmark specifically designed for fine-grained historical calligraphy style understanding. It aims to address the knowledgeable but unperceptive dilemma of existing large vision-language models in the field of calligraphy art, i.e., the lack of fine-grained perception of micro-level brushwork, ink techniques, and structure in calligraphy works. Through a pioneering strict data processing pipeline, HCSU successfully decouples authentic ink manuscripts (Tie) from stone rubbings (Bei), completely solving the long-standing modal confusion problem in digital cultural heritage. The dataset contains 39,307 meticulously annotated high-definition Chinese character images (uniformly normalized to 256×256 resolution), accompanied by expert-level hierarchical aesthetic descriptions. The data spans 10 major historical dynasties from the Three Kingdoms to modern times, includes 49 milestone calligraphy masters in Chinese art history, and comprehensively covers five main script styles: Seal, Clerical, Regular, Running, and Cursive. Based on data source and processing level, HCSU is divided into three subdomains: 1) Ink Manuscripts (Tie): 3,780 images, highly preserving authentic ink dynamics (e.g., ink shades, flying white textures); 2) Stone Rubbings (Bei): 3,240 images, extracting pure geometric structures and stroke tension; 3) Wild Data: 32,287 images, raw calligraphy character images without subsequent strict processing. HCSU introduces a multi-dimensional, interpretable hierarchical annotation framework that goes beyond traditional flat labels. Each data instance provides rich metadata: 1) Semantic and Contextual Ground Truth: including character ID, calligrapher, dynasty, source medium, and preservation quality; 2) Fine-Grained Visual Attribute Decomposition: detailed descriptions of ink style (ink shades, dryness/wetness, diffusion, flying white textures), brushwork style (micro-brushstroke features, such as centered tip, hidden tip, square turns), and character structure (overall spatial layout and geometric proportions); 3) Expert Natural Language Descriptions: professional aesthetic comments (within 50 words) written by calligraphy appraisal experts, serving as ground truth for generation tasks. The dataset is suitable for image classification and image-to-text tasks, particularly in research areas like fine-grained visual recognition, style understanding, digital cultural heritage analysis, and explainable AI. The data is licensed under CC BY-NC 4.0 and intended solely for academic and non-commercial research use.

创建时间:
2026-06-23
原始信息汇总

HCSU:细粒度历史书法风格理解数据集

数据集概览

HCSU(Fine-Grained Historical Calligraphy Style Understanding Dataset)是首个专门用于细粒度历史书法风格理解的大规模数据集和评估基准,由同济大学团队构建,已被ECCV 2026收录。该数据集共包含39,307张经过精心标注的高清汉字图像,并配有专家级分层审美描述。

核心统计

  • 总规模:39,307张高分辨率汉字图像(归一化为256×256)
  • 时间跨度:覆盖从三国到现代的10个主要历史朝代
  • 书法家:涵盖49位中国艺术史里程碑式的书法大师
  • 书体分类:完整覆盖5种主要书体——篆书、隶书、楷书、行书、草书
  • 数据子域
    • 🖌️ 墨迹本(帖):3,780张图像,真实保留墨韵(墨色、飞白等)
    • 🪨 碑刻拓本(碑):3,240张图像,提取纯几何结构与笔画张力
    • 📜 原始数据:32,287张图像,为未经管道处理的书法作品原始汉字图像

数据标注体系

HCSU引入多维度、可解释的分层标注框架,每个实例提供以下元数据:

  1. 语义与上下文标注
    • 字符ID(char
    • 书法家(author
    • 朝代(dynasty
    • 来源介质(source_type
    • 保存质量(quality
  2. 细粒度视觉属性分解
    • ink_style:墨色密度、水分、渗透与飞白纹理
    • stroke_style:微观笔法特征(如中锋、藏锋、方折)
    • character_structure:整体空间布局与几何比例(如中宫收紧、欹正相生)
  3. 专家自然语言描述:由书法鉴赏家撰写的专业审美评论(50字以内)

数据处理管道

为解决历史档案中不同物理介质(纸本与石刻)造成的干扰,HCSU设计了多阶段严格处理流程:

阶段一:领域自适应极性归一化与视觉启发式纠正

  • 对拓本图像进行全局极性反转(255 - 灰度值),统一为“黑底白字”标准配置
  • 通过四角区域像素强度检查自动纠正元数据错误

阶段二:几何无损归一化

  • 将原始图像嵌入白色画布中心,保持原始宽高比
  • 使用Lanczos插值算法下采样至256×256分辨率,有效抑制锯齿效应

阶段三:形态学去噪与“真实墨韵”重建

  • 对二值掩码进行连通域分析,过滤小于50像素的独立噪声点
  • 将纯净语义掩码映射回几何对齐的原始高分辨率RGB图像
  • 所有背景像素替换为纯白色[255,255,255],在剥离背景干扰的同时100%保留墨色密度、笔画纹理与书写压力变化

评估协议

基于处理后的高质量数据,HCSU提出两项严格评估任务:

  1. 细粒度风格辨别(8选1候选选择):检验模型能否在1个正确风格与7个强干扰项中正确配对风格
  2. 可解释审美推理(风格描述生成):给定2-shot提示,模型需使用专业术语生成50字以内的书法评论,采用BERTScoreLLM-as-a-Judge双轨评估框架

许可协议

  • 代码与文档:Apache License 2.0
  • 数据集图像、压缩包、标注、样本及相关视觉资产:Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0),仅限学术与非商业研究用途

引用

bibtex @inproceedings{hcsu2026, title={HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding}, author={Yao, Yinsheng and Liu, Yan and Ye, Chen}, booktitle={Proceedings of the European Conference on Computer Vision (ECCV)}, year={2026} }

搜集汇总
数据集介绍
HCSU 数据集图片
构建方式
HCSU数据集的构建依赖于一套严谨的多阶段处理流程,旨在消解历史文献中不同物理媒介带来的模态混叠问题。首先,通过元数据驱动的极性反转与视觉启发式校正,将碑刻(Bei)的阴文图像统一为黑底白字标准格式。随后,采用Lanczos插值算法对图像进行几何无损归一化至256×256分辨率,在保持原始宽高比的前提下抑制走样效应。最后,通过形态学去噪算法滤除孤立噪声点,并将清洁后的语义掩模重新映射至原始RGB图像,用纯白色替换所有背景像素,从而完整保留墨迹密度、飞白肌理与运笔压力等真实墨韵特征。最终构建的39,307张高质量图像按来源细分为墨迹(Tie)、碑拓(Bei)与野外数据(Wild)三个子域,确保风格的纯净性与结构的一致性。
特点
HCSU数据集的显著特色在于其多层次、可解释的层级化标注架构,突破了传统书法数据集仅提供扁平化标签的局限。每个实例不仅包含字符、书家、朝代与来源介质等语义元数据,还精细拆解了墨法风格、笔法特征与间架结构三类视觉属性,从宏观布局到微观笔触实现多维度的艺术风格解耦。尤为独特的是,数据集为每幅图像配备了由书法鉴赏专家撰写的专业审美评述,将低层视觉特征与高层美学判断进行桥梁式衔接。这种兼顾技术维度与精神气韵的标注设计,使HCSU能够支撑细致的风格判别与可解释的美学推理,为大规模视觉语言模型提供了深厚的感知与理解基础。
使用方法
HCSU数据集设计了两种严谨的评估任务以衡量模型对书法风格的细粒度理解能力。第一项是风格判别任务,要求模型从包含1个目标风格与7个强干扰选项的候选池中正确配对风格,测试其借助微观笔法与结构特征进行风格鉴别的能力。第二项是可解释美学推理任务,基于少样本提示引导模型生成不超过50字的专业书法评述,并采用BERTScore与LLM-as-a-Judge双重评估框架,从术语准确性与细节丰富度两个维度进行评分。研究者可通过Hugging Face页面下载包含Bei与Tie子集的压缩档案及其对应注释文件。此外,开源的评估代码与提示模板可在GitHub仓库获取,便于复现实验结果或部署自定义验证流程。
背景与挑战
背景概述
HCSU(Fine-Grained Historical Calligraphy Style Understanding Dataset)是由同济大学研究团队于ECCV 2026提出的首个面向细粒度历史书法风格理解的大规模数据集与评测基准。该数据集由Yinsheng Yao、Yan Liu和Chen Ye共同创建,旨在突破现有大型视觉语言模型(LVLMs)在书法艺术感知领域的“知其然却不知其所以然”困境——模型虽然具备历史知识,却缺乏对书法风格细节的敏锐捕捉。HCSU包含39,307张经过专家级层次化美学标注的高清汉字图像,覆盖从三国至现代共10个主要朝代、49位里程碑式的书法名家,以及篆、隶、楷、行、草五种书体。通过独创的严格数据处理流程,数据集成功解耦了墨迹(帖)与拓片(碑)两种物理介质,彻底解决了长期困扰数字文化遗产领域的“模态混叠”问题,为书法风格的计算机分析与理解提供了全新的基准与范式。
当前挑战
HCSU数据集所解决的领域问题核心在于书法风格的细粒度感知与理解。传统OCR或文档AI数据集仅关注“内容识别”,而HCSU聚焦于艺术风格的微观差异感知,要求模型在视觉上区分同一书法家的不同字形、不同书法家相似字形的微妙笔法与结构特征。这涉及对墨色浓淡、飞白纹理、中锋用笔、藏锋露锋等高维视觉属性的识别。在构建过程中,团队面临重大挑战:历史档案中的物理介质干扰(如纸张老化、石纹裂纹)导致形态噪声;不同介质间的极性差异(碑白字黑底 vs 帖黑字白底)需自动化统一;传统直接缩放会破坏书法特有的结构张力。为此,HCSU设计了多阶段严格流水线,包括基于启发式视觉校正的极性反转、等比例无损几何归一化、形态学去噪与“真墨”外观重建,在剥离复杂背景的同时完整保留墨韵与笔压信息,最终构建出结构一致、可解释性强的评测基准。
常用场景
经典使用场景
HCSU数据集的核心应用场景聚焦于历史书法风格的细粒度理解与判别。研究者可借助该数据集,训练模型在无内容提示的前提下,仅凭笔画韧性、墨色浓淡、结体疏密等微观视觉特征,从多个候选作品中准确配对同一书家的风格。该场景精准模拟了艺术史研究中“辨伪存真”的专家能力,为书法风格鉴定提供了标准化的测试基准。
实际应用
在实际应用中,HCSU可被部署于博物馆的藏品数字化管理系统,辅助策展人员快速比对不同朝代书迹的风格归属。古玩拍卖领域可借助该数据集训练判别模型,对拍品真伪提供客观参考。其细粒度标注体系还能赋能书法教育,通过可视化分析帮助学习者精准理解笔法结构与墨韵变化。
衍生相关工作
该数据集衍生出一系列开创性工作,包括基于层次化美学描述解释的生成任务和对抗式风格迁移。研究者在其基础上开发了融合多模态视觉-语言模型的可解释书法分析系统,推动了对“飞白”纹理、逆锋回笔等专业笔法的定量解析。后续工作尝试将其两阶段感知框架扩展至绘画与篆刻领域,形成完整的传统文化智能理解生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务