遇见数据集

HCSU

收藏
arXiv2026-07-05 更新2026-07-07 收录
官方服务:

资源简介:

HCSU是由同济大学研究团队构建的首个面向细粒度历史书法风格理解的大规模数据集,旨在解决文化遗产保护中书法风格自动感知的难题。该数据集包含39,307张精心筛选的字符图像,涵盖10个历史朝代、49位著名书法家的作品,并系统性地将墨迹真迹与碑刻拓片分离以消除模态混合问题。数据集通过专家撰写的层次化美学描述,将抽象风格分解为墨色风格、笔触风格和字形结构等视觉属性,支持风格判别与可解释美学推理任务。该基准主要应用于书法艺术分析、多模态人工智能模型评估及数字人文研究,致力于推动具备专家级视觉推理能力的文化遗产保护技术发展。

HCSU is the first large-scale dataset for fine-grained historical calligraphy style understanding, constructed by the research team from Tongji University, aiming to address the challenge of automatic perception of calligraphy styles in cultural heritage preservation. This dataset contains 39,307 carefully screened character images, covering works from 10 historical dynasties and 49 renowned calligraphers. It systematically separates original ink handwritten works from stele rubbings to eliminate modality mixing problems. Through hierarchical aesthetic descriptions authored by experts, the dataset decomposes abstract calligraphy styles into visual attributes such as ink tone style, brushstroke style and character structure, supporting style discrimination and interpretable aesthetic reasoning tasks. This benchmark is mainly applied to calligraphy art analysis, multimodal AI model evaluation and digital humanities research, and is committed to promoting the development of cultural heritage preservation technologies with expert-level visual reasoning capabilities.

创建时间:
2026-07-05
原始信息汇总

数据集概览:HCSU(精细历史书法风格理解数据集)

  • 名称:HCSU: Fine-Grained Historical Calligraphy Style Understanding Dataset (V1.0)
  • 发布者:Yinsheng Yao, Yan Liu, Chen Ye(同济大学,ECCV 2026)
  • 语言:中文、英文
  • 许可协议
    • 数据集(图像、标注等):CC BY-NC 4.0(仅限非商业研究)
    • 代码与文档:Apache 2.0
  • 任务类型:图像分类、图像到文本生成
  • 标签:图像、书法、中国书法、历史文档、细粒度识别、文化遗产、风格理解
  • 数据规模:39,307张(10K < n < 100K)

核心特点与创新

  • 解决大型视觉语言模型(LVLMs)“有知识但缺乏细粒度书法风格感知”的困境。
  • 首次推出针对历史书法风格细粒度理解的大规模数据集与评估基准。
  • 成功解耦墨迹(Tie)与碑拓(Bei),解决“模态混叠”问题。

数据集统计详情

维度 具体内容
总规模 39,307张高分辨率汉字图像(归一化至256×256),经严格人工验证
历史跨度 覆盖10个主要朝代(三国至现代),涉及49位书法名家
字体覆盖 5大书体全涵盖:篆书、隶书、楷书、行书、草书
三个子域 墨迹(Tie, 3,780张)、碑拓(Bei, 3,240张)、原始作品图(Wild, 32,287张)

多维层次化标注框架

每个实例提供以下丰富的元数据:

  1. 语义与上下文真实信息
    • 字符ID(char)、书法家(author)、朝代(dynasty)、介质类型(source_type)、保存质量(quality)
  2. 细粒度视觉属性分解
    • 笔墨风格(ink_style):墨色浓度、湿度、渗透、飞白等
    • 笔法风格(stroke_style):中锋、藏锋、方折等微观笔触特征
    • 字体结构(character_structure):空间布局、几何比例(如“中宫紧收”“欹正动态平衡”)
  3. 专家自然语言描述:由书法鉴赏家撰写的专业美学评语(不超过50字),作为生成任务的真值

数据处理管线

为消除复杂背景干扰(如纸张老化、装裱边界、石裂纹),设计多阶段严格管线:

  1. 领域自适应极性归一化与视觉启发式校正
    • 碑拓(Bei)统一反色为“黑字白底”
    • 通过角区域像素强度检查,自动修正元数据错误,确保极性准确
  2. 几何无损归一化
    • 将原图嵌入最大边长画布,采用Lanczos插值缩放到256×256,保持原始长宽比和笔画锐度
  3. 形态学去噪与“真墨”外观重建
    • 对二值掩码进行8连通域分析,滤除小于50像素的噪声
    • 清洁掩码重新映射回原始高分辨率RGB图像,背景替换为纯白色,保留100%墨色、笔触纹理和书写压力变化

评估协议

基于处理后的高质量数据,提出两项严格评估任务(测试集采用严格反泄漏采样规则,确保目标与参考图像不包含相同字符):

  1. 细粒度风格辨别(8选1):从1个正确风格和7个强干扰项中,仅凭微观笔法与结构特征配对风格
  2. 可解释美学推理(风格描述生成):给定2-shot提示,模型需用专业术语生成50字以内的书法评论,采用BERTScore和LLM-as-a-Judge双轨评估(术语准确性与细节丰富度)
搜集汇总
数据集介绍
HCSU 数据集图片
构建方式
HCSU数据集构建源于对中国历代书法作品中线条质感与笔墨意蕴的深入观察。研究团队从一观书法数字档案中精选图像,遵循严格筛选标准,聚焦于在书法史上具有卓越地位的49位书家,横跨10个朝代。针对传统碑帖数据集普遍存在的模态混杂问题,数据被系统划分为三类域:经精细化处理的墨迹本(Tie,3780幅)、拓本(Bei,3240幅)及不受约束的原始图像(Wild,32287幅),共计39307幅精心校对的256×256像素字符图像。构建过程包含前景背景规范化、几何归一化及语义掩膜重建等多阶段流水线,旨在消除非风格干扰因素,保留真实的笔触纹理与墨色变化。
特点
该数据集的独特之处在于其层次化的细粒度标注体系,突破了传统“扁平化标签”的局限。每个字符不仅标注了字符身份、书家与朝代等元信息,更深入拆解了抽象风格,提供由书法专家撰写的分类美学描述,涵盖笔法(stroke_style)、用墨(ink_style)、结体(character structure)及整体气韵等维度。这种多层次的解构不仅实现了风格识别,更构建了可解释的审美推理基准。HCSU涵盖篆、隶、楷、行、草五大书体,其精心的域划分(Tie、Bei、Wild)为评估模型在不同模态下的鲁棒性提供了独特视角,揭示了当前视觉模型对高对比度几何轮廓的偏好及其对连续笔触纹理感知的不足。
使用方法
HCSU设计了两种严谨的评估协议,旨在全面衡量模型对书法风格的感知能力。其一为细粒度风格判别任务(8-way候选选择),模型需从包含真实风格描述与参考图像的八个候选中,精准选出与目标图像风格匹配的一项,以测试其视觉分辨力。其二为可解释审美推理任务(风格描述生成),模型必须在2-shot上下文学习下,为未见过的书法图像生成50字内的专业描述,并通过BERTScore及LLM-as-a-Judge双框架,从术语准确性与细节丰富度两个维度进行评估。数据集已在Hugging Face平台公开发布,Bei与Tie域直接可用,Wild域需申请获取,确保数据使用的可控性与学术规范性。
背景与挑战
背景概述
在文化遗产数字化保护与人工智能交叉领域,书法风格的精细感知始终是一项极具挑战性的任务。由同济大学计算机科学与技术学院姚寅申、刘岩、叶晨等研究人员于2026年提出的HCSU数据集,正是为攻克这一难题而生。该数据集聚焦于历史书法风格的细粒度理解,收录了跨越10个朝代、49位杰出书法家的39,307幅精心筛选的字符图像,系统性地将墨迹(帖)与拓片(碑)两种模态分离,解决了长期困扰该领域的模态混杂问题。HCSU不仅提供了分层级的专家美学描述,还建立了细粒度风格判别与可解释美学推理的双重评估协议,为大型视觉语言模型(LVLMs)在文化遗产保护中的专家级视觉推理能力树立了全新标杆。
当前挑战
HCSU所应对的挑战具有双重性。其一,在领域问题层面,书法风格理解要求模型从视觉形态迥异的字符中识别并剥离出抽象的作者风格,而非简单的类别区分,这对于当前仅擅长粗粒度目标识别的LVLMs而言是严峻考验,模型常陷入“博学却不善感知”的困境,即能识别字符却无法捕捉笔触中的艺术精髓。其二,在数据集构建过程中,团队面临了处理多模态图像(帖与碑的极性反转、背景干扰)的复杂任务,开发了统一的多阶段处理流程以消除非风格混杂因素,并设计了严格的专家标注质量控制体系,确保美学描述的准确性与一致性,这为同类文化遗产数据集的建设提供了宝贵经验。
常用场景
经典使用场景
在文化遗产数字化保护与智能分析的学术浪潮中,HCSU数据集为书法风格的细粒度感知与审美推理提供了极具代表性的评测基石。其最经典的使用场景在于构建严格受控的K路风格判别任务(最优配置为8路),通过在同一字符结构与不同作者风格之间建立精细的视觉映射,精准评估大规模视觉语言模型在解耦内容与艺术表达上的感知深度。该数据集将墨迹拓本与石刻拓片分域处理,有效消除了模态混叠带来的风格干扰,使得研究者能够在统一的标准下检验模型对笔法节奏、墨色浓淡、结构疏密等微观艺术特征的敏感程度,为书法风格智能识别树立了权威的评测范式。
解决学术问题
该数据集的诞生填补了历史书法风格理解领域长期存在的两大关键学术空白——模态混叠与标签扁平化。一方面,通过将墨迹手札与石刻拓片分离处理,HCSU彻底解决了传统数据集中因媒介差异导致的风格特征污染问题,为真实笔墨感知提供了纯净的评测环境。另一方面,其引入的多层级专家标注体系将抽象的艺术风格分解为笔墨风格、线条质感与结体特征等可量化的视觉维度,突破了以往仅依赖字符身份或作者标签的简单分类框架。这些创新使研究者得以系统性地揭示当前多模态模型在审美推理层面的“博学而不善察”困境,即模型虽能借助语言先验识别字符,却难以将判断锚定在真实的笔触证据上,从而推动了专家级视觉推理能力的理论探索与方法演进。
衍生相关工作
HCSU数据集催生了一系列富有启发性的衍生研究工作。基于其对“博学而不善察”现象的揭示,研究者开始探索参数高效微调策略与思维链提示技术在书法风格感知中的适应能力,试图弥合模型判别力与生成性审美推理之间的鸿沟。此外,该数据集严谨的模态分离与多层级标注框架,激励了面向特定艺术领域的视觉语言模型架构优化工作,例如改进视觉编码器对连续墨迹纹理的敏感性,或构建文化领域对齐的语义表征。这些衍生的探索不仅深化了人们对多模态模型在细粒度艺术理解中瓶颈的认识,也为下一代具备专家级视觉推理能力的智能系统指明了发展路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务