遇见数据集

chinese-painting-collection

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

中国绘画收藏数据集包含91,438张中国绘画图像,附带双语(中文/英文)视觉语言模型描述、书法OCR转录、视角分类以及异物检测边界框。图像来源包括台北故宫博物院(86,666张,遵循台湾政府开放数据许可证)、大都会艺术博物馆(1,186张,CC0)、史密森尼弗利尔美术馆(1,782张,CC0)、普林斯顿大学艺术博物馆(1,631张,研究用途)和芝加哥艺术博物馆(173张,CC0)。数据经过采集、规则清洗(仅保留完整、装裱和细节视图)、VLM标注(使用gemini-3.5-flash-lite生成中文和英文描述、OCR文本、视角类型和文化属性)以及异物检测(识别色卡、标尺、桌面等并生成裁剪边界框)。数据以WebDataset tar分片形式存储,每个样本包含JPEG图像和JSON侧车文件,另提供parquet元数据文件便于过滤。视角分布:装裱视图43,548张、完整视图36,253张、细节视图11,637张。适用任务包括图像描述生成、文本到图像生成、OCR、文化分类等。建议使用时可过滤掉包含异物的图像或应用边界框裁剪,以及按文化或视角筛选。标注以CC-BY-4.0发布,图像保留原始来源许可证。

Chinese Painting Collection is a dataset containing 91,438 Chinese painting images, accompanied by bilingual (Chinese/English) VLM descriptions, calligraphy OCR transcriptions, viewpoint classifications, and foreign object detection bounding boxes. Image sources include the National Palace Museum in Taipei (86,666 images, subject to the Taiwan Government Open Data license), the Metropolitan Museum of Art (1,186 images, CC0), the Smithsonian Freer Gallery of Art (1,782 images, CC0), the Princeton University Art Museum (1,631 images, research use), and the Art Institute of Chicago (173 images, CC0). The data underwent collection, rule-based cleaning (retaining only complete, mounted, and detail views), VLM annotation (using gemini-3.5-flash-lite to generate Chinese and English descriptions, OCR text, viewpoint types, and cultural attributes), and foreign object detection (identifying color cards, rulers, tables, etc., and generating crop bounding boxes). Data is stored in WebDataset tar shards, each sample containing a JPEG image and a JSON sidecar file, with additional parquet metadata files for easy filtering. Viewpoint distribution: mounted view 43,548, complete view 36,253, detail view 11,637. Applicable tasks include image captioning, text-to-image generation, OCR, cultural classification, etc. It is recommended to filter out images with foreign objects or apply bounding box cropping, and to filter by culture or viewpoint when using. Annotations are released under CC-BY-4.0, images retain original source licenses.

创建时间:
2026-08-31
原始信息汇总

数据集概述

该数据集名为 Chinese Painting Collection,包含 91,438 张中国绘画图像,并配有中英双语视觉语言模型(VLM)描述、书法 OCR 转录、视图类型分类、部分子集的长描述,以及异物检测与最终裁剪框信息。

数据来源

组成部分 来源机构 图像数量 图像许可
npm_tw_c0npm_tw_c3 台北国立故宫博物院开放数据 86,666 台湾开放政府数据许可 v1(需注明出处)
met_china 大都会艺术博物馆开放获取 1,186 CC0
fsg 史密森尼弗利尔美术馆 / 国家亚洲艺术博物馆 1,782 CC0
princeton 普林斯顿大学艺术博物馆 1,631 需查阅来源条款,供研究使用
aic_china 芝加哥艺术学院 173 CC0

其中四个台北故宫组成部分是该机构开放数据的季度分片,经去重并筛选出可用视图;博物馆部分均通过各机构公开 API 采集,并筛选与中国绘画相关的物件。

生成流程

  1. 采集:从来源 API / 开放数据包获取图像与基础元数据(标题、艺术家、年代、物件编号)。
  2. 基于规则的清洗:移除非艺术作品视图(如卷轴展开、装置照、封面、损坏或不可读图像、近似重复项),仅保留 fullmounteddetail 三种视图。
  3. VLM 标注(gemini-3.5-flash-lite):对每张图像生成中英文描述、可见书法文字的 OCR 转录及印章描述、视图类型、文化归属字段(chinese 88,928 张、japanese 2,255 张、korean 83 张、western 10 张、other 20 张、uncertain 142 张)。
  4. 异物检测:识别博物馆摄影中常见色卡、尺子、标签、桌面、眩光等异物(39,509 张非空),并返回作品裁剪框。
  5. 第二轮裁剪:对首轮标记的图像在已裁剪视图内再次定位作品框,两框合成为原始照片坐标系中的单一 bbox。每行恰有一个最终 bbox,存在于 39,338 张图像中;171 张标记图像无框,以未裁剪形式保留。
  6. 文本并入描述:OCR 转录作为尾部块并入 caption_zh / caption_en,供文生图模型使用。
  7. 长描述:59,860 张图像额外获得由 DeepSeek V4.1 Flash 生成的更长描述(caption_long),中位长度 488 tokens,p90 为 817,最大 4,415;模型查看的是裁剪后视图。

数据格式

数据以 Parquet 分片存储于 default/train/part-*.parquet,每行一张图像,包含 image 列(struct<bytes: binary, path: string> 类型)。包含以下列:

image_idshardsourceobject_notitleartistcategorycultureview_typecaption_zhcaption_encaption_longocr_textartifacts(列表)、bbox(四个浮点数列表)、image

bbox 为归一化的 [x_min, y_min, x_max, y_max],单位为千分比坐标(0–1000)。视图类型分布:mounted 43,548 · full 36,253 · detail 11,637。

建议筛选方式

  • 仅训练作品主体:应用 bbox 裁剪(推荐),bbox 为空则无需裁剪。
  • 最干净子集:额外丢弃 artifacts 非空的行。
  • 排除装裱边框:保留 view_type == "full""detail"
  • 仅中国绘画:保留 culture == "chinese"
  • 长文本训练:在存在 caption_long 处使用该字段。

注意事项

  • 描述与 OCR 均由轻量级 VLM 机器生成,草书书法转录可能偶有错误。
  • 裁剪框是模型对"作品在哪里"的作答,通常能移除色卡、尺子和标签条,但多数情况下会沿一条边缘留下薄背景条。
  • detail 视图属大作品局部特写,可能与同一物件(相同 object_no)的 full 视图内容重复。
  • 171 张图像虽有异物但无裁剪框,以未裁剪形式发布。

许可信息

图像保留各自来源的许可(见上表)。台北故宫部分需依台湾开放政府数据许可 v1 注明出处为國立故宮博物院(National Palace Museum, Taipei)。标注数据(描述、OCR、分类、裁剪框)以 CC-BY-4.0 发布。

搜集汇总
数据集介绍
chinese-painting-collection 数据集图片
构建方式
该数据集整合了来自台北故宫博物院、大都会艺术博物馆、史密森尼弗利尔美术馆、普林斯顿大学艺术博物馆及芝加哥艺术学院的公开中国绘画图像,总计91,438幅。构建流程始于从各机构API或开放数据包中采集图像与元数据,继而通过规则清洗剔除卷轴、装置照、封面及不可读图像,仅保留全幅、装裱与局部视图。随后运用轻量级视觉语言模型为每幅图像生成中英双语描述、书法OCR转录、视角分类及异物检测,并针对部分图像执行二次裁剪以精确定位画心,最终将转录文本融入描述字段,同时为59,860幅图像补充了长描述。
使用方法
使用者可通过Hugging Face datasets库加载Parquet分片,每行对应一幅图像及其元数据。建议依据任务需求进行筛选:训练图像生成模型时,应用bbox裁剪以去除博物馆拍摄背景,空bbox表示原图即画心;追求纯净数据可剔除artifacts非空的行;若需排除装裱边框,保留view_type为full或detail的样本;专注中国绘画则筛选culture为chinese。长文本训练可选用caption_long字段,而ocr_text提供原始书法转录。裁剪操作依据归一化坐标(千分比)执行,预览目录提供裁剪前后对比示例。
背景与挑战
背景概述
中国绘画作为世界艺术瑰宝,其数字化整理与智能理解一直是跨学科研究的重要议题。chinese-painting-collection数据集由kaupane团队构建,于2024年发布,整合了台北故宫博物院、大都会艺术博物馆、史密森尼弗利尔美术馆等五家机构公开的91,438幅中国绘画图像,并借助轻量级视觉语言模型生成双语描述、书法OCR转录及长文本标注。该数据集旨在回应艺术图像多模态理解与生成任务中高质量标注数据匮乏的核心问题,为图像到文本和文本到图像任务提供大规模、多维度、可溯源的中文艺术图像资源,对推动数字人文与计算机视觉的交叉研究具有显著影响力。
当前挑战
在领域问题层面,中国绘画的自动理解面临风格多样、题跋印章复杂、装裱形式多变等固有难点,传统图像分类或描述模型难以捕捉其美学与文化语义。构建过程中,数据来源异构导致许可与元数据规范不一,需进行去重、视图筛选与跨馆对齐;机器生成的描述与OCR转录在草书识别上存在误差,且外物检测与裁剪框的准确性受拍摄环境影响,部分图像仍保留色卡、标尺等干扰。这些因素共同构成数据集在标注质量、领域适应性与跨模态对齐方面的核心挑战。
常用场景
经典使用场景
在中国古代书画的数字人文研究脉络中,该数据集最经典的使用场景是服务于跨模态图像-文本生成任务。依托九万余幅绘画图像及其双语视觉语言模型描述,研究者可开展图像到文本的自动描述生成与文本到图像的绘画合成,同时借助书法OCR转写字段进行题跋识读,利用裁切框剥离博物馆拍摄中的色卡、标尺等外物,从而在训练与推理中获得更为纯净的画心视图,为绘画风格建模与构图理解提供高质量的视觉-语言监督信号。
解决学术问题
长期以来,中国绘画研究受制于高质量双语标注资源的匮乏,馆藏著录与图像之间往往存在语义鸿沟,题跋识读亦高度依赖专家经验。该数据集以机器生成的双语描述、书法转写、视图类型分类及外物检测框,缓解了跨模态对齐数据稀缺、题跋自动识读困难以及博物馆摄影噪声干扰等常见学术问题,为绘画风格计算分析、题跋文本挖掘和跨语言艺术检索提供了可复用的基准资源,推动了艺术史与计算机视觉的交叉研究。
实际应用
在博物馆数字化与文化遗产传播的实践场景中,该数据集可支撑智能导览与藏品检索系统的构建,使观众以自然语言查询绘画内容并获取双语解说;其裁切框与视图分类有助于自动生成展览级画心图像,减少人工修图成本;长描述字段可用于生成详尽的藏品说明,辅助线上展览与教育内容生产,同时为绘画图像修复、风格迁移与文创设计等应用提供数据基础。
数据集最近研究
最新研究方向
在数字人文与多模态学习深度交融的学术语境下,该数据集凭借近十万幅中国绘画图像及中英双语视觉语言模型标注、书法OCR转录、长文本描述与异物检测裁剪框,正推动中国艺术图像的跨模态理解与生成研究走向纵深。当前前沿探索集中于利用其细粒度标注开展文本到图像生成中的风格与构图控制、基于OCR的题跋与印鉴自动释读,以及面向博物馆摄影伪影的鲁棒性图像修复与目标检测。该数据集亦呼应了全球博物馆开放数据运动与文化遗产智能计算的热点,为少量样本下的中国绘画风格迁移、跨文化图像检索及多语言艺术描述生成提供了关键基准,对促进传统艺术资源的可计算化与知识传播具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务