遇见数据集

links-ads/cma-dataset

收藏
Hugging Face2026-06-05 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含截至2026年5月27日来自克利夫兰艺术博物馆的所有公共领域艺术品(元数据+图像)。所有数据最初以CC0或公共领域许可共享。数据集由三个字段组成:id(艺术品的唯一登录号)、metadata(包含艺术品相关元数据的JSON字典)和image(描绘艺术品的图像)。数据来源于克利夫兰艺术博物馆的开放获取资源,图像以web格式(最大边长900像素,保持原始宽高比)或print格式(最大边长3400像素)获取。数据集包含41,457件艺术品和92,123张图像(部分艺术品有多张图像)。原始图像和元数据由克利夫兰艺术博物馆以CC0许可发布,而本数据集(包括元数据和图像)由LINKS Foundation以CC BY 4.0许可发布,使用时需注明出处。

This dataset comprises all public domain artworks (metadata plus images) from the Cleveland Museum of Art as of May 27, 2026. All data was initially shared under CC0 or public domain licenses. The dataset is composed of three fields: id (the unique accession number of the artwork), metadata (a JSON dictionary containing pertinent metadata associated with the artwork), and image (the image that depicts the artwork). The data is sourced from the open access resources of the Cleveland Museum of Art. Images are available in two formats: web format (maximum side length of 900 pixels, with the original aspect ratio preserved) or print format (maximum side length of 3400 pixels). The dataset encompasses 41,457 artworks and 92,123 images; some artworks have multiple associated images. The original images and metadata are released by the Cleveland Museum of Art under a CC0 license, whereas this dataset (including both its metadata and images) is released by the LINKS Foundation under a CC BY 4.0 license, and proper attribution is required when using the dataset.

提供机构:
links-ads
搜集汇总
数据集介绍
links-ads/cma-dataset 数据集图片
构建方式
该数据集收录了克利夫兰艺术博物馆截至2026年5月27日的全部公有领域艺术品数据。其元数据来源于博物馆官方的开放数据仓库,而图像则依据元数据中的链接进行批量获取。在图像采集过程中,优先采用最大边长为900像素的网页格式,若该格式不可用,则替换为最大边长3400像素的打印格式,以兼顾图像质量与存储效率。为确保数据的合法合规,数据集仅纳入许可状态标注为CC0的作品,最终整合为包含唯一识别号、元数据JSON字段及图像字段的结构化语料库,总图像数量达到92,123张。
使用方法
用户可通过HuggingFace数据集库直接加载本数据集,默认配置下将获取包含训练集的整体数据。每条数据由三个字段构成:'id'字段提供艺术品的唯一标识符,便于跨数据集引用与匹配;'metadata'字段以JSON格式存储结构化的元数据,适合进行条件生成或检索任务;'image'字段则直接提供PIL图像对象,可用于视觉模型的训练与评估。建议研究者在加载后首先解析元数据字段以提取所需属性,并注意部分作品存在多张关联图像,可基于id字段进行聚合处理。数据集采用CC BY 4.0许可,使用时应注明数据来源及贡献者信息。
背景与挑战
背景概述
在数字人文与文化遗产领域,大规模、高质量的艺术品开放数据集对推动计算机视觉和跨模态检索研究具有重要价值。Cleveland Museum of Art公共领域数据集(cma-dataset)由LINKS Foundation于2026年创建,整合了克利夫兰艺术博物馆截至2026年5月27日所有CC0许可的公共领域艺术品资源,包含92,123张图像与41,457件艺术品的详细元数据。该数据集的核心研究问题聚焦于艺术品的多模态理解,旨在为图像描述生成、文本到图像检索、图像风格迁移等任务提供标准化基准。作为少数完全开放获取的艺术数据集之一,它弥补了现有数据集在规模、许可透明度和元数据丰富性上的不足,对艺术史计算分析、博物馆数字化应用及AI创作工具研发产生了深远影响。
当前挑战
该数据集所解决的领域挑战在于艺术品的细粒度分类与多模态对齐难题:传统图像数据集难以捕捉艺术品的风格、时期、媒介等高层语义特征,而该数据集通过结构化元数据为跨模态学习提供了基础。在构建过程中,主要挑战包括图像与元数据的异构整合——原始数据来自官方数据转储和URL抓取,需处理图像分辨率不一致(web格式与print格式并存)及部分图像缺失的问题。此外,许可一致性校验是关键难点:虽已通过字段过滤确保CC0状态,但仍需手动核查潜在版权争议,且数据集更新需与博物馆持续开放数据同步。存储与传输方面,超过28GB的原始文件对数据版本管理与分发效率提出了要求。
常用场景
经典使用场景
在数字人文与计算机视觉的交叉领域中,cma-dataset作为来自克利夫兰艺术博物馆的公共领域艺术品数据集,为图像描述生成(image-to-text)与文本驱动图像生成(text-to-image)等跨模态任务提供了丰富的艺术素材。研究者可利用其包含的九万余幅高分辨率艺术作品图像及配套的结构化元数据,开展艺术品自动标注、风格识别、作品主题分类等经典研究,推动从视觉特征到语义描述的映射能力在文化遗产场景下的提升。
解决学术问题
该数据集有效解决了艺术领域大规模标注数据匮乏的学术瓶颈,为无监督或弱监督学习在艺术品分析中的落地提供了标准化基准。它支持学术社区在图像检索、多模态对齐、艺术风格迁移等方向开展可比性研究,并促使模型从纯粹的自然图像理解拓展至对艺术史脉络中色彩、构图、肌理与象征意义的深层解析,从而推动计算机视觉向更具人文内涵的认知层次迈进。
实际应用
在实际应用层面,cma-dataset可赋能博物馆数字展厅的智能导览系统,通过图像理解技术自动生成展品解说词或语音导览内容;亦可用于开发辅助艺术教育与创作的交互式工具,例如基于文本描述检索相似艺术作品、或根据用户输入的风格诉求生成具有特定艺术流派特征的新图像,从而降低公众接触与理解艺术的门槛,扩展文化遗产的数字化传播边界。
数据集最近研究
最新研究方向
cma-dataset作为克利夫兰艺术博物馆公共领域艺术品的结构化集合,正推动艺术与人工智能的交叉研究迈向新高度。当前前沿方向聚焦于多模态生成与理解,利用该数据集的图文对齐特性,研究人员可训练图像到文本的自动描述、文本到图像的风格化生成,以及图像间的语义转换模型。结合数字人文浪潮,该数据集赋能文化遗产的数字化修复与虚拟展示,支持zero-shot艺术分类与跨文化风格迁移,其大规模CC0授权特性还降低了版权壁垒,为公平、可复用的AI艺术基准测试提供关键资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务