遇见数据集

CHR_detection_trees

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集名为绘画中的主题分割,专门用于支持19世纪北欧绘画中景观和树木主题的研究。数据集由奥胡斯人文计算中心(chcaa)的黄金矩阵项目团队使用SAM3模型生成,包含从博物馆和Wikidata来源收集的4,727幅绘画。对于每幅画中检测到的树木实例,数据集记录了其边界框、置信度分数和分割掩码,并附带了绘画级别的元数据,如艺术家、国籍、创作日期和收藏信息等。每行数据对应一幅绘画,具体字段包括:原始图像文件名和字节数据、绘画元数据(标题、艺术家、艺术家国籍、创作年份、收藏机构、地点、库存编号、QID、Wikidata URL、原始图像URL、图像文件名)、图像版权信息、原始图像尺寸、检测到的树木边界框、置信度分数和数量、图像嵌入向量,以及以.npz文件原始字节形式存储的分割掩码(可通过指定代码加载为布尔数组)。该数据集(包括掩码、元数据、嵌入向量和注释)采用CC-BY-4.0许可证发布。

This dataset, named Theme Segmentation in Paintings, is specifically designed to support research on landscape and tree themes in 19th-century Nordic paintings. It was generated by the Gold Matrix project team at the Center for Humanities Computing Aarhus (chcaa) using the SAM3 model, containing 4,727 paintings collected from museums and Wikidata sources. For each detected tree instance in a painting, the dataset records its bounding box, confidence score, and segmentation mask, along with painting-level metadata such as artist, nationality, creation date, and collection information. Each row of data corresponds to a painting, with specific fields including: original image filename and byte data, painting metadata (title, artist, artist nationality, creation year, collection institution, location, inventory number, QID, Wikidata URL, original image URL, image filename), image copyright information, original image dimensions, detected tree bounding boxes, confidence scores and counts, image embedding vectors, and segmentation masks stored as raw bytes in .npz files (which can be loaded as boolean arrays using specified code). The dataset (including masks, metadata, embedding vectors, and annotations) is released under the CC-BY-4.0 license.

创建时间:
2026-07-23
原始信息汇总

数据集概述:绘画中的主题分割(树木检测)

该数据集专注于19世纪北欧绘画中树木主题的检测与分割,由奥胡斯大学人文计算中心(chcaa)的“金色矩阵”项目团队制作。

  • 研究背景:支持对19世纪北欧绘画中的风景与树木主题进行研究。
  • 数据来源:覆盖来自博物馆和维基数据源的 4,727幅 绘画作品。
  • 检测方法:使用 SAM3 模型检测每幅画中的树木实例。

数据集内容

数据集中每一行对应一幅绘画,包含以下字段:

绘画元数据

  • filenameimage:原始图像文件名及原始图像字节
  • titleartistArtist-nationalityinceptioncollectionlocationinventory_numberqidwikidata_urlimage_url_rawimage_filename:绘画的标题、艺术家、国籍、创作日期、收藏机构、位置、库存编号、维基数据ID、维基数据URL、原始图像URL、图像文件名

版权与尺寸

  • Image-rights:原始图像的权利/许可信息(按绘画记录)
  • original_heightoriginal_width:原始图像的尺寸(高度和宽度)

树木检测结果

  • boxes:检测到的树木边界框
  • scores:每个检测结果的置信度分数
  • count:检测到的树木数量
  • embedding:图像嵌入向量
  • mask:原始字节形式的 .npz 文件;加载方式为 np.load(io.BytesIO(row["mask"]))["masks"],得到形状为 (count, 1, H, W) 的布尔数组(分割掩码)

许可协议

该数据集(由chcaa团队——Rie Schmidt Eriksen、Louise Brix Hansen和Marta Kipke——生成的掩码、元数据、嵌入和注释)以 CC-BY-4.0 许可协议发布。

搜集汇总
数据集介绍
CHR_detection_trees 数据集图片
构建方式
该数据集源自北欧人文计算中心开展的黄金矩阵项目,旨在支持对19世纪北欧绘画中树木主题的量化研究。研究团队从博物馆及Wikidata等来源采集了4,727幅绘画作品,并借助SAM3模型对每幅画作中的树木实例进行自动检测,生成对应的边界框、置信度评分及分割掩码。每一行数据代表一幅画作,包含画作元数据(如艺术家、国籍、创作年份、馆藏地)以及检测结果的文本与视觉信息。其中,掩码数据以.npz格式存储于原始字节中,可通过加载后获得布尔型数组,便于后续图像分析。
特点
该数据集以高覆盖度的绘画图像为基础,整合了丰富的画作元数据与精细的物体检测结果,兼具艺术史研究与计算机视觉应用的双重价值。每个检测到的树木实例均配有边界框、置信度与分割掩码,形成多维度的标注体系。尤为突出的是数据集提供了图像嵌入向量,为图像检索与特征聚类提供了支持。数据遵循CC-BY-4.0许可协议发布,鼓励学术再利用,同时要求引用原始创作团队,体现了开放科学精神。
使用方法
研究人员可通过Python环境读取数据集,利用HuggingFace数据集库加载图像与元数据。对于掩码数据的解析,需利用numpy库的load方法并配合io.BytesIO处理字节流,以获取形状为(count, 1, H, W)的布尔数组。边界框与置信度分数可直接用于对象检测模型的评估或训练,而嵌入向量则适用于风格分析或主题聚类任务。建议结合画作元数据对检测结果进行分组比较,探索树木表现与艺术家国籍、时期或地域之间的潜在关联。
背景与挑战
背景概述
在计算艺术史与数字人文领域,视觉素材的结构化分析日益成为揭示艺术风格与文化演进的关键手段。CHR_detection_trees数据集源于奥胡斯大学人文计算中心(CHCAA)的“金色矩阵”研究项目,由Rie Schmidt Eriksen、Louise Brix Hansen及Marta Kipke等人于近年创建,旨在系统性地解析19世纪北欧绘画中的树木母题。该数据集覆盖来自博物馆与维基数据源的4,727幅画作,利用SAM3模型自动检测树木实例,记录边界框、置信度分数及分割掩码,并辅以艺术家国籍、创作年代等元数据。其贡献在于为量化研究风景画中树木的形态、分布与历史演变提供了大规模、可复用的基准资源,有力推动了数字人文与计算机视觉的交叉创新。
当前挑战
该数据集核心挑战在于解决艺术图像中树木检测与分割的领域特殊性问题。相比于自然场景,绘画作品风格多样(如印象派、浪漫主义)、笔触抽象且光照与色彩高度主观化,通用实例分割模型(如SAM3)易产生误检或漏检,尤其在重叠树木、模糊轮廓或低对比度区域。构建过程中,严格的质量控制成为难题:4,727幅画作源自不同博物馆与维基数据源,图像分辨率、版权标注及元数据格式差异显著,需人工校验与统一标准化。此外,树木定义本身具有模糊性——灌木、枝干或前景阴影可能被误标为树木,需构建明确标注准则以消歧义,这要求跨学科合作(艺术史与计算机视觉专家协同),显著增加了数据集的构建复杂度与维护成本。
常用场景
经典使用场景
在计算艺术史与数字人文的交叉领域中,CHR_detection_trees数据集为景观绘画中的树木主题检测提供了标准化基准。其核心应用场景在于利用深度学习模型(如SAM3)对19世纪北欧绘画中树木实例进行精确分割与定位,研究者可通过该数据集提取边界框、置信度分数及分割掩码,从而系统性地分析树木在画面中的空间分布与视觉特征。该数据集覆盖4,727幅来自博物馆与Wikidata的绘画作品,为跨地域、跨时间的艺术风格比较提供了丰富的样本基础。
衍生相关工作
该数据集催生了多项前沿研究路径,一是推动了微调的语义分割模型(如SAM3)在艺术图像领域的领域适应与迁移学习探索,衍生出针对绘画中植物、天空等非刚性目标分割的改进算法。二是启发了基于树主题分布的时间序列分析工作,用于揭示植被表现与工业化进程、浪漫主义思潮之间的隐性关联。三是嵌入了多模态对比学习框架,将视觉嵌入向量与文本元数据联合训练,形成了绘画主题自动标注与跨语言检索的系列研究,促进了数字人文与计算机视觉的协同创新。
数据集最近研究
最新研究方向
在计算艺术史与数字人文学科的交叉前沿,CHR_detection_trees数据集为19世纪北欧绘画中的树木母题研究提供了革命性的量化分析工具。该数据集通过SAM3模型从4727幅馆藏与维基数据源的画作中自动检测树木实例,产出边界框、置信度分数与分割掩码等结构化信息,其核心价值在于将经典图像学中的“母题”概念转化为可计算的视觉单元。当前研究前沿聚焦于利用该数据集探索树木形态与画家国籍、创作年代及艺术流派的隐含关联,尤其在浪漫主义与自然主义绘画中,树木作为风景构成的语义基元,其空间分布与风格演变可揭示19世纪北欧景观认知的深层变迁。结合嵌入向量与大规模元数据,研究者可构建跨画作的树木形态聚类网络,推动艺术风格演变与生态美学观念的联合建模,这一方向不仅革新了传统艺术史的视觉证据推理范式,更为文化遗产的数字化阐释开辟了具有方法论意义的计算路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务