遇见数据集

jaddai/openart-animals

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

OpenArt — Animals & the Natural World(OpenArt动物与自然世界)是OpenArt系列开放公共领域艺术数据集的动物主题子集,包含31,511件作品(15,920幅绘画/插图、15,407件摄影对象、184件未分类),每件作品都配有结构化VLM描述以及媒介、归属和铭文元数据。该数据集涵盖了各种媒介中的动物和自然世界主题,包括鸟类、野兽、鱼类和昆虫的绘画和绘图,以及雕刻、铸造、釉面和编织成雕塑、陶瓷、金属制品和版画的作品。它是OpenArt中最大的主题子集。数据集来源自大都会艺术博物馆、荷兰国家博物馆、克利夫兰艺术博物馆、芝加哥艺术学院、史密森尼学会、Europeana、维基媒体等主要博物馆和图书馆的开放访问API。与仅包含绘画的OpenBrush语料库不同,每个OpenArt主题子集都是混合媒介的:包含二维艺术(绘画、版画、绘图)和三维对象的照片(雕塑、陶瓷、金属制品、纺织品)。通过brand列(openbrush表示二维艺术,openartifacts表示摄影对象,ambiguous表示未明确)可以精确筛选所需内容。关键特征包括:所有31,511张图像均为公共领域且通过rights_status: safe检查;每张图像具有9个语义部分的结构化v2描述(与OpenBrush相同模式);品牌分割为openbrush(15,920件二维艺术)和openartifacts(15,407件摄影对象);媒介标记和归属感知:7,357行有命名艺术家,其中6,311行通过像素签名验证;采用CC0-1.0许可证(公共领域奉献,无保留权利);每行包含完整来源信息:source、landing_page、sha256。数据集结构包括图像字段(图像数据)、宽度和高度(像素尺寸)、品牌(openbrush/openartifacts/ambiguous)、主题(animals)、标签(规范化描述性标签)、9个描述部分(主题、动作、设置、情绪、风格描述、照明、颜色、构图)、完整描述、媒介(如油画、雕塑、金属制品)、艺术家(或unknown)、签名文本(如有)、签名验证(仅当为true时可信)、归属置信度、铭文文本(如有)、铭文可读性和验证性、标题(如有)、权利信息(许可证)、来源和完整性字段。描述生成采用双模型视觉管道:Gemma 4 31B生成完整9部分描述并处理路由,Gemini 3 Flash验证媒介、归属和铭文。标签经过规范化以匹配OpenBrush约定。许可证为CC0 1.0(公共领域奉献),所有图像均来自博物馆和图书馆的开放访问计划,并在摄入时验证(rights_status: safe)。统计数据:总图像31,511张,openbrush 15,920张,openartifacts 15,407张,ambiguous 184张,命名艺术家7,357行,签名验证6,311行,铭文验证12,139行。主要媒介包括雕塑、陶瓷、绘图等;主要标签包括动物、单色、自然等;主要来源包括大都会博物馆开放访问、荷兰国家博物馆OAI等。

OpenArt — Animals & the Natural World is the animals subject collection of the OpenArt family of open, public-domain art datasets: 31,511 works (15,920 paintings/illustrations, 15,407 photographed objects, 184 unclassified), each paired with a structured VLM caption plus medium, attribution and inscription metadata. It covers fauna and the natural world across every medium — birds, beasts, fish and insects painted and drawn, but also carved, cast, glazed and woven into sculpture, ceramics, metalwork and prints, making it the single largest OpenArt subject collection. The dataset draws from the open-access APIs of major museums and libraries (the Metropolitan Museum of Art, Rijksmuseum, Cleveland Museum of Art, Art Institute of Chicago, Smithsonian, Europeana, Wikimedia and others). Unlike the painting-only OpenBrush corpus, each OpenArt subject collection is mixed-medium: it contains both 2-D art (paintings, prints, drawings) and photographs of three-dimensional objects (sculpture, ceramics, metalwork, textiles). A brand column splits every row into openbrush (2-D art), openartifacts (photographed objects), or ambiguous for precise filtering. Key features include: 31,511 public-domain images all passing a rights_status: safe gate; structured v2 captions with 9 semantic sections per image (same schema as OpenBrush); brand split into openbrush (15,920, 2-D art) and openartifacts (15,407, photographed objects); medium-tagged and attribution-aware with 7,357 rows carrying a named artist and 6,311 of those signature-verified against the pixels; CC0-1.0 license (public-domain dedication, no rights reserved); and full provenance per row with source, landing_page, and sha256. The dataset structure includes fields for image, width, height, brand, theme, tags, the 9 caption sections (subject, action, setting, mood, style_description, lighting, color, composition), caption_full, medium, artist, signatures, signature_verified, attribution_confidence, inscription_text, inscription_legible, inscription_verified, title, rights information, and provenance fields. Captions were generated with a two-model vision pipeline: Gemma 4 31B for full captioning and routing, and Gemini 3 Flash for verification of medium, attribution, and inscription. Tags were normalized to match OpenBrush conventions. The license is CC0 1.0, with every image being public domain from museum and library open-access programs and verified at ingest (rights_status: safe). Statistics: total images 31,511, openbrush 15,920, openartifacts 15,407, ambiguous 184, named artist/maker 7,357, signature-verified 6,311, inscription-verified 12,139. Top media include sculpture, ceramic, drawing, etc.; top tags include animal, monochrome, nature, etc.; and top sources include met openaccess, rijksmuseum oai, smithsonian art, etc.

提供机构:
jaddai
搜集汇总
数据集介绍
jaddai/openart-animals 数据集图片
构建方式
OpenArt-Animals数据集源自OpenArt系列,专门聚焦于动物与自然世界主题,汇集了来自大都会艺术博物馆、荷兰国立博物馆、克利夫兰艺术博物馆、芝加哥艺术博物馆及史密森尼学会等主要文化机构开放API的公共领域作品。该数据集包含31,511件艺术品,其中15,920件为二维绘画与版画,15,407件为三维实物的摄影记录,另有184件未分类作品。构建过程中采用双模型视觉流水线:首先由Gemma 4 31B模型生成包含九个语义分区的结构化描述,随后通过Gemini 3 Flash对媒介、归属及铭文信息进行像素级的二次验证,确保元数据的可靠性。最终所有图像均通过CC0-1.0许可协议发布,每行数据保留了完整的来源追溯和完整性校验信息。
特点
本数据集最显著的特点在于其跨媒介的丰富性与结构化描述的精密度。作品横跨绘画、雕塑、陶瓷、金属工艺、纺织品等多种艺术形式,并通过brand列清晰区分二维艺术与实物摄影两大类别。每幅图像配备的v2结构化描述涵盖主题、动作、场景、情绪、风格、光线、色彩与构图等九个语义维度,为视觉语言模型提供了极为细致的训练素材。尤为突出的是,超过七千条记录标注了创作者信息,其中6,311条经过签名验证,同时还有12,139条题刻记录通过了可读性确认,使得数据在艺术史研究层面具有高度的可信度。这种双重验证机制赋予了数据集独特的学术价值。
使用方法
研究人员可通过HuggingFace Datasets库便捷地加载该数据集,直接使用load_dataset函数即可获取包含31,511条训练样本的完整集合。为适应不同研究需求,数据集提供了灵活的筛选机制:利用brand列可分离二维绘画与三维实物摄影数据;通过signature_verified字段可筛选出经过签名验证的可靠归属作品;基于medium列则能按媒介类型进行定向检索,如仅提取雕塑或陶瓷类别。该数据集适用于图像生成模型的微调、视觉语言模型的精细训练、媒介分类任务,以及跨媒介艺术比较研究等多种应用场景,为计算机视觉与艺术史交叉领域提供了坚实的公共领域数据基础。
背景与挑战
背景概述
OpenArt-Animals是OpenArt系列数据集中规模最大的主题子集,创建于2026年,由研究人员jaddai主导,整合了纽约大都会艺术博物馆、荷兰国立博物馆、克利夫兰艺术博物馆、芝加哥艺术博物馆及史密森尼学会等多家顶级机构的开放访问资源。该数据集包含31,511幅高品质公有领域图像,聚焦动物与自然世界主题,横跨绘画、雕塑、陶瓷、金属工艺等多种媒介,并配备结构化的多模态描述与详细的元数据。它填补了艺术领域细粒度、跨媒介动物图像数据集的空白,为图像生成、视觉语言模型微调及艺术分类研究提供了标准化、大规模且版权纯净的基准资源,在推动自然主题艺术品的计算分析方面具有重要影响力。
当前挑战
该数据集面临的挑战体现在两个层面。其一,所解决的领域问题是:现有艺术数据集多局限于单一媒介(如油画)或缺乏细粒度的主题划分,难以支持跨媒介动物图像的多模态理解与生成任务;同时,博物馆开放数据的使用常受制于版权不确定性,影响研究可复现性。其二,构建过程中的挑战包括:需从多元异构的博物馆API中筛选并统一版权状态为CC0的图像,去除来源不明的聚合数据;采用Gemma 4与Gemini 3双模型管线生成结构化描述,但AI生成的标注非策展级真相,艺术家归属需依赖签名验证才能确保准确;此外,西方机构与馆藏的固有偏差难以完全消除,可能限制数据集的全球文化代表性。
常用场景
经典使用场景
在视觉与语言模型研究的交汇处,OpenArt-Animals数据集为多模态学习提供了跨越二维绘画与三维文物的动物主题艺术图像资源。其经典使用场景涵盖图文生成训练,研究者可利用结构化标注的9语义段描述,微调扩散模型以生成特定媒介或风格的动物艺术形象;视觉语言模型微调中,该数据集的博物馆来源与签名验证机制支持对艺术品归属与铭文的深层理解;图像分类任务则可借助媒介、品牌或主题标签,开展跨媒介的动物图像识别研究。
解决学术问题
该数据集精准回应了艺术计算领域中跨媒介动物图像理解与归因验证两大学术难题。通过整合雕塑、陶瓷、金属工艺等三维文物与绘画、版画等二维作品的混合媒介数据,它打破了以往艺术数据集局限于单一样态的壁垒,为研究不同艺术形式对同一动物主题的视觉诠释提供了可比基础。签名验证与铭文二次确认机制,则有效缓解了AI生成元数据的归因可信度问题,使研究者能够区分可靠署名与学术推断,从而提升艺术史计算分析的严谨性。
衍生相关工作
该数据集催生了OpenArt系列中的多个子集与工具链延伸。其结构化字幕生成方法论(Gemma 4 31B配合Gemini 3 Flash验证)启发了针对艺术图像的归因验证管线,后续衍生了openbrush-anonymous-masters等专注于特定时期或匿名大师的子集。跨媒介对比研究的范式,推动了openart-mythic-creatures与openart-painterly-foundations等主题集合的创建,形成覆盖神话、肖像、装饰艺术的OpenArt家族。此外,媒介标签与品牌划分的策略,为同类数据集提供了可复用的元数据架构,促进了艺术计算领域数据集标准化的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务