遇见数据集

jaddai/openart-mythic-creatures

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

OpenArt — Mythic Creatures 是OpenArt系列开放公共领域艺术数据集中的神话生物主题集合,包含12,933个作品(4,053个绘画/插图,8,828个摄影对象,52个未分类),每个作品都配有结构化视觉语言模型(VLM)字幕以及媒介、归属和铭文元数据。该数据集从主要博物馆和图书馆(如大都会艺术博物馆、荷兰国家博物馆、克利夫兰艺术博物馆、芝加哥艺术博物馆、史密森尼学会、欧洲文化平台、维基媒体等)的开放API中提取。与仅包含绘画的OpenBrush语料库不同,每个OpenArt主题集合都是混合媒介的:包含2D艺术(绘画、版画、素描)和3D对象的照片(雕塑、陶瓷、金属制品、纺织品)。通过brand列分割每个行,用户可以精确选择所需部分。关键特征包括:所有图像均为公共领域(通过rights_status: safe检查),提供结构化v2字幕(每个图像9个语义部分),品牌分割为openbrush(2D艺术)和openartifacts(摄影对象),媒介标记和归属感知(2,016行有命名艺术家,其中1,453行通过签名验证),使用CC0-1.0许可证(公共领域奉献,无权利保留),每行提供完整来源信息(如source、landing_page、sha256)。数据集适用于图像生成训练、VLM微调、分类和跨媒介研究等用例。

OpenArt — Mythic Creatures is the mythic creatures subject collection of the OpenArt family of open, public-domain art datasets, containing 12,933 works (4,053 paintings/illustrations, 8,880 photographed objects, 52 unclassified), each paired with a structured VLM caption plus medium, attribution, and inscription metadata. The dataset draws from the open-access APIs of major museums and libraries (such as the Metropolitan Museum of Art, Rijksmuseum, Cleveland Museum of Art, Art Institute of Chicago, Smithsonian, Europeana, Wikimedia, and others). Unlike the painting-only OpenBrush corpus, each OpenArt subject collection is mixed-medium: it includes both 2-D art (paintings, prints, drawings) and photographs of three-dimensional objects (sculpture, ceramics, metalwork, textiles). A brand column splits every row, allowing users to select the exact slice they want. Key features include: all images are public domain (passing a rights_status: safe gate), structured v2 captions (9 semantic sections per image), brand split into openbrush (2-D art) and openartifacts (photographed objects), medium-tagged and attribution-aware (2,016 rows with named artists, 1,453 of which are signature-verified), CC0-1.0 license (public-domain dedication, no rights reserved), and full provenance per row (e.g., source, landing_page, sha256). The dataset is suitable for use cases such as image-generation training, VLM fine-tuning, classification, and cross-medium studies.

提供机构:
jaddai
搜集汇总
数据集介绍
jaddai/openart-mythic-creatures 数据集图片
构建方式
OpenArt-Mythic Creatures数据集源自全球多家顶级博物馆与图书馆的开放API,包括大都会艺术博物馆、荷兰国家博物馆、克利夫兰艺术博物馆、芝加哥艺术博物馆及史密森尼学会等。该数据集精选了12,933件与神话及奇幻生物相关的公共领域艺术作品,涵盖绘画、版画、雕塑、金属工艺品及纺织品等多种媒介。每件作品均通过双模型视觉管线生成结构化标题:Gemma 4 31B负责生成包含主题、动作、场景、情绪等9个语义部分的完整描述,而Gemini 3 Flash则对媒介、归因及铭文信息进行像素级的二次校验。所有图像均通过CC0 1.0许可协议发布,确保无任何版权限制。
使用方法
用户可通过Hugging Face的datasets库轻松加载该数据集,使用load_dataset函数即可获取全部12,933条训练数据。借助filter方法,研究者可依据brand列分离二维绘画与三维物体,或根据signature_verified字段筛选经过签名验证的可信归因作品。数据集的9部分结构化标题可直接用于文本到图像生成模型的微调,其丰富的图像分类标签(如媒介、主题)则适用于图像分类与跨媒介对比研究。建议在涉及艺术家归因的研究中,优先使用signature_verified为true的数据行以确保可靠性。
背景与挑战
背景概述
openart-mythic-creatures数据集由jaddai于2026年创建,隶属于OpenArt系列,旨在系统性地收集与神话生物相关的公有领域艺术作品。该数据集整合了来自大都会艺术博物馆、荷兰国立博物馆、克利夫兰艺术博物馆、芝加哥艺术博物馆和史密森学会等主要博物馆与图书馆的开放API资源,共计12,933件作品,涵盖二维绘画与三维器物(如金属工艺、雕塑、纺织品),并辅以结构化的视觉语言模型(VLM)描述、媒介、归属与铭文元数据。作为艺术与文化遗产数字化研究的前沿成果,该数据集突破了传统图像分类与生成任务中题材单一、媒介局限的瓶颈,为多模态学习、跨媒介风格迁移和文化符号学分析提供了稀缺的、高质量的神话主题资源,在艺术史计算化、文化AI等领域具有显著的推动价值。
当前挑战
该数据集核心解决领域问题中神话生物主题在视觉数据中的稀缺性与多样性不足挑战,现有公开数据集多聚焦于日常物体或自然场景,难以支持对神话、幻想及民俗意象的细粒度建模,而本数据集通过跨媒介(绘画、雕塑、金属工艺)的混合采集,弥补了这一空白,为文生图、图像描述和风格识别等任务提供了特化的训练素材。构建过程中面临两大挑战:一是数据来源分散且格式异构,需从多个博物馆API批量获取,并执行严格的公有领域校验(仅保留CC0或同等授权图像),剔除了版权存疑的聚合来源;二是元数据自动化标注与验证的可靠性,采用Gemma 4 31B生成结构化描述,再经Gemini 3 Flash进行归属与铭文的像素级复核,但AI生成的非策展元数据仍可能引入陈述偏差,需依赖签名验证标志(signature_verified)确保艺术家身份的可信度。
常用场景
经典使用场景
在计算机视觉与多模态研究的交汇处,openart-mythic-creatures数据集因其独特的主题聚焦与媒介多样性,成为了训练和评估生成式模型与视觉语言模型的理想资源。该数据集汇聚了12,933幅来自全球顶尖博物馆开放获取计划的神话生物图像,涵盖二维绘画与三维文物摄影两种截然不同的艺术载体。研究者可借助其精细的结构化字幕系统,涵盖主题、动作、环境、情绪、风格、光照、色彩与构图等九个语义维度,进行图像描述生成、文本到图像生成以及图像分类等经典任务的模型微调。尤其是其内置的brand字段,允许用户精准提取纯二维绘画或纯三维文物子集,为跨媒介的神话主题视觉表征研究提供了前所未有的精细控制能力。
解决学术问题
长期以来,艺术图像数据集要么局限于单一媒介(如仅含绘画),要么缺乏精细的语义标注与版权保障,导致生成模型训练时面临风格混淆与版权的双重困境。openart-mythic-creatures数据集以全CC0公共领域奉献协议统一了所有图像的合法使用权,彻底消除了学术研究中的版权顾虑。更重要的是,它创新性地将二维艺术与三维文物并置,为解决跨媒介的视觉概念迁移问题提供了关键数据支撑——同一个神话生物如龙或狮鹫,在绘画与金属器皿上的造型逻辑与视觉语法究竟有何异同?数据集提供的结构化字幕与brand标签,使研究者得以系统地比较并量化不同媒介对同一主题的视觉编码差异,推动了艺术计算领域中“媒介理解”这一前沿学术问题的深入探索。
实际应用
在文化遗产数字化与创意产业的交汇地带,该数据集展现出了显著的实用价值。博物馆与文化遗产机构可借助其训练的视觉语言模型,自动为馆藏神话题材的绘画与金属器物生成多维度描述,极大提升藏品编目与在线展览的文字生成效率。数字艺术家与游戏开发者则能利用该数据集微调扩散模型,精准生成特定风格与媒介的神话生物图像——例如青铜质感的格里芬或蚀刻版画风格的龙,从而丰富奇幻类作品的视觉素材库。此外,教育科技领域可基于该数据集构建互动式艺术鉴赏工具,通过语义解析图像中的神话元素与艺术风格,为学生提供沉浸式的神话题材艺术史学习体验,让古老的神话意象在数字时代焕发新的生命力。
数据集最近研究
最新研究方向
在神话与奇幻生物这一跨文化视觉母题的研究领域,openart-mythic-creatures数据集为多模态大模型在文化遗产数字化中的细粒度理解与生成开辟了全新路径。其核心创新在于融合了二维绘画与三维器物(如金属工艺、雕塑)的异构媒介,并引入双层视觉语言模型管线(Gemma 4 31B与Gemini 3 Flash)生成结构化标注,显著提升了在复杂纹饰、铭文和跨材质对比任务中的语义精度。该数据集以CC0协议发布,不仅直接支撑起基于博物馆开放获取图像的去中心化训练,更使得模型在神话符号的跨媒介对应(如龙在绘画与兵器上的不同呈现)识别、零样本分类以及可控生成等前沿方向具备突破性潜力,为艺术史计算与文化遗产的智能化叙事注入了高质量的多模态基座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务