遇见数据集

jaddai/openart-portraits-classical

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

OpenArt — Portraits & the Classical Figure(openart-portraits-classical)是OpenArt开放公共领域艺术数据集系列中的肖像古典主题集合。该数据集包含28,011件作品(13,868幅绘画/插图、13,970张拍摄对象照片、173件未分类),每件作品都配有结构化的视觉语言模型(VLM)字幕,以及媒介、归属和铭文元数据。数据集涵盖全范围媒介中的人物形象和肖像艺术,包括绘画和素描肖像、摄影肖像、肖像纺织品和服装、雕刻和雕塑 likeness。2D肖像与拍摄/对象肖像的比例接近均等。数据来源于大都会艺术博物馆、荷兰国家博物馆、克利夫兰艺术博物馆、芝加哥艺术博物馆、史密森尼学会、Europeana、维基媒体等主要博物馆和图书馆的开放访问API。与仅包含绘画的OpenBrush语料库不同,每个OpenArt主题集合都是混合媒介的:既包含2D艺术(绘画、版画、素描),也包含三维对象的照片(雕塑、陶瓷、金属制品、纺织品)。数据集通过“brand”列进行分割,以便用户根据需要选择特定部分。关键特征包括:所有图像均通过“rights_status: safe”检查,为公共领域;提供结构化v2字幕(每个图像9个语义部分,与OpenBrush模式相同);品牌分割为“openbrush”(2D艺术)和“openartifacts”(拍摄对象);媒介标记和归属感知,其中6,648行包含命名艺术家,5,600行经过签名验证;采用CC0-1.0许可,为公共领域奉献,无保留权利;每行提供完整来源信息,包括“source”、“landing_page”和“sha256”。数据集结构包括图像、宽度和高度、品牌、主题、标签、字幕部分(如主题、动作、设置、情绪、风格描述、灯光、颜色、构图)、完整字幕、媒介、艺术家、签名、签名验证、归属置信度、铭文文本、铭文可读性和验证、标题、权利信息以及来源字段。字幕生成采用双模型流程:首先使用Gemma 4 31B生成完整字幕、身份保留主题描述、铭文阅读和路由;然后使用Gemini 3 Flash进行验证,重新确认媒介、归属和铭文信息。数据集适用于图像生成训练、VLM微调、分类和跨媒介研究。

OpenArt — Portraits & the Classical Figure (openart-portraits-classical) is the portraits classical subject collection of the OpenArt family of open, public-domain art datasets. It contains 28,011 works (13,868 paintings/illustrations, 13,970 photographed objects, 173 unclassified), each paired with a structured VLM caption plus medium, attribution and inscription metadata. The dataset covers the human figure and portraiture across the full range of media, including painted and drawn portraits alongside photographic portraits, portrait textiles and costume, engraved and sculpted likenesses, with a near-even split between 2-D portraiture and photographed/object portraiture. It draws from the open-access APIs of major museums and libraries such as the Metropolitan Museum of Art, Rijksmuseum, Cleveland Museum of Art, Art Institute of Chicago, Smithsonian, Europeana, Wikimedia and others. Unlike the painting-only OpenBrush corpus, each OpenArt subject collection is mixed-medium, containing both 2-D art (paintings, prints, drawings) and photographs of three-dimensional objects (sculpture, ceramics, metalwork, textiles). A brand column splits every row for user selection. Key features include: 28,011 public-domain images passing a rights_status: safe gate; structured v2 captions with 9 semantic sections per image (same schema as OpenBrush); brand split into openbrush (13,868, 2-D art) and openartifacts (13,970, photographed objects); medium-tagged and attribution-aware with 6,648 rows carrying a named artist and 5,600 signature-verified; CC0-1.0 public-domain dedication; full provenance per row with source, landing_page, and sha256. The dataset structure includes fields for image, width, height, brand, theme, tags, caption sections (subject, action, setting, mood, style_description, lighting, color, composition), caption_full, medium, artist, signatures, signature_verified, attribution_confidence, inscription_text, inscription_legible, inscription_verified, title, rights, rights_status, license_class, landing_page, source, and sha256. Captions are generated via a two-model pipeline: Gemma 4 31B for captioning and routing, and Gemini 3 Flash for verification of medium, attribution, and inscription. The dataset is suitable for image-generation training, VLM fine-tuning, classification, and cross-medium study.

提供机构:
jaddai
搜集汇总
数据集介绍
jaddai/openart-portraits-classical 数据集图片
构建方式
该数据集是OpenArt系列中专注于肖像与古典人物主题的子集,整合了来自大都会艺术博物馆、荷兰国立博物馆、克利夫兰艺术博物馆、芝加哥艺术博物馆及史密森学会等全球顶级机构的开放获取数据。其构建过程采用双模型视觉管线:首先由Gemma 4 31B模型生成包含九大语义维度的结构化描述,涵盖主体、动作、氛围、风格、光线与色彩等要素,同时进行主题路由与铭文识别;随后通过Gemini 3 Flash模型对媒介、归属及铭文信息进行像素级二次验证,确保数据准确性。所有图像均经过严格的版权筛查,确保每一行数据均符合CC0公共领域奉献标准。
特点
该数据集汇集28,011件公共领域作品,涵盖绘画、版画、雕塑、纺织品与金属工艺品等多种媒介,呈现二维绘画与三维实物摄影近乎对半的独特分布。其核心特色在于内置的品牌分离机制——通过'brand'字段可将二维艺术(openbrush)与器物影像(openartifacts)精准区分。每条数据均配备结构化v2描述,包含九个独立语义段落与规范化标签,同时提供详尽的归属信息,其中5,600条记录带有经过签名验证的艺术家身份。数据集还完整追溯每件作品的来源、原始链接与哈希校验值,为学术研究与模型训练提供了可溯源的高质量素材。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集,直接调用load_dataset函数获取完整28,011条训练数据。利用filter操作可自由筛选不同品牌类型,如仅提取二维绘画作品或摄影器物影像。针对归属信息的可靠性,可通过signature_verified字段过滤出签名已认证的高置信度条目。数据集支持多种主流下游任务,包括扩散模型的图像生成训练、视觉语言模型的微调以及媒介分类与跨媒介比较研究。对于需要特定媒介素材的场景,可依据medium字段精确筛选,例如单独提取雕塑类图像用于风格迁移或三维重建模型的开发。
背景与挑战
背景概述
在视觉与语言模型(VLM)和扩散模型快速发展的背景下,高质量、结构化且版权清晰的艺术数据集成为推动模型泛化能力的关键。2026年由研究者jaddai构建的OpenArt系列数据集中的openart-portraits-classical子集,聚焦于古典人物肖像这一核心艺术母题,从纽约大都会艺术博物馆、荷兰国立博物馆、克利夫兰艺术博物馆等全球顶级博物馆与图书馆的开放获取API中,系统收集了28,011件涵盖绘画、版画、摄影、雕塑、纺织品等多元媒介的公共领域作品。该数据集为每一幅图像配备了包含9个语义段的结构化视觉语言模型(VLM)描述,并通过双模型流水线(Gemma 4 31B生成、Gemini 3 Flash验证)确保标注质量,在肖像画、服饰史、跨媒介艺术比较等研究领域树立了可复现、可追溯的基准。
当前挑战
该数据集主要应对两大挑战。在领域问题层面,现有艺术数据集多局限于单一媒介(如仅含绘画的OpenBrush),难以支持跨媒介的“同一主题在不同载体中的表现差异”研究,且缺乏统一的结构化描述范式来对齐视觉特征与语义信息;同时,博物馆藏品中的归属(attribution)与铭文(inscription)信息常具学术争议性,直接使用未验证的元数据将误导下游模型。在构建过程中,需克服博物馆开放API的数据格式碎片化(如11种主要媒介类型的异构标注)、通过定制化的验证模型对6,648条署名记录进行像素级别的签名比对(仅5,600条通过),并从欧洲等聚合源中筛除版权不明确的样本以确保CC0许可证的纯净性,最终在图像分类、主题迁移、跨媒介生成等任务中实现可信任的基准数据供给。
常用场景
经典使用场景
在艺术史与计算机视觉的交叉领域中,openart-portraits-classical数据集为肖像与古典人物形象的跨媒介研究提供了坚实的基石。其核心用例在于训练多模态模型以理解艺术作品中的人物表征,无论是二维绘画、版画中的细腻笔触,还是三维雕塑、织物上的立体塑造。研究人员可借助该数据集精确地将视觉特征与结构化描述进行对齐,例如通过九段式字幕中的主体、动作、风格、光线等维度,实现从图像到语义的细粒度映射。此外,数据集的品牌列设计允许用户分别取用纯绘画子集与实物摄影子集,从而对比同一主题在不同媒介下的视觉表达差异,为艺术风格迁移、跨模态检索乃至文化遗产数字化保护等方向提供了标准化的实验平台。
解决学术问题
长期以来,艺术领域的机器学习研究面临两大核心难题:一是缺乏兼具规模与结构化标注的肖像类公共领域图像资源,二是难以在混合媒介中建立统一的人物表征框架。该数据集通过整合全球顶级博物馆与图书馆的开放获取资源,系统性地解决了图像来源碎片化与版权不确定性带来的研究瓶颈。其提出的九段式结构化字幕涵盖了艺术批评中的关键视角,为自动描述生成、视觉问答、属性识别等任务提供了坚实的监督信号。更重要的是,签名验证与铭文核实机制的引入,使学术研究能够可靠地锚定艺术品的创作者身份与历史信息,从而有效缓解了归属推断中的偏差问题,推动了可信人工智能在文化遗产领域的深入应用。
衍生相关工作
基于此数据集,研究者已衍生出一系列开创性工作。在模型层面,其结构化字幕与品牌分割的设计启发了OpenArt家族中多个主题子集的构建,形成了涵盖动物、神话生物、器物等多个领域的完整语料生态。在算法层面,Gemma与Gemini双模型级联的混合媒介字幕生成与验证流水线,为工业级视觉语言数据集构建提供了可复用的技术范式。此外,针对签名与铭文的双重校验策略,直接催生了艺术品归属置信度评估的新评估基准,促使后续工作更审慎地对待机器生成的元数据,并推动了以证据链为导向的可信文化遗产计算这一新兴方向的萌芽与发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务