遇见数据集

ArtiFact

收藏
arXiv2026-06-08 更新2026-06-10 收录
官方服务:

资源简介:

ArtiFact是由柏林工业大学研究团队构建的大规模多模态文化遗产数据集,整合了大都会艺术博物馆、芝加哥艺术学院和荷兰国立博物馆的开放访问资源。该数据集包含65.1万条艺术品记录,每条记录均关联结构化元数据、文本描述和公共领域图像,数据总量庞大且覆盖多元文化遗产维度。数据集通过规则化处理与大型语言模型辅助的语义解析流程,实现了异构元数据的标准化与去重,并注入了涵盖物理、文化、时空等七类人工标注错误。该数据集主要应用于多模态数据管理研究,旨在为跨模态错误检测、语义查询处理等任务提供基准测试平台,以解决文化遗产领域数据质量评估与语义一致性验证的挑战。

ArtiFact is a large-scale multimodal cultural heritage dataset constructed by a research team from the Technical University of Berlin, which integrates open-access resources from the Metropolitan Museum of Art, the Art Institute of Chicago, and the Rijksmuseum. This dataset contains 651,000 artwork records, each linked to structured metadata, text descriptions, and public-domain images, boasting a massive data volume and covering diverse cultural heritage dimensions. Through regularization processing and large language model-aided semantic parsing workflows, the dataset achieves standardization and deduplication of heterogeneous metadata, and injects seven categories of manually annotated errors covering physical, cultural, spatiotemporal and other aspects. This dataset is primarily utilized for multimodal data management research, aiming to provide a benchmark platform for tasks such as cross-modal error detection and semantic query processing, so as to address the challenges of data quality assessment and semantic consistency verification in the cultural heritage field.

创建时间:
2026-06-08
原始信息汇总

ArtiFact: 大规模多模态文化遗产数据集

数据集概览

  • 总记录数:651,045 条艺术品记录,包含图像与结构化元数据
  • 来源机构:3 家世界级博物馆(大都会艺术博物馆、芝加哥艺术博物馆、荷兰国家博物馆)
  • 标准化模式:统一 24 列模式
  • 错误标注记录:130,209 条(含 7 大错误类别、19 个子类别)

数据来源

  • 大都会艺术博物馆:通过 MET REST API 采集,覆盖全部 19 个策展部门
  • 芝加哥艺术博物馆:通过开放存取 JSON-LD 文件(基于 IIIF 框架)采集
  • 荷兰国家博物馆:通过 OAI-PMH 和递归 JSON-LD 链接数据解析采集

统一模式(24 列)

类别 字段
标识符 object_ID, object_name, title, description, subjects, inscriptions, image_url
时间 date_begin, date_end, date_begin_bce, date_end_bce, period, dynasty, reign
物理属性 materials, techniques, dimensions_json
文化/地理 culture, location
艺术家 artist_name, artist_role, artist_nationality, artist_date_begin, artist_date_end

错误分类(130,209 条记录)

错误类别 记录数 描述
物理错误 20,484 插入基于世界知识的材料或技法时代错乱(如视觉相似材料互换)
文化错误 10,780 在相邻文化或同一大洲内互换文化标签
时间错误 8,992 将创作日期范围随机偏移 ±100/200/300 年
身份错误 26,952 艺术家归属错误(从随机互换到共享国籍/时代/专业的艺术家间互换)
地理错误 13,476 在邻国之间交换地点(保持词汇重叠约束)
空间错误 15,837 尺寸单位缩放 10 倍,或交换高宽比
视觉错误 33,688 使用 CLIP 嵌入识别视觉孪生图像并进行互换

下游任务

  • 跨模态错误检测:利用 130K 条标注基准检测图像与元数据间的不一致
  • 语义查询处理:包含 5 个语义查询的迷你基准,结合结构化数据的关系谓词与文本/图像的语义算子
  • 多模态检索:支持基于图像相似性、结构化属性或组合语义-视觉查询的跨模态检索

访问方式

  • HuggingFacedeem-data/ArtiFact,可通过 datasets 库加载
  • GitHubOlgaOvcharenko/ArtiFact,包含 ETL 流水线、错误注入框架和下游任务代码

引用

bibtex @article{duarte2026artifact, title = {{ArtiFact}: A Large-Scale Multi-Modal Cultural Heritage Dataset}, author = {Duarte, Luciano and Ovcharenko, Olga and Schelter, Sebastian}, year = {2026}, url = {https://github.com/OlgaOvcharenko/ArtiFact} }

搜集汇总
数据集介绍
ArtiFact 数据集图片
构建方式
ArtiFact数据集通过整合纽约大都会艺术博物馆、芝加哥艺术博物馆和荷兰国立博物馆的开放获取馆藏资源构建而成。数据采集过程中,仅保留具有公共领域图像链接的记录,最终汇聚为651,045件文物对象。为克服三家机构采用异构元数据标准所带来的整合挑战,研究者设计了一套统一的ETL流水线,涵盖基于正则表达式的规则化值归一化(如将文本日期解析为绝对时间范围、标准化度量单位)与大语言模型辅助的语义解析。随后,通过模式映射将各异构源数据统一至包含24个字段的标准化模式中,并利用文本嵌入模型与大语言模型分类实现类别化值的去重及艺术家实体的匹配。
特点
该数据集的核心特点在于其大规模、多模态与领域特异性。它同时提供结构化表格数据、非结构化文本描述与公共域文物图像,为跨模态数据管理研究提供了难能可贵的真实世界场景。尤为突出的是,研究者与博物馆策展人合作,精心设计了涵盖物理、文化、时间、身份、地理、空间及视觉七个维度、包含十九个子类别的错误注入分类体系,并在130,209条记录中注入了这些人为但现实合理的错误,从而构建了一个层级化的跨模态错误检测基准。这使得ArtiFact能够系统性地评估模型在应对细微领域特定错误(如材质时代错置)时的脆弱性。
使用方法
ArtiFact主要面向两大下游任务:跨模态错误检测与语义查询处理。在错误检测任务中,研究者可基于其提供的含错误标注的子集,评估多模态模型识别表格、文本与图像之间不一致性的能力,并可根据错误类型与难度进行针对性实验。在语义查询处理任务中,研究者可利用系统提供的结构化元数据与图像,构建结合关系型谓词与语义运算符的查询(如寻找特定窑厂生产的瓷器花瓶),以检验现有引擎在应对文化邻近性、模糊对象类型及历史性术语时的表现。数据集已开源并提供完整代码与预处理流水线,便于研究者快速复现与扩展。
背景与挑战
背景概述
ArtiFact数据集由柏林工业大学BIFOLD实验室的Luciano Duarte、Olga Ovcharenko和Sebastian Schelter于2026年创建,旨在填补多模态数据管理领域缺乏大规模真实世界文化遗产数据集的空白。该数据集整合了纽约大都会艺术博物馆、芝加哥艺术博物馆和阿姆斯特丹国立博物馆的651,045件馆藏记录,每件作品均配以公共领域图像、结构化元数据及文本描述,并通过统一的ETL管道解决了跨机构元数据异构性问题。作为首个同时提供表格、文本与图像三种模态并针对数据质量设计的文化遗产基准,ArtiFact聚焦于跨模态错误检测与语义查询处理两大核心任务,为多模态数据库研究提供了兼具规模性与领域特异性的关键资源。
当前挑战
ArtiFact所应对的核心挑战在于文化遗产数据的多模态不一致性:博物馆记录常存在年代错置、材料张冠李戴、文化标签误用等细微但关键的错误,现有模型难以辨识如材质时代倒错或图像互换等需要领域知识的异常。数据集构建过程中亦面临严峻困难:三家博物馆采用迥异的元数据标准与分类体系,需借助正则规则与大型语言模型协同完成日期格式归一化、同义材料术语去重及艺术家实体对齐等复杂清洗任务;同时,为生成130,209条含标注错误的测试记录,研究团队需参考策展人意见设计七类19子类错误注入方案,并确保错误在语义上合理却事实错误,这对领域知识深度提出了极高要求。
常用场景
经典使用场景
在文化遗产数字化浪潮中,博物馆记录常因异构元数据标准和手动标注流程而蕴含大量跨模态不一致性。ArtiFact数据集汇集了来自大都会艺术博物馆、芝加哥艺术学院和荷兰国立博物馆的651,045条馆藏记录,每一条均包含结构化表格、自由文本描述与公共领域图像。其最经典的使用场景是跨模态错误检测——通过设计七大类精细化的错误注入方案(如材质时代错置、邻近文化混淆、视觉图像置换),研究者可系统性地评估多模态数据管理系统对微妙领域错误的识别能力。该场景为验证表格、文本与图像三者间的语义一致性提供了大规模的受控实验平台。
衍生相关工作
ArtiFact的发布催生了一系列衍生研究。在方法论层面,研究者基于其错误注入框架改进了跨模态一致性检测范式,如将CLIP嵌入比较与LLM推理相结合以捕捉更隐蔽的图文矛盾。在系统设计上,LOTUS和Palimpzest等语义查询引擎以ArtiFact为基准测试集,优化了针对文化领域特殊术语的过滤算子。此外,策展人联合数据科学家利用该数据集构建了历史名画风格迁移的鲁棒性评估体系,并推动了多轮对话式文物知识问答系统的开发。其统一的ETL管线更被借鉴至其他非英语文化遗产数据的清洗,如中世纪手稿与东亚陶瓷档案的语义对齐工作中。
数据集最近研究
最新研究方向
ArtiFact数据集的最新研究方向聚焦于多模态数据管理中的两大核心挑战:跨模态错误检测与语义查询处理。在错误检测方面,研究揭示了当前系统在识别视觉显著错误(如图像交换、尺度异常)时表现优异,但对于领域特定的细微错误,例如材料年代误置、历史时期偏移和文化归属混淆,仍存在显著局限。实验表明,即便是先进的视觉语言模型在面对涉及深层文化背景与历史知识的不一致性时,检测能力大幅下降。在语义查询处理领域,该数据集推动了基于LLM的SQL查询在多模态文化遗存数据上的应用研究,发现现有系统在处理文化邻近性、模糊对象类别和历史演变术语时困难重重。ArtiFact通过引入七类精心设计的错误注入和丰富的文化上下文,为评估和提升多模态数据管理系统的鲁棒性与领域适应性提供了极具挑战性的基准,其影响力在于填补了文化遗产领域高质量多模态基准数据集的空白,为未来数据融合、质量优化与语义理解研究奠定了坚实基础。
相关研究论文
  • 1
    ArtiFact: A Large-Scale Multi-Modal Cultural Heritage Dataset柏林工业大学·柏林数据融合与人工智能基础研究所 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务