遇见数据集

Indonesian Traditional Attire Dataset

收藏
arXiv2026-06-11 更新2026-06-13 收录
官方服务:

资源简介:

印度尼西亚传统服饰数据集是由布拉维贾亚大学研究团队构建的专门用于文化遗产保护的多模态数据集。该数据集共包含3800张经过专家标注的高质量图像,均匀覆盖印度尼西亚全部38个省份,每个省份提供100张代表性样本,数据来源于博物馆档案、文化机构、教育资料库和专业摄影资源。数据集构建过程采用严格的领域专家标注流程,由人类学家和纺织学者对服装类别、仪式属性、民族归属和文化语境进行精细化标注,并通过数据增强技术提升模型鲁棒性。该数据集主要应用于低资源环境下的跨文化视觉语言建模,旨在通过零样本图像描述技术解决传统服饰文化术语的自动化识别与解释问题,为博物馆数字化和文化索引提供技术支持。

The Indonesian Traditional Clothing Dataset is a multimodal dataset dedicated to cultural heritage conservation, constructed by a research team from Brawijaya University. It consists of 3800 high-quality expert-annotated images, which uniformly cover all 38 provinces of Indonesia, with 100 representative samples per province. The data is sourced from museum archives, cultural institutions, educational databases, and professional photography resources. The dataset construction follows a strict domain expert annotation workflow: anthropologists and textile scholars conduct fine-grained annotations for clothing categories, ritual attributes, ethnic affiliations, and cultural contexts, and data augmentation techniques are applied to enhance model robustness. This dataset is primarily applied to cross-cultural vision-language modeling in low-resource settings, aiming to address the automated recognition and interpretation of traditional clothing cultural terminologies via zero-shot image captioning technology, and provide technical support for museum digitization and cultural indexing.

创建时间:
2026-06-11
原始信息汇总

数据集概述

Traditional-Indonesian-Clothing-Captioning-Dataset 是一个面向文化遗产的视觉语言数据集,包含来自印度尼西亚全部 38 个省份3,800 张 由专家标注的传统服装图像,主要用于零样本图像描述和检索增强的多模态研究。

核心特点

  • 数据规模:3,800 张传统服装图像,每个省份均有代表性样本
  • 标注质量:由文化领域专家撰写描述性文字(cultural captions)
  • 研究导向:专为零样本学习、图像描述、多模态学习、检索增强生成(RAG)以及跨文化 AI 研究设计
  • 适用领域:图像描述、零样本学习、跨文化 AI、检索增强生成、CLIP 基础研究、低资源 AI

零样本评估协议

数据集采用 省份级别归纳零样本协议,确保严格的泛化评估:

数据集划分 涵盖省份数 用途
训练集 24 个省份 模型训练
验证集 6 个省份 超参数调优
测试集 8 个未见过省份 完全未见省份的测试

重要约束:测试期间,模型无法接触未见过省份的图像、描述或标签,检索库仅包含来自训练省份的描述,以评估模型对完全未见区域服装传统的文化泛化能力。

框架组成

提出的框架整合了以下模块:

  • CLIP ViT-B/32 图像编码器
  • CLIP 文本编码器
  • BERT 文本编码器
  • LSTM 描述解码器
  • 检索增强描述生成

基准评测结果

指标 分数
CLIPScore 0.8536
BLEU-4 0.3342
METEOR 0.4859

关键发现

  • 检索增强能提高文化词汇的恢复能力
  • 通过检索集成,METEOR 提升了 19.3%
  • 人工评估确认生成描述的文化准确性、流畅性和描述性更强

数据集结构

Traditional-Indonesian-Clothing-Captioning-Dataset/ ├── images/ # 按省份名称(如 Aceh、Bali、Papua)组织的图像 ├── annotations/ # 训练、验证、测试集的描述 JSON 文件和元数据 CSV ├── splits/ # 训练、验证和未见省份的文本列表 ├── examples/ # 示例文件 ├── README.md └── LICENSE

示例描述

  • 输入:来自未见过印度尼西亚省份的传统服饰图像
  • 生成描述“A person wearing traditional ceremonial clothing with intricate woven patterns, cultural ornaments, and regional heritage accessories.”

应用方向

  • 零样本图像描述
  • 文化遗产 AI
  • 视觉语言对齐
  • 检索增强生成
  • 跨领域泛化
  • 低资源语言技术
  • 多模态学习

许可

本数据集仅用于 研究、教育及非商业用途,使用时需正确引用。

引用

如使用本数据集,请引用:

bibtex @article{customzeroclip2026, title={Custom ZeroCLIP: Retrieval-Augmented Vision-Language Framework for Zero-Shot Captioning of Traditional Indonesian Clothing}, author={Author Names}, journal={Conference/Journal Name}, year={2026} }

搜集汇总
数据集介绍
Indonesian Traditional Attire Dataset 数据集图片
构建方式
该数据集以印尼38个省份的传统服饰为对象,从博物馆档案、文化机构、教育资料库及专业摄影来源中收集了3,800张经过领域专家(包括人类学家和纺织学者)标注的图像,每省份100张。数据集按照省份级别划分为24个训练省份、6个验证省份和8个未见测试省份,采用归纳式零样本学习协议,确保未见省份的图像、标签和参考描述在训练、验证及检索库构建中完全不可见。图像经过224×224尺寸调整和ImageNet标准化,并应用随机水平翻转、颜色抖动和15度旋转等数据增强技术。
使用方法
该数据集主要用于文化遗产领域的零样本图像描述生成任务。研究者可以基于提供的训练省份图像-描述对,训练一个由冻结CLIP图像编码器、可训练BERT编码器、投影层和LSTM解码器组成的Custom ZeroCLIP框架。在测试时,模型对未见省份图像进行零样本推理,首先通过CLIP嵌入的余弦相似度从训练省份的检索库中获取前K个最相关的描述,再将检索到的文本上下文与视觉特征融合,驱动LSTM解码器生成最终描述,而无需使用任何未见省份的标签或参考描述。该数据集已公开于GitHub仓库。
背景与挑战
背景概述
印度尼西亚传统服饰数据集(Indonesian Traditional Attire Dataset)由Brawijaya大学计算机科学学院的Anugrah Aidin Yotolembah、Novanto Yudistira和Gembong Edhi Setyawan于2026年创建,旨在解决文化遗产数字化保护中视觉语言模型对非西方服饰文化术语理解不足的核心问题。该数据集包含来自印度尼西亚全部38个省份的3,800张专家标注图像,涵盖蜡染、宋吉、乌洛斯等传统纺织品及各类仪式服饰。研究团队提出了Custom ZeroCLIP框架,将归纳式零样本学习与检索增强生成相结合,在仅依托已知省份数据的情况下,成功为未知省份的传统服饰生成了文化准确的描述。该数据集与方法的提出,为低资源文化遗产场景下的多模态学习提供了重要基准,推动了计算机视觉在文化保护领域的应用,对博物馆数字化和文化索引具有显著影响力。
当前挑战
该数据集所解决的领域问题在于,现有视觉语言模型如CLIP、BLIP等虽然性能强大,但其训练数据以西方服饰为主,导致对印度尼西亚各省份传统服饰的精细文化术语(如Meukutop、Suntiang Aceh等)无法有效识别与生成。研究面临的核心构建挑战包括:第一,采用省份级别的归纳式零样本协议,要求模型在训练、验证和检索库构建阶段完全排除未知省份的图像、标签及描述,确保无数据泄露,这极大限制了模型可利用的信息来源;第二,数据集涵盖38个省份、100种不同文化背景的服饰,专家标注需要人类学与纺织学者的深度参与,确保文化语境与仪式属性的准确性;第三,推理阶段仅能从已知省份的检索库中获取语义候选,模型需克服跨省份文化词汇迁移的偏差,避免检索传播视觉相似但文化错误的术语,这对检索增强解码机制的设计提出了严苛要求。
常用场景
经典使用场景
Indonesian Traditional Attire Dataset最经典的使用场景在于为文化遗产保护领域的零样本图像描述提供标准化基准。研究者借助该数据集构建跨视觉与文本模态的检索增强生成框架,在低资源环境下实现对印尼传统服饰的文化语义重建。数据集覆盖38个省份的3800张图像,每张均由人类学家与纺织专家进行深度标注,可支撑从视觉识别到文化内涵解析的多层次任务,尤其适用于评估模型在面对未见省份服饰时恢复特有术语如songket、ulos、Meukutop等的能力,从而推动文化敏感的视觉语言理解研究。
解决学术问题
该数据集核心解决了低资源文化遗产场景下的归纳式零样本视觉语言泛化难题。传统模型因训练数据以西方服饰为主,难以捕捉印尼传统服饰精细的文化术语。通过设计严谨的省份级归纳零样本协议,将8个未见省份完全排除于训练与检索库之外,数据集为检验模型在无标注条件下生成文化准确描述的能力提供了可重复评估框架。其学术意义在于量化证明了检索增强领域自适应机制相比现成基础模型在BLUE-4和METEOR指标上分别提升18.64%和10.18%,且消融实验揭示检索模块对术语恢复贡献了19.3%的METEOR增益,为遗产文献数字化中的域适应研究树立了新范式。
实际应用
在实际应用中,该数据集支撑博物馆数字化编目与文化索引系统的自动化建设。借助Custom ZeroCLIP框架生成的描述可直接辅助策展人员快速标注馆藏服饰中的省份归属、仪式属性与象征意义,将人工鉴定周期缩短数倍。此外,数据集可集成至文化遗产教育平台,通过图像自动生成阐释性文本,帮助公众理解各区域服饰背后的族群历史与礼制内蕴。在纺织产业领域,该数据集还能助力传统工艺数据库的智能化检索,使设计师能够通过语义查询快速定位特定省份、图案或仪式场景的服饰材料与结构特征,进而促进濒危工艺的数字化存续。
数据集最近研究
最新研究方向
在文化遗产数字化保护与计算机视觉的交叉领域,Indonesian Traditional Attire Dataset的提出为低资源情境下的文化描述生成开辟了新路径。该数据集涵盖印尼全部38个省份的3800张专家标注图像,聚焦于巴迪克、宋吉等传统服饰的细粒度识别与解释。当前前沿研究围绕归纳式零样本学习展开,旨在让模型仅凭已见省份的标注数据,对完全未见省份的服饰图像生成具有文化准确性的描述。Custom ZeroCLIP框架通过检索增强的视觉-语言架构,在零样本设定下实现了CLIPScore达0.8536的领先性能,其METEOR指标相比基线提升19.3%,显著改善了文化术语的恢复能力。这一工作不仅回应了现代性导致传统服饰知识流失的紧迫挑战,更通过可扩展的数字化方案,为博物馆归档、文化索引等遗产保护实践提供了技术支撑,彰显了AI在弥合视觉符号与历史叙事之间鸿沟的深远意义。
相关研究论文
  • 1
    Zero-Shot Captioning for Cultural Heritage: Automated Image Analysis of Traditional Indonesian Clothing布拉维贾亚大学·计算机科学学院信息工程系 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务