遇见数据集

VietFashion

收藏
arXiv2026-06-11 更新2026-06-13 收录
数据链接:
官方服务:

资源简介:

VietFashion是由胡志明市国家大学科学大学团队构建的专注于越南传统服饰奥黛的细粒度跨模态检索基准数据集。该数据集包含超过21,000张通过生成模型合成的逼真图像,每条数据均包含手绘草图与从时尚杂志提取的文化属性文本描述,形成草图-文本-图像的多模态对齐结构。数据集通过结合Qwen-2.5文本生成模型和SANA-ControlNet图像生成模型构建,实现了从有限原始草图到大规模合成数据的扩展,并创新性地采用多目标检索设计,每个查询对应三个有效结果以模拟真实设计场景。该数据集主要应用于文化遗产数字化保护与时尚设计领域,旨在解决传统视觉检索系统对文化服饰细粒度结构特征和语义属性捕捉不足的问题,推动草图-文本组合图像检索技术在文化语义理解方面的发展。

VietFashion is a fine-grained cross-modal retrieval benchmark dataset focusing on the traditional Vietnamese clothing Áo dài, constructed by the team from the University of Science, Vietnam National University Ho Chi Minh City. This dataset contains over 21,000 photorealistic images generated via generative models, with each sample including hand-drawn sketches and textual descriptions of cultural attributes extracted from fashion magazines, establishing a multimodal alignment framework of sketch-text-image. The dataset is developed by integrating the Qwen-2.5 text generation model and the SANA-ControlNet image generation model, which enables scaling up from limited original sketches to large-scale synthesized multimodal data. It innovatively adopts a multi-objective retrieval design, where each query is paired with three valid results to simulate real-world design scenarios. This dataset is primarily utilized in the fields of digital heritage preservation and fashion design, aiming to address the limitation of traditional visual retrieval systems in capturing fine-grained structural features and semantic attributes of traditional cultural garments, and promote the advancement of sketch-text combined image retrieval technology for cultural semantic understanding.

创建时间:
2026-06-11
原始信息汇总

数据集概述

数据集名称:VietFashion
发布时间:2026年(ACM ICMR 2026)
所属领域:文化服饰检索
核心任务:Sketch-Text Composed Image Retrieval(草图-文本组合图像检索)
研究对象:越南传统服饰 Áo Dài
论文链接:https://doi.org/10.1145/3805622.3810590
项目主页:https://hng0303.github.io/VietFashion

数据集规模

  • 草图数量:650张(由人类手绘,覆盖不同抽象程度)
  • 合成图像:超过21,000张(基于草图+属性提示生成)
  • 检索查询:7,000个组合查询
  • 多目标映射:每个查询对应3张语义一致的目标图像(1→3)
  • 属性类别:11种(如面料、领型、袖子、刺绣等)

数据构建流程

  1. 草图收集:650张手绘草图,涵盖多种 Áo Dài 廓形、领型和袖型。
  2. 属性驱动合成:从11个属性类别中随机采样,使用 SANA-ControlNet 根据草图和结构化提示生成逼真图像。
  3. 描述提炼:使用 Qwen-2.5 3B Instruct 将结构化属性转化为自然语言描述(平均42.46个词,以“A photo of…”开头)。
  4. 三元组对齐:每个查询(草图+描述)与3个语义一致的目标图像配对(1→3)。

数据划分

  • 训练集:5,200个查询
  • 验证集:650个查询
  • 测试集:1,150个查询
    (划分基于草图级别,防止查询级泄露)

主要特点

  • 文化专注:面向传统服饰 Áo Dài,捕捉细粒度文化和结构细节。
  • 多目标检索:每个查询有3个有效目标图像,解决单目标设计中的“假阴性”问题。
  • 跨模态组合:结合草图(结构信息)和文本(语义信息)进行检索。

基准测试结果(测试集)

方法 范式 R@1 R@5 R@10 mAP MRR
BLIP4CIR 监督 0.0877 0.2672 0.3703 0.2483 0.3950
VaGFeM ST-CIR 0.0750 0.1612 0.2201 0.0356 0.1142
TaskFormer ST-CIR 0.0564 0.1472 0.2067 0.0269 0.0891
CLIP4CIR 监督 0.0313 0.1149 0.1851 0.1064 0.1908
ZSE-SBIR SBIR 0.0285 0.0623 0.1077 0.0323 0.0539
Pic2Word (Fine-tuned) 微调 0.0087 0.0221 0.0374 0.0253 0.0527

关键发现

  • 多模态组合(Sketch+Text)相比纯SBIR显著更优(VaGFeM R@1 是最好SBIR的2.6倍)。
  • 零样本模型表现差(最佳R@1仅0.01),通用视觉-语言预训练无法处理抽象草图和文化语义。
  • 细粒度检索困难,最好模型的R@1低于0.09。
  • BLIP4CIR显著优于CLIP4CIR,表明更强的文本-视觉对齐对细微语义差异至关重要。
  • 多目标设计导致低mAP,需要属性级判别而非实例记忆。
  • 描述长度(平均42.46词)增加语义丰富度,但也提升模型解析难度。

贡献

  1. 提出 VietFashion 基准,用于文化保留场景下的草图-文本组合检索。
  2. 开发生成式合成流水线(Qwen-2.5 + SANA-ControlNet),生成21,000张时尚图像。
  3. 实现多目标查询设计(1→3),减少单目标基准中的三元组歧义问题。
  4. 数据集公开可用,包含代码、标注和评估脚本。
搜集汇总
数据集介绍
VietFashion 数据集图片
构建方式
VietFashion数据集的构建经由一条多阶段流水线精心雕琢而成。首先,研究团队从权威时尚杂志与文化档案中系统爬取并人工筛选出涵盖结构、细节及背景三个维度的十一类服装属性词汇,构建了富含文化真实性的属性库。在此基础上,收集了650幅覆盖不同抽象层级与结构复杂度的手绘草图作为结构查询。随后,利用大型语言模型Qwen-2.5将随机组合的属性描述转化为平均长度约42词的规范自然语言标题。最后,借助SANA-ControlNet生成式模型,为每对草图-标题合成三张光照、纹理等细节各异但语义一致的逼真图像,总计产出21,000张目标图像,从而形成了7,000个由草图、文本与多目标图像构成的三元组查询。
特点
该数据集的独特之处在于其深度融合了文化特异性与多模态检索的复杂性。它以越南传统服饰奥黛为核心,所采用的结构属性(如廓形、领型)与装饰属性(如花卉刺绣)均源自专业时尚文献,确保了文化语义的高度保真。与单一正例的传统基准不同,VietFashion创新性地采用了多目标查询设计,每个查询对应三张语义一致但渲染细节迥异的有效目标图像,精准模拟了设计过程中“一个概念对应多种合法诠释”的真实歧义性。这种设计不仅缓解了训练中的假阴性监督问题,更迫使模型超越实例记忆,学习真正的属性级区分,从而构成了一个评估模型对细粒度文化语义理解能力的严苛试炼场。
使用方法
使用VietFashion数据集时,研究者可将其作为评估草图-文本组合图像检索(ST-CIR)模型的标准化基准。数据已按草图级别划分为5,200条训练查询、650条验证查询及1,150条测试查询,避免了查询级信息泄露。研究者可采用Recall@K、平均精度均值(mAP)和平均倒数排名(MRR)等指标,评估模型在监督式CIR、零样本CIR、ST-CIR及纯草图检索(SBIR)四种检索范式上的表现。数据集特别适用于探究跨模态融合机制的有效性,由于每张草图配有多条详细的专业属性描述,模型需具备在抽象草图与密集视觉细节间建立精准对齐的能力,从而推动更精细的视觉-语言对齐与属性推理研究。
背景与挑战
背景概述
在数字化文化遗产保护的浪潮中,视觉检索系统对传统服饰的细粒度理解仍显薄弱。2026年,由越南国立大学胡志明市分校研究团队开发的VietFashion数据集应运而生,旨在填补手绘草图与文本描述联合检索在文化服装领域的空白。该数据集聚焦越南传统服饰奥黛,通过收集650张涵盖多样结构细节的草图,并借助Qwen-2.5语言模型与SANA-ControlNet生成式管线,扩增出超过21000张具有忠实配文的高保真图像。研究团队还创新性地引入多目标检索协议,一个查询对应多个有效结果,以模拟设计意图的固有模糊性。该工作发表于ICMR '26,为细粒度文化服饰检索提供了全新基准,并揭示了现有模型在理解微妙文化语义方面的显著不足。
当前挑战
VietFashion所应对的核心挑战在于弥合抽象草图与精细文化意象之间的领域鸿沟。具体表现为:一是解决现有图像检索系统难以识别传统服饰中细微结构与符号性细节的问题,例如刺绣纹样、领型剪裁等高度依赖文化语境的属性;二是克服构建过程中多模态数据对齐的困难,即如何将手绘草图的稀疏结构信息与色彩、质地等文本语义融合,同时确保生成图像的文化真实性与多样性。此外,该数据集采用的多目标检索设计加剧了区分高度相似图像的任务难度,使模型必须学习属性级别的判别能力,而非简单的实例匹配。实验表明,即便是最优的监督学习方法,其召回率仍十分低下,凸显了文化服饰检索领域所面临的严峻技术挑战。
常用场景
经典使用场景
VietFashion数据集的经典使用场景聚焦于草图-文本组合图像检索(ST-CIR)这一前沿研究领域。在该场景中,研究者利用手绘草图捕捉越南传统服饰“奥黛”的结构轮廓,如衣身剪裁、袖型与领口设计,同时辅以文本描述来编码其深层的文化语义,包括布料质地、刺绣纹样与场合背景。这一多模态查询机制尤其适用于文化服饰设计场景——当设计师萌发某种创意构想时,无需精确绘制细节,仅凭借抽象草图与简短的文字描述即可从庞大图像库中检索出最契合其设计意图的服饰作品,突破了传统单一模态检索的局限性。
解决学术问题
该数据集直击当前视觉检索领域两大核心学术困境:一是主流模型对文化服饰中高度细粒度的结构性差异与符号性细节感知能力匮乏;二是现有草图-文本组合检索基准在文化多样性上的严重缺失。VietFashion通过构建包含650幅手绘草图与21,000张高保真合成图像的多目标检索环境,系统性地评估了从零样本到全监督的多种检索范式。实验表明即便是最优监督模型BLIP4CIR的Recall@1也仅为0.0877,揭示出现代视觉语言模型在理解抽象草图与细粒度文化语义之间复杂关联时仍存在显著性能鸿沟,为后续研究明确了关键突破方向。
衍生相关工作
VietFashion的出现催生了多个具有深远影响的相关研究脉络。在基准方法方面,BLIP4CIR与CLIP4CIR等模型在该数据集上的性能对比,直接促进了专用于细粒度文化服饰特征的更优多模态融合架构探索,如引入图神经网络的结构化语义推理框架。在零样本学习方向上,SEARLE系列与Pic2Word方法的验证结果表明,通用视觉语言预训练在面对抽象手绘与领域专属文化描述时泛化能力严重不足,这激发了针对草图-文本对齐的专用自监督预训练范式的开发。此外,该数据集的多目标检索设计亦推动了检索评估协议从单目标到多目标的范式转变,催生了面向设计多样性的新型排序损失函数与共识学习策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务