VietFashion
收藏资源简介:
VietFashion是由胡志明市国家大学科学大学团队构建的专注于越南传统服饰奥黛的细粒度跨模态检索基准数据集。该数据集包含超过21,000张通过生成模型合成的逼真图像,每条数据均包含手绘草图与从时尚杂志提取的文化属性文本描述,形成草图-文本-图像的多模态对齐结构。数据集通过结合Qwen-2.5文本生成模型和SANA-ControlNet图像生成模型构建,实现了从有限原始草图到大规模合成数据的扩展,并创新性地采用多目标检索设计,每个查询对应三个有效结果以模拟真实设计场景。该数据集主要应用于文化遗产数字化保护与时尚设计领域,旨在解决传统视觉检索系统对文化服饰细粒度结构特征和语义属性捕捉不足的问题,推动草图-文本组合图像检索技术在文化语义理解方面的发展。
VietFashion is a fine-grained cross-modal retrieval benchmark dataset focusing on the traditional Vietnamese clothing Áo dài, constructed by the team from the University of Science, Vietnam National University Ho Chi Minh City. This dataset contains over 21,000 photorealistic images generated via generative models, with each sample including hand-drawn sketches and textual descriptions of cultural attributes extracted from fashion magazines, establishing a multimodal alignment framework of sketch-text-image. The dataset is developed by integrating the Qwen-2.5 text generation model and the SANA-ControlNet image generation model, which enables scaling up from limited original sketches to large-scale synthesized multimodal data. It innovatively adopts a multi-objective retrieval design, where each query is paired with three valid results to simulate real-world design scenarios. This dataset is primarily utilized in the fields of digital heritage preservation and fashion design, aiming to address the limitation of traditional visual retrieval systems in capturing fine-grained structural features and semantic attributes of traditional cultural garments, and promote the advancement of sketch-text combined image retrieval technology for cultural semantic understanding.
数据集概述
数据集名称:VietFashion
发布时间:2026年(ACM ICMR 2026)
所属领域:文化服饰检索
核心任务:Sketch-Text Composed Image Retrieval(草图-文本组合图像检索)
研究对象:越南传统服饰 Áo Dài
论文链接:https://doi.org/10.1145/3805622.3810590
项目主页:https://hng0303.github.io/VietFashion
数据集规模
- 草图数量:650张(由人类手绘,覆盖不同抽象程度)
- 合成图像:超过21,000张(基于草图+属性提示生成)
- 检索查询:7,000个组合查询
- 多目标映射:每个查询对应3张语义一致的目标图像(1→3)
- 属性类别:11种(如面料、领型、袖子、刺绣等)
数据构建流程
- 草图收集:650张手绘草图,涵盖多种 Áo Dài 廓形、领型和袖型。
- 属性驱动合成:从11个属性类别中随机采样,使用 SANA-ControlNet 根据草图和结构化提示生成逼真图像。
- 描述提炼:使用 Qwen-2.5 3B Instruct 将结构化属性转化为自然语言描述(平均42.46个词,以“A photo of…”开头)。
- 三元组对齐:每个查询(草图+描述)与3个语义一致的目标图像配对(1→3)。
数据划分
- 训练集:5,200个查询
- 验证集:650个查询
- 测试集:1,150个查询
(划分基于草图级别,防止查询级泄露)
主要特点
- 文化专注:面向传统服饰 Áo Dài,捕捉细粒度文化和结构细节。
- 多目标检索:每个查询有3个有效目标图像,解决单目标设计中的“假阴性”问题。
- 跨模态组合:结合草图(结构信息)和文本(语义信息)进行检索。
基准测试结果(测试集)
| 方法 | 范式 | R@1 | R@5 | R@10 | mAP | MRR |
|---|---|---|---|---|---|---|
| BLIP4CIR | 监督 | 0.0877 | 0.2672 | 0.3703 | 0.2483 | 0.3950 |
| VaGFeM | ST-CIR | 0.0750 | 0.1612 | 0.2201 | 0.0356 | 0.1142 |
| TaskFormer | ST-CIR | 0.0564 | 0.1472 | 0.2067 | 0.0269 | 0.0891 |
| CLIP4CIR | 监督 | 0.0313 | 0.1149 | 0.1851 | 0.1064 | 0.1908 |
| ZSE-SBIR | SBIR | 0.0285 | 0.0623 | 0.1077 | 0.0323 | 0.0539 |
| Pic2Word (Fine-tuned) | 微调 | 0.0087 | 0.0221 | 0.0374 | 0.0253 | 0.0527 |
关键发现
- 多模态组合(Sketch+Text)相比纯SBIR显著更优(VaGFeM R@1 是最好SBIR的2.6倍)。
- 零样本模型表现差(最佳R@1仅0.01),通用视觉-语言预训练无法处理抽象草图和文化语义。
- 细粒度检索困难,最好模型的R@1低于0.09。
- BLIP4CIR显著优于CLIP4CIR,表明更强的文本-视觉对齐对细微语义差异至关重要。
- 多目标设计导致低mAP,需要属性级判别而非实例记忆。
- 描述长度(平均42.46词)增加语义丰富度,但也提升模型解析难度。
贡献
- 提出 VietFashion 基准,用于文化保留场景下的草图-文本组合检索。
- 开发生成式合成流水线(Qwen-2.5 + SANA-ControlNet),生成21,000张时尚图像。
- 实现多目标查询设计(1→3),减少单目标基准中的三元组歧义问题。
- 数据集公开可用,包含代码、标注和评估脚本。




