TWIN
收藏资源简介:
TWIN是由加州理工学院团队构建的大规模视觉问答数据集,包含56.1万对家居物品图像对比查询,旨在提升视觉语言模型对细粒度视觉差异的感知能力。数据集涵盖1,836个物体实例的22,157张图像,通过人工标注和DreamBooth生成技术构建正负样本对,重点关注形状、纹理等细微特征差异。该数据集主要应用于增强模型在机器人交互、零售产品识别等需要精细视觉理解的场景中的表现,通过对比学习机制解决现有模型忽视细节差异的核心问题。
TWIN is a large-scale visual question answering dataset constructed by a team from the California Institute of Technology (Caltech). It contains 561,000 pairs of comparative queries for household item images, aiming to improve the perceptual ability of visual-language models for fine-grained visual differences. The dataset covers 22,157 images of 1,836 object instances, where positive and negative sample pairs are generated via manual annotation and DreamBooth generation technology, with an emphasis on subtle feature disparities such as shape and texture. This dataset is primarily applied to enhance model performance in scenarios requiring fine-grained visual understanding, including robot interaction and retail product recognition, and it resolves the core problem that existing models overlook subtle detail differences through contrastive learning mechanisms.
TWIN数据集概述
数据集简介
- 名称:TWIN
- 核心任务:训练视觉语言模型(VLM)通过判断两张相似图像是否显示同一物体实例来检测细微的视觉差异。
- 规模:包含561,000个以实例为中心的图像对查询。
- 构成:包含22,157张独特图像,涵盖1,836个物体实例,跨越36个常见物体类别。
数据集构建
- 实例定义:同一物理物体在不同视角、光照和背景下的图像集合。
- 数据来源:从Amazon Reviews中获取不同类别的物体实例。
- 难点构建:专注于收集“困难负样本对”,即外观相似的不同物体,由人工标注者协助收集。
- 可扩展性:其成对表述方式使得数据集能够随着物体实例数量的增加而良好扩展。
训练与应用
- 训练方法:使用强化学习对现有VLM进行后训练,仅依赖于成对分配的真值标签进行监督,无需任何描述性文本注释。
- 训练模型示例:在Qwen2.5-VL 3B Instruct模型上进行后训练。
- 数据规模重要性:分析表明,使用从5K到561K不同数量的TWIN样本对进行训练,模型在所有评估数据集上的性能持续提升。
评估基准:FGVQA
- 目的:评估模型在细粒度视觉问答上的跨领域泛化能力。
- 构成:包含六个基准数据集,总计12,000个查询,涵盖零售产品、动植物、地标、鸟类和艺术领域。
- TWIN-Eval:TWIN的评估集。
- ILIAS:大规模实例级图像检索测试数据集。
- Google Landmarks v2:地标识别数据集。
- MET:大都会艺术博物馆的艺术品图像检索数据集。
- CUB:专注于鸟类物种识别的细粒度分类数据集。
- Inquire:自然世界图像检索基准。
- 查询类型:
- 配对查询:展示两张图像,询问它们是否描绘同一实例、艺术品或物种。
- 多重查询:提供一张参考图像和三张候选图像,询问有多少张与参考图像匹配。
效果评估
- 定量结果:在TWIN上后训练的模型在FGVQA基准套件上显示出显著提升。在ILIAS上提升+18.3%,在TWIN-Eval上提升+17.2%。改进也迁移到未见过的领域,如在INQUIRE、CUB、MET和LANDMARKS数据集上观察到显著增益。
- 定性结果:后训练的模型能够区分基模型忽略的细微颜色差异(如数字和时钟指针)。
- 通用性保持:在FGVQA上性能的提升并未损害模型在通用VQA基准上的性能。
引用信息
-
论文标题:Same or Not? Enhancing Visual Perception in Vision-Language Models
-
作者:Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari
-
年份:2025
-
arXiv编号:2512.23592
-
arXiv链接:https://arxiv.org/abs/2512.23592
-
BibTeX:
@misc{marsili2025notenhancingvisualperception, title={Same or Not? Enhancing Visual Perception in Vision-Language Models}, author={Damiano Marsili and Aditya Mehta and Ryan Y. Lin and Georgia Gkioxari}, year={2025}, eprint={2512.23592}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2512.23592}, }




