Salience COCO, Salience Flickr, Salience VizWiz
收藏资源简介:
Salience COCO、Salience Flickr和Salience VizWiz是三个面向低视力辅助的显著性感知图像描述数据集,由纽约大学等机构联合创建。这些数据集分别基于COCO、Flickr和VizWiz原始数据,经过筛选(至少包含两个超类别、排除户外运动场景)并引入对象级显著性标注,最终生成按重要性排序的描述文本。数据集规模未明确公布,但涵盖室内日常、城市街景等复杂场景,旨在解决通用视觉语言模型忽略人类感知优先级的问题,为低视力用户提供安全关键信息优先传达的辅助描述。
数据集概述
本页面介绍的是论文 “Focus Where It Counts: A Salience-Driven Vision-Language Model for Low Vision Assistance” 的官方匿名仓库,核心贡献包括一个显著度预测模块(QAGNet)、一个显著度感知的视觉语言模型(Salience-LLaVA),以及三个显著度感知的图像描述数据集。
显著度感知数据集
仓库提供了三个用于图像描述任务的数据集,均包含显著性排序信息,专为低视力人群的辅助场景设计:
| 数据集 | 图像数量 | 训练/测试划分 | 总词数 | 描述句子数 | 平均句子数 | 平均每句词数 | 词汇量 |
|---|---|---|---|---|---|---|---|
| Salience COCO | 8,295 | 6,636 / 1,659 | 728,043 | 46,012 | 5 | 16 | 6,657 |
| Salience Flickr | 8,725 | 6,980 / 1,745 | 712,516 | 46,190 | 5 | 15 | 6,882 |
| Salience VizWiz | 1,045 | 779 / 266 | 73,689 | 4,815 | 4 | 15 | 2,854 |
- 数据集特点:弥补了以往基准在显著性信息缺失、场景复杂度不足、以及包含不适用于低视力用户日常活动场景(如户外运动)三方面的局限。
- 质量验证:4名通过IRB批准的低视力参与者独立对随机采样验证集中的三个最显著物体进行排序,人类与模型排序之间的Cohen’s kappa达到 0.70,表明注释具有实质一致性。
- 数据获取:由于匿名评审政策与数据集规模,Salience COCO、Salience Flickr、Salience VizWiz 的Google Drive链接将在论文接收后提供。
QAGNet(显著度预测模块)
QAGNet 构建于 Mask2Former 之上,输入图像后输出实例级显著度掩码和排序分数。可通过脚本 scripts/precompute_saliency.sh 对图像文件夹进行批量处理,输出每个图像的 .npy 显著度张量,以及包含逐物体显著度分数和排名的 JSON 文件。预训练权重链接在评审期间暂不公开。
Salience-LLaVA(显著度感知视觉语言模型)
Salience-LLaVA 以 LLaVA-v1.5(Vicuna-v1.5)为基础,将 QAGNet 显著度分支接入模型,并基于上述三个显著度数据集进行微调。模型结构包含三条输入通路:
- 视觉骨干分支:CLIP-ViT 编码器将图像转换为 patch 特征,经 MLP 投影到LLM输入空间(维度D=4096)。
- 显著度分支(QAGNet):预测逐实例显著度掩码与排序,以多尺度显著度特征作为辅助视觉token注入。
- 大语言模型:结合投影的 CLIP tokens、QAGNet 显著度 tokens 与文本指令,生成有序、显著度感知的描述。
环境设置
提供基于 conda 的环境配置命令,需安装 PyTorch、transformers、deepspeed、flash-attn 等依赖,并克隆上游 LLaVA 仓库以可编辑模式安装。
训练
通过 bash scripts/finetune.sh 启动训练,也可使用 scripts/finetune_lora.sh 进行 LoRA 变体训练以适应显存受限环境。
推理
使用 src/train_saliency_llava.py 的 --mode infer 模式,配合模型路径、输入图像和对应的 .npy 显著度文件,即可生成单张图像的显著度感知描述。
评估
评估在保留测试集上进行,涵盖两方面指标:
- 标准描述质量:BLEU、METEOR、ROUGE-L、CIDEr。
- 显著度感知排序:提出的 SCMI(Salience-Consistent Mention Index) 指标,衡量预测描述中物体提及顺序与真实显著度降序排序的一致性。
通过 src/eval/run_eval.py 脚本可对预测结果进行计算,支持针对三个数据集的分别评估。完整定量结果与消融实验详见论文。





