遇见数据集

Salience COCO, Salience Flickr, Salience VizWiz

收藏
arXiv2026-08-28 更新2026-09-01 收录
官方服务:

资源简介:

Salience COCO、Salience Flickr和Salience VizWiz是三个面向低视力辅助的显著性感知图像描述数据集,由纽约大学等机构联合创建。这些数据集分别基于COCO、Flickr和VizWiz原始数据,经过筛选(至少包含两个超类别、排除户外运动场景)并引入对象级显著性标注,最终生成按重要性排序的描述文本。数据集规模未明确公布,但涵盖室内日常、城市街景等复杂场景,旨在解决通用视觉语言模型忽略人类感知优先级的问题,为低视力用户提供安全关键信息优先传达的辅助描述。

创建时间:
2026-08-28
原始信息汇总

数据集概述

本页面介绍的是论文 “Focus Where It Counts: A Salience-Driven Vision-Language Model for Low Vision Assistance” 的官方匿名仓库,核心贡献包括一个显著度预测模块(QAGNet)、一个显著度感知的视觉语言模型(Salience-LLaVA),以及三个显著度感知的图像描述数据集。

显著度感知数据集

仓库提供了三个用于图像描述任务的数据集,均包含显著性排序信息,专为低视力人群的辅助场景设计:

数据集 图像数量 训练/测试划分 总词数 描述句子数 平均句子数 平均每句词数 词汇量
Salience COCO 8,295 6,636 / 1,659 728,043 46,012 5 16 6,657
Salience Flickr 8,725 6,980 / 1,745 712,516 46,190 5 15 6,882
Salience VizWiz 1,045 779 / 266 73,689 4,815 4 15 2,854
  • 数据集特点:弥补了以往基准在显著性信息缺失、场景复杂度不足、以及包含不适用于低视力用户日常活动场景(如户外运动)三方面的局限。
  • 质量验证:4名通过IRB批准的低视力参与者独立对随机采样验证集中的三个最显著物体进行排序,人类与模型排序之间的Cohen’s kappa达到 0.70,表明注释具有实质一致性。
  • 数据获取:由于匿名评审政策与数据集规模,Salience COCO、Salience Flickr、Salience VizWiz 的Google Drive链接将在论文接收后提供。

QAGNet(显著度预测模块)

QAGNet 构建于 Mask2Former 之上,输入图像后输出实例级显著度掩码和排序分数。可通过脚本 scripts/precompute_saliency.sh 对图像文件夹进行批量处理,输出每个图像的 .npy 显著度张量,以及包含逐物体显著度分数和排名的 JSON 文件。预训练权重链接在评审期间暂不公开。

Salience-LLaVA(显著度感知视觉语言模型)

Salience-LLaVA 以 LLaVA-v1.5(Vicuna-v1.5)为基础,将 QAGNet 显著度分支接入模型,并基于上述三个显著度数据集进行微调。模型结构包含三条输入通路:

  1. 视觉骨干分支:CLIP-ViT 编码器将图像转换为 patch 特征,经 MLP 投影到LLM输入空间(维度D=4096)。
  2. 显著度分支(QAGNet):预测逐实例显著度掩码与排序,以多尺度显著度特征作为辅助视觉token注入。
  3. 大语言模型:结合投影的 CLIP tokens、QAGNet 显著度 tokens 与文本指令,生成有序、显著度感知的描述。

环境设置

提供基于 conda 的环境配置命令,需安装 PyTorch、transformers、deepspeed、flash-attn 等依赖,并克隆上游 LLaVA 仓库以可编辑模式安装。

训练

通过 bash scripts/finetune.sh 启动训练,也可使用 scripts/finetune_lora.sh 进行 LoRA 变体训练以适应显存受限环境。

推理

使用 src/train_saliency_llava.py--mode infer 模式,配合模型路径、输入图像和对应的 .npy 显著度文件,即可生成单张图像的显著度感知描述。

评估

评估在保留测试集上进行,涵盖两方面指标:

  • 标准描述质量:BLEU、METEOR、ROUGE-L、CIDEr。
  • 显著度感知排序:提出的 SCMI(Salience-Consistent Mention Index) 指标,衡量预测描述中物体提及顺序与真实显著度降序排序的一致性。

通过 src/eval/run_eval.py 脚本可对预测结果进行计算,支持针对三个数据集的分别评估。完整定量结果与消融实验详见论文。

搜集汇总
数据集介绍
Salience COCO, Salience Flickr, Salience VizWiz 数据集图片
构建方式
在视觉-语言模型(VLM)广泛应用于辅助技术但缺乏对人类感知优先级建模的背景下,Salience COCO、Salience Flickr 和 Salience VizWiz 数据集应运而生。这三个数据集分别基于 COCO、Flickr30K 和 VizWiz 图像重新构建,旨在捕捉低视力用户在真实环境中的显著性知觉。构建流程首先通过过滤策略保留包含至少两个语义超类别的图像,并剔除户外运动等低相关场景,以贴近低视力用户的日常需求。随后,采用 QAGNet 模型生成显著性图,并结合 YOLO-World 自动检测目标,根据每个目标边界框内的平均显著性强度进行降序排序。最后,将排序后的目标标签与原始图像输入 Janus Pro-7B,依据统一模板生成按重要性顺序描述对象的显著性感知标注。所有配置(如置信度阈值、排序流程和生成模板)均保持固定以确保一致性。
特点
Salience COCO、Salience Flickr 和 Salience VizWiz 数据集的核心特色在于其对象级别的显著性标注,这些标注经过低视力参与者的验证,与人类感知优先级高度对齐。数据集不仅涵盖复杂的室内外场景,如厨房、客厅和城市街道,还排除了对低视力辅助无显著意义的户外运动场景,确保了内容的代表性。每个数据集均包含丰富的多类别对象,平均句子长度约为15词,词汇量从2,854到6,882不等,提供了多样化的语义挑战。此外,通过 QAGNet 的上下文相关排序能力,同一对象在不同场景中的显著性排名会动态变化,例如杯子在用餐场景中显著而在社交场景中排名降低,这种灵活性使得模型能够适应不同环境下的感知需求。
使用方法
Salience COCO、Salience Flickr 和 Salience VizWiz 数据集主要用于训练和评估显著性感知的图像描述模型,特别是针对低视力辅助场景。研究人员可利用这些数据集微调视觉-语言模型(如 Salience-LLaVA),通过注入显著性特征(如 saliency ranking)来生成按重要性顺序描述对象的标题。数据集的标注格式与 COCO 风格一致,便于直接用于目标检测和描述任务。使用时,用户可基于提供的图像、边界框和显著性排序标签构建训练集或测试集,并通过标准指标(如 BLEU、CIDEr)及专门设计的 SCMI(显著性一致性匹配指数)评估模型在对象排序准确性上的表现。此外,这些数据集还可用于人机交互研究,如验证低视力用户对模型输出的满意度。
背景与挑战
背景概述
随着多模态大语言模型的飞速发展,视觉语言模型已广泛应用于医疗辅助技术,特别是针对盲人与低视力人群的辅助设备。然而,现有视觉语言模型多面向通用图像描述,未能明确建模人类感知优先级,导致在辅助场景中难以突出对低视力用户至关重要的安全信息。为此,纽约大学阿布扎比分校的研究团队于2026年提出Salience COCO、Salience Flickr和Salience VizWiz三个显著性感知数据集,旨在捕捉真实世界中低视力用户所需的关键视觉信息。这三个数据集分别基于COCO、Flickr30K和VizWiz重构,通过融合人类注视数据驱动的显著性模型,生成按重要性排序的物体级描述,并经过低视力参与者的验证。该数据集填补了现有图像描述基准在人类感知优先级建模上的空白,为开发以人为中心的辅助视觉语言模型奠定了重要基础,对提升低视力用户的独立行动能力具有深远影响。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,现有视觉语言模型在描述图像时对场景元素不加以区分,无法优先呈现影响低视力用户安全与导航的关键信息,如不平整路缘、来车或错位的盲道,这导致生成描述虽内容详尽却实用性不足。构建过程中,需从原始数据中筛选至少包含两个超类别的复杂场景,以反映真实环境的视觉拥挤程度,并排除户外运动等非代表性情境;同时,需利用显著性模型自动排序并生成符合人类感知顺序的标注,但需确保模型排序与低视力参与者的判断高度一致,经Cohen's kappa验证达到0.70方视为合格;此外,数据规模不均(如Salience VizWiz仅1045张图)与低光照条件下的显著性估计鲁棒性亦构成显著挑战。
常用场景
经典使用场景
Salience COCO、Salience Flickr与Salience VizWiz数据集在视觉语言模型领域开辟了崭新的研究范式,其核心应用场景聚焦于显著性感知的图像描述生成。这三个数据集通过引入对象级别的显著性排序标注,使模型能够依据人类视觉注意力优先级组织描述次序,尤其适用于辅助低视力人群的场景理解任务。在具体应用中,研究者利用这些数据集训练具备显著性感知能力的视觉语言模型,使其生成的描述不仅涵盖场景中所有关键元素,更严格遵循从高到低的显著性顺序进行叙述。这种机制有效解决了传统描述模型对所有对象平等对待的局限,使得生成的描述更贴近真实人类的感知和认知习惯,显著提升了描述内容在导航辅助、环境感知等实际应用中的信息传递效率和安全性。
解决学术问题
这三个数据集的构建旨在攻克视觉语言模型在捕捉人类感知优先级方面的核心缺陷。传统图像描述数据集如COCO、Flickr30K和VizWiz虽然提供了丰富的场景标注,但均未显式建模对象在人类视觉感知中的重要性排序,导致模型生成的描述缺乏对任务相关和安全关键信息的优先关注。Salience系列数据集通过引入基于人类注视数据的显著性排序标注,解决了现有基准中场景复杂度不足、上下文代表性欠缺以及低视力用户需求导向缺失等关键问题。这些数据集的提出使得研究人员能够系统性地评估和提升模型在显著性驱动下的描述生成能力,填补了该领域缺乏面向低视力辅助应用的标准化评测资源的空白,为探索人类中心化视觉语言理解提供了坚实的实验基础。
衍生相关工作
Salience系列数据集的发布催生了一系列具有深远影响的后续研究。其中最具代表性的是Salience-LLaVA模型,该模型通过双分支架构将显著性特征显式融入视觉语言模型的生成过程,展示了融合人类视觉优先级与语言生成的创新范式。此外,数据集的提出直接推动了显著性引导的目标排序评测指标SCMI及其语义增强版本Wu-Palmer SCMI的发展,为领域内评估模型对显著性顺序的保持能力提供了标准化工具。在模型架构方面,研究者探索了多种替代显著性提取网络(如Samba、DSGNN)与Salience-LLaVA结合的性能表现,验证了所提框架的鲁棒性和泛化能力。这些衍生工作不仅深化了对显著性信息在视觉语言理解中作用的认识,还拓展了该方法在自主导航、搜索救援和工业检测等更广泛场景中的应用前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务