遇见数据集

shi-labs/COST

收藏
Hugging Face2024-04-23 更新2024-03-04 收录
官方服务:

资源简介:

COST数据集包含用于训练和评估多模态大语言模型(MLLMs)在对象级感知任务上的多个组件。这些组件包括从COCO-2017数据集中获取的RGB图像、使用DiNAT-L OneFormer模型生成的分割图(用于语义、实例和全景分割任务)、通过GPT-4生成的问题(用于对象识别和对象顺序感知任务)以及使用DINOv2 DPT模型生成的深度图。数据集将这些信息以文本形式表示,最终生成问答对。数据集提供了不同的训练和评估分割,包括训练集、验证集等。

COST数据集包含用于训练和评估多模态大语言模型(MLLMs)在对象级感知任务上的多个组件。这些组件包括从COCO-2017数据集中获取的RGB图像、使用DiNAT-L OneFormer模型生成的分割图(用于语义、实例和全景分割任务)、通过GPT-4生成的问题(用于对象识别和对象顺序感知任务)以及使用DINOv2 DPT模型生成的深度图。数据集将这些信息以文本形式表示,最终生成问答对。数据集提供了不同的训练和评估分割,包括训练集、验证集等。

提供机构:
shi-labs
原始信息汇总

COST 数据集

COST 数据集包含以下组件,用于训练和评估多模态大型语言模型(MLLMs)在物体级别感知任务上的表现:

  • RGB 图像:来源于 COCO-2017 数据集。
  • 分割图:用于语义、实例和全景分割任务,使用公开可用的 DiNAT-L OneFormer 模型在 COCO 数据集上训练得到。
  • 问题:通过提示 GPT-4 生成,用于物体识别和物体顺序感知任务。问题可在 questions.py 中找到。
  • 深度图:使用公开可用的 ViT-L/14 蒸馏变体 DINOv2 DPT 模型在 NYUd 数据集上训练得到。

我们以文本形式表示分割图和深度图的信息,以获得最终的问答对。更多细节请参考我们的论文第 3.1 节。

数据集提供了不同的分割用于训练和评估:

分割 图像数量 问答对数量 来源
train 280k 280k train2017, test2017, unlabeled2017
val 5k 5k val2017

文件结构

text coco_segm_text ├── depth │ └── test │ │ └── ... │ └── train │ │ └── depth # 包含 train2017 分割的深度图 │ │ └── panoptic_order.txt # 包含 test2017 分割图像的物体顺序感知任务答案 │ └── unlabeled │ │ └── ... │ └── val │ │ └── ... ├── test │ └── ... ├── train │ └── instance_inference # 包含 train2017 分割的实例掩码 │ └── instance.txt # 包含 train2017 分割图像的实例物体识别任务答案 │ └── panoptic_inference # 包含 train2017 分割的全景掩码 │ └── panoptic.txt # 包含 train2017 分割图像的全景物体识别任务答案 │ └── semantic_inference # 包含 train2017 分割的语义掩码 │ └── semantic.txt # 包含 train2017 分割图像的实例物体识别任务答案 ├── unlabeled │ └── ... ├── val │ └── ...

搜集汇总
数据集介绍
shi-labs/COST 数据集图片
构建方式
在视觉语言模型蓬勃发展的背景下,COST数据集应运而生,专为训练和评估多模态大语言模型在对象级感知任务中的表现而设计。其构建过程严谨而系统:首先,从COCO-2017数据集中精选RGB图像作为视觉基础;随后,利用在COCO上预训练的DiNAT-L OneFormer模型生成语义、实例及全景分割图,并借助基于NYUd训练的DINOv2 DPT模型提取深度图。最终,通过提示GPT-4生成对象识别与顺序感知任务的问题,将分割与深度信息以文本形式编码,形成完整的问答对,充分融合了视觉理解与语言推理。
特点
该数据集的核心特色在于其多维度、多任务的综合性。它整合了RGB图像、语义/实例/全景分割图及深度图,为对象级感知提供了丰富的层次化信息。通过将视觉特征转化为文本描述,COST实现了视觉与语言的深度对齐,支持对象识别与顺序感知两类挑战性任务。此外,数据集规模庞大,训练集包含28万张图像及等量问答对,覆盖COCO的多个子集,确保了样本的多样性与泛化能力,为模型在复杂场景中的细粒度理解奠定了坚实基础。
使用方法
COST数据集的使用灵活而高效,适用于多模态大语言模型的训练与评估。用户可通过HuggingFace平台直接下载,其文件结构按任务类型(如深度、分割)和数据集划分(训练/验证/测试)清晰组织,便于按需调用。例如,针对实例分割任务,可直接访问‘instance_inference’目录下的掩码及对应文本答案。在模型应用中,建议结合VCoder框架,将分割与深度信息作为额外视觉编码输入,提升对象级感知的准确性。详细的问答生成逻辑可参考配套代码仓库中的‘questions.py’文件,确保复现与扩展的便捷性。
背景与挑战
背景概述
在多模态大语言模型(MLLMs)蓬勃发展的浪潮中,如何赋予模型精准的物体级感知能力成为一项核心挑战。由SHI-Labs团队于2023年发布的COST数据集,旨在为MLLMs提供统一的物体级视觉感知训练与评估基准。该数据集由Jitesh Jain、Jianwei Yang和Humphrey Shi等人创建,基于COCO-2017图像,通过DiNAT-L OneFormer模型生成语义、实例与全景分割掩码,利用DINOv2 DPT模型提取深度图,并借助GPT-4生成目标识别与顺序感知的问答对。COST数据集将分割与深度信息转化为文本形式,构建了280k训练样本与5k验证样本,填补了MLLMs在细粒度物体感知任务中缺乏高质量标注数据的空白,为视觉-语言模型的进阶研究奠定了坚实基础。
当前挑战
COST数据集所应对的领域挑战在于,现有MLLMs在处理物体级感知任务时,常因缺乏结构化视觉线索而陷入语义模糊或空间混乱。该数据集通过将分割与深度信息文本化,迫使模型学习从离散描述中重构视觉场景,从而提升对物体类别、实例排序及空间关系的理解能力。在构建过程中,团队面临多重技术难题:如何从COCO图像中高效提取多类型分割掩码并保证一致性,如何利用预训练模型生成可靠的深度图以避免噪声干扰,以及如何设计GPT-4提示词以产出高质量、无偏见的问答对。此外,跨模型(OneFormer与DINOv2)输出的对齐与融合、大规模数据集的存储与索引效率,均为实际落地中的关键挑战。
常用场景
经典使用场景
COST数据集,作为多模态大语言模型(MLLMs)在物体级感知任务中的标杆资源,其经典使用场景聚焦于训练与评估模型对图像中语义、实例及全景分割的理解能力。该数据集以COCO-2017的RGB图像为基底,融合了由OneFormer模型生成的高质量分割掩码、DINOv2 DPT估计的深度图,以及GPT-4驱动的物体识别与顺序感知问题,构建了超过28万对图文问答样本。研究者常利用其丰富的文本化感知信息,推动MLLMs在细粒度物体定位与空间关系推理上的性能突破,例如验证模型是否能在复杂场景中准确区分重叠物体的类别与层次。
实际应用
实际应用中,COST数据集赋能了智能系统在自动化视觉检测与交互场景中的落地能力。例如在工业质检中,模型可利用其训练的分割与深度理解能力,精准定位产品表面缺陷并判断其与周围组件的层次关系;在自动驾驶领域,该数据集有助于提升车辆对道路障碍物、行人及交通标识的实时感知精度,通过融合语义与深度信息增强环境建模的鲁棒性。此外,在增强现实(AR)应用中,COST支持的物体顺序推理可为虚拟内容与现实物体的正确遮挡渲染提供关键支撑。
衍生相关工作
COST数据集的提出衍生了一系列引领性研究工作,其中最具代表性的是VCoder框架,它通过集成专用视觉编码器(如分割与深度编码器)拓展了MLLMs的感知维度。后续工作进一步探索了将文本化分割与深度信息作为跨模态桥梁,例如在LLaVA、InstructBLIP等模型中引入COST风格的问答对,以强化模型对结构化视觉线索的响应能力。此外,基于COST的评估协议催生了如SegGPT等统一分割模型的研究,推动了视觉基础模型在开放世界物体感知中的泛化性能提升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务