遇见数据集

基于视觉提示图像理解的数据集

收藏
官方服务:

资源简介:

基于视觉提示图像理解的数据集主要面向多模态大模型(MLLMs)的像素级图像理解研究、提升模型与图像交互能力的需求建设,基于现有开源定位与分割数据集(如RefCOCO、Visual Genome、ADE20k等)以及GPT-4V智能模型产生,主要记录了“图像-视觉提示-文本”三元组、多类型视觉提示坐标(点Point、边界框BBox)、细粒度区域描述、区域间关系分析及视觉问答(QA)等多维度指令标注观测值,数据量约为0.0005 TB(500MB,仅含标注文件)。 在多模态大模型快速发展的背景下,如何实现模型对图像细粒度、精准的区域理解与交互成为一项关键挑战。该数据集广泛覆盖了自然图像、场景文本、文档、移动端/网页UI界面及遥感图像等多个领域。其产生方法采取“开源重构”与“智能生成”相结合的方案:一方面通过反转现有数据集的输入输出逻辑,将传统的定位标注转化为视觉提示指令;另一方面利用GPT-4V结合Set-of-Marks提示技术,针对不同领域自动生成高质量的描述与问答数据。 本数据集共包含约50万组高质量的指令数据,为多模态大模型的细粒度区域理解、复杂逻辑推理及视觉交互能力的训练与评估提供了丰富、高精度的数据基准,具有重要的学术研究价值与工程应用意义。数据量619MB。

提供机构:
香港中文大学
二维码
社区交流群
二维码
科研交流群
商业服务