多模态多任务的通用视觉模型测试实验支撑数据
收藏国家基础学科公共科学数据中心2026-06-28 收录
官方服务:
资源简介:
多模态多任务的通用视觉模型测试实验支撑数据主要面向通用视觉模型的多模态、多任务能力测评研究,以及长尾分布物体识别、复杂场景感知、三维物体分类等前沿需求建设。本数据集基于MS COCO静态图像、广泛的真实世界场景采集图像以及CAD/3D建模对象等来源加工产生,主要记录了图像路径、文本表达式、像素级目标掩码与分割轮廓、目标外接矩形框、区域类别,以及3D点云及类别标签等观测值。 在主要内容与数据体量方面,本数据集整合了四大核心测试集:一是Refcocog检测数据(表达式平均8.4个单词),用于测评模型的指代分割能力;二是LVIS检测数据,包含超过1200个物体类别,测试集包含1000张图片与4000多个区域对象,旨在解决长尾分布物体识别问题;三是ADE20k检测数据,选取150个常用类别进行高密度像素级标注,用于场景的语义分割与全景分割;四是ModelNet40点云数据,包含40个类别共2468条3D点云测试样本,用于测试三维物体分类能力。 本数据资源覆盖了极其丰富的室内外日常生活场景及规则三维空间,标注精度达到像素级与物体级。其建设意义在于为通用视觉模型提供了高质量、标准化的实验支撑,使得模型在mIoU、语义相似度(SS)、全景质量(PQ)及准确率(Accuracy)等核心指标上的评估更加科学、全面,对推动计算机视觉与多模态大模型的发展具有重要的研究价值。数据量37GB。
提供机构:
香港中文大学


