通用视觉模型自主适配算法库
收藏国家基础学科公共科学数据中心2026-06-28 收录
官方服务:
资源简介:
本数据集中构建了一个面向多任务视觉感知的自主适配算法库。该算法库集成了当代最具代表性的六种深度学习架构,包括基于Transformer架构的视觉Transformer(ViT)、基于自监督掩码自编码器预训练的ViT-MAE、基于层次化移动窗口的Swin Transformer、经典的深度残差网络ResNet、大规模视觉基础模型InternViT,以及专为移动端和嵌入式设备设计的轻量级卷积网络MobileNetV3。通过对基于以上架构的通用视觉模型在语义分割、目标检测、实例分割、图像分类以及视频行为识别等任务上进行进行多任务自主适配,兼顾了高精度与实时性的需求。数据量为2.43GB。
提供机构:
北京航空航天大学


