通用视觉模型自主适配模型参数文件
收藏国家基础学科公共科学数据中心2026-06-28 收录
官方服务:
资源简介:
本文提供了一个涵盖语义分割、目标检测、实例分割、图像分类及视频行为识别五种核心视觉任务的多模型参数数据集。该数据集汇集了采用基于ViT架构、ViT-MAE架构、Swin架构、ResNet架构等主流骨干网络在多个公开基准数据集上训练得到的模型权重文件,旨在为计算机视觉研究社区提供一套系统、多样的预训练与微调参数资源。在所有模型的构建过程中,其参数文件均在相应领域的大规模数据集上进行训练与测试,包括但不限于:Cityscapes(语义分割)、COCO(目标检测与实例分割)、Penn-Fudan(行人检测与分割)、VTAB(图像分类的多样化视觉任务)以及Kinetics-400(视频行为识别)。训练过程中采用了标准的优化策略与数据增强方法,并记录了每个模型在验证集上的性能指标,确保参数的有效性与可靠性。数据量为12.58GB。
提供机构:
北京航空航天大学


