高效统一多模态自监督预训练算法测试实验支撑数据
收藏国家基础学科公共科学数据中心2026-06-28 收录
官方服务:
资源简介:
“高效统一多模态自监督预训练算法测试实验支撑数据”主要面向多模态视觉大模型预训练算法优化、模型性能评估及收敛速度对比等研究需求建设。本数据集基于GPU服务器算力训练,并通过在ImageNet和COCO等权威开源数据集上进行模型推理与微调测试产生,数据采集与生成周期为2024年10月至2025年6月。 本数据集主要记录了多模态自监督预训练算法的核心文件与评估指标,具体包括:算法的模型权重检查点(如uta_base_p16_224.pt等)、ImageNet数据集零样本分类测试结果(含预测类别、真实类别比对及整体准确率)、COCO数据集图文检索测试结果(含图像与文本的Recall@5召回率),以及本算法与基准模型(EVA02)在不同训练步数下的收敛速度对比日志和最终分数计算元信息。 在数据体量方面,本数据集包含了多个大容量的深度学习模型权重文件(.pt)、详尽的训练日志文件(.log)以及数万条多维度分数计算元信息记录(.json)。本数据的全开源共享,为多模态自监督预训练算法的有效性验证、长尾分布识别、零样本泛化能力及后续的模型复现提供了完整、可靠的底层实验支撑。数据量5.69GB。
提供机构:
香港中文大学


