通用视觉超大模型训练元信息数据库
收藏国家基础学科公共科学数据中心2026-06-28 收录
官方服务:
资源简介:
通用视觉超大模型训练元信息数据库”主要面向通用视觉超大模型的高效架构设计、自动化神经架构搜索(NAS)以及模型性能预测等前沿研究与实际工程需求建设。本数据集基于GPU服务器集群,通过对海量视觉模型结构进行大规模采样、训练与严格评估产生,数据采集与生成时间跨度为2024年10月至2025年6月。 本数据库主要记录了不同视觉模型在特定任务上的搜索轨迹与“结构-性能”映射关系。核心观测值与字段包括:搜索轨迹中的单步元信息(Trial)、模型具体结构的PyTorch代码实现(Arc),以及该模型结构在对应视觉任务上的实际性能精度(Acc)等。数据采用JSONL格式,并按文件大小切分为多个分片(如 processed_data_encode_space 系列)进行结构化存储。 在视觉大模型参数量与训练成本急剧攀升的背景下,本数据库的建设具有重要的学术与应用意义。它为探索庞大复杂的模型架构空间提供了详实、标准的基础数据支撑,极大降低了研究人员获取模型结构与性能关联规律的算力门槛,助力视觉大模型训练策略的优化与自动化扩展算法的快速迭代。整体数据量82.39GB。
提供机构:
香港中文大学搜集汇总
数据集介绍

背景与挑战
背景概述
该数据库面向通用视觉超大模型的高效架构设计与自动化神经架构搜索(NAS)需求,基于GPU集群对海量视觉模型结构进行采样、训练与评估,记录了搜索轨迹中的单步元信息、PyTorch代码实现及任务性能精度等结构-性能映射关系。数据采用JSONL格式存储,总量82.39GB,为降低视觉大模型训练与优化研究的算力门槛提供了标准化基础数据支撑。
以上内容由遇见数据集搜集并总结生成



