遇见数据集

hrluo/ModelAtlasData

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

Model Atlas数据集包含了在论文《Charting and Navigating Hugging Faces Model Atlas》中使用的经过处理的数据。该数据集源自原始的hub-stats数据集,并经过了一系列专门为Model Atlas定制的预处理步骤:移除了不必要的列;从标签中提取了相关属性到独立列;手动标注了1000多条记录的base_model、base_model_relation或标记为未知;使用基于正则表达式的方法从模型卡片中自动提取了base_model信息;移除了base_model循环和自循环;排除了仓库中没有权重文件(例如.pt、.pth、.bin、.safetensors等扩展名文件)的模型;添加了虚拟模型来表示已被移除但仍被其他模型引用的基础模型。该数据用于构建论文和演示中使用的有向无环图(DAG)。

The Model Atlas Dataset contains the processed data used in the paper Charting and Navigating Hugging Faces Model Atlas. This dataset is derived from the original hub-stats dataset and has undergone several preprocessing steps specifically tailored for the Model Atlas: removed unnecessary columns; extracted relevant attributes from tags into dedicated columns; manually annotated over 1,000 records with base_model, base_model_relation, or marked as unknown; automatically extracted base_model information from model cards using a regex-based approach; removed base_model loops and self-loops; excluded models without weight files in the repository (i.e., files matching extensions like .pt, .pth, .bin, .safetensors, etc.); added virtual models to represent base models that have been removed but are still referenced by other models. The data is used to construct the directed acyclic graph (DAG) utilized in the paper and demo.

提供机构:
hrluo
搜集汇总
数据集介绍
hrluo/ModelAtlasData 数据集图片
构建方式
ModelAtlasData数据集基于原始的hub-stats数据集进行了精细的预处理与重构。首先,通过剔除冗余列、从标签中提取相关属性至专用列,完成了数据清洗。继而,人工标注了超过1000条记录的基模型及其关系,并利用正则表达式从模型卡片中自动抽取基模型信息,同时剔除了基模型循环引用与自引用。为确保数据质量,仅保留包含权重文件(如.pt、.bin、.safetensors等)的模型仓库。最后,为已被删除但仍被其他模型引用的基模型添加了虚拟节点,从而构建出一个层次分明的知识图谱。
使用方法
用户可通过Hugging Face数据集页面直接加载ModelAtlasData,使用如datasets库的load_dataset函数即可快速获取。该数据集主要服务于论文与Demo中模型的图结构分析,配合官方提供的代码库(https://github.com/eliahuhorwitz/Model-Atlas),用户可将其转换为可直接应用于图神经网络或可视化系统的有向无环图。建议在需要研究模型派生、基模型影响力分析或模型生态演化趋势的场景中使用,并引用原始论文作为学术参考。
背景与挑战
背景概述
ModelAtlasData数据集由耶路撒冷希伯来大学的Eliahu Horwitz、Nitzan Kurer、Jonathan Kahana、Liel Amar和Yedid Hoshen研究团队于2025年创建,发表于论文《Charting and Navigating Hugging Face's Model Atlas》。该数据集旨在系统化地梳理和可视化Hugging Face模型生态中的庞大模型集合及其衍生关系,核心研究问题是如何为开放模型库构建一个结构化的“模型图谱”,以帮助研究者导航和理解模型间的继承与演变。通过将原始hub-stats数据预处理为有向无环图结构,该数据集为模型关系分析、架构演化追踪以及模型推荐系统等下游任务提供了重要基础,对推动开放模型生态的可解释性与可探索性具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于Hugging Face平台上的模型数量快速增长,缺乏对模型间衍生关系的系统化梳理,使得研究者难以定位特定任务的基线模型或追踪模型演化路径。构建过程中面临多重挑战:首先,原始hub-stats数据包含大量无关列和噪声标签,需手动注释超过1,000条记录以提取准确的base_model关系;其次,许多模型卡中的base_model信息不规范或缺失,需设计正则表达式自动抽取;此外,需排除无权重文件的仓库和自引用循环,并针对已删除但被引用的基础模型添加虚拟节点,以维护图谱的完整性。
常用场景
经典使用场景
ModelAtlasData数据集为大规模预训练模型生态系统提供了结构化的元数据图谱,其经典使用场景在于构建模型间衍生关系的可视化导航系统。研究人员可利用该数据集中手动与自动标注的base_model信息及模型依赖关系,将海量HuggingFace模型映射为有向无环图(DAG),从而探索模型家族的演化脉络、版本分支与迁移流动。该场景特别适用于模型检索、相似性分析以及衍生路径追踪等任务,帮助用户在庞杂的模型库中高效定位最适配的基础架构或衍生变体。
解决学术问题
该数据集有效解决了模型生态研究中“信息孤岛”与“关系模糊”两大核心难题。通过消除冗余列、提取标签属性、去除自循环依赖并补充已删除但被引用的虚拟模型,它揭示了模型间隐藏的继承与衍生关系,为理解开源社区模型演化动力学提供了可量化分析的基础。这极大推动了模型谱系学、迁移学习路径优化以及模型血缘关系自动推断等学术方向的发展,其意义在于将非结构化的模型仓库转化为可推理的知识图谱,首次实现了对HuggingFace模型生态的全景式量化认知。
实际应用
在实际工业界与学术场景中,ModelAtlasData可支撑智能模型推荐系统、模型兼容性验证以及资源复用决策。当开发者需要选择适合下游任务的预训练基础模型时,该数据集能依据依赖关系与衍生频率推荐历史最悠久或关联最紧密的祖模型;在模型运维环节,它能自动检测因上游依赖消失导致的“模型孤儿”问题,辅助维护者及时更新或替换基座。此外,该数据集的预处理代码与可视化Demo可直接整合至MLOps平台,用于自动化追踪模型血缘与版本合规性。
数据集最近研究
最新研究方向
ModelAtlasData数据集为探索预训练模型生态系统的演化与关联性提供了关键数据基础。当前前沿研究方向聚焦于构建大规模模型关系图谱,通过解析模型间的派生、微调及继承关系,揭示开源模型社区的发展脉络。该数据集在论文《Charting and Navigating Hugging Face's Model Atlas》中被用于生成有向无环图,这使得研究者能够可视化追踪基础模型到衍生模型的演化路径,识别关键模型节点与群落结构。这一工作呼应了AI领域对模型供应链透明化与可追溯性的迫切需求,尤其在大模型快速迭代的背景下,为理解模型知识传递、评估模型影响力以及防范未授权使用等热点问题提供了量化分析工具。其意义在于将海量、碎片化的模型仓库转化为结构化的知识图谱,推动了模型治理、推荐系统和可持续性研究的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务