遇见数据集

ai-model-popularity

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

Datamata AI 模型流行度指数是一个每周更新的数据集,用于追踪 Hugging Face 平台上最受欢迎和趋势模型的流行度指标。该数据集基于每周快照,记录了每个模型的近期下载量(过去30天)、点赞数、模型任务类型(pipeline_tag)以及趋势评分(trending_score)。数据集旨在帮助用户分析模型流行度的动态变化,识别当前下载和点赞领先的模型,区分每周趋势模型与稳定高下载的常用模型,并按任务类型(如文本生成、文本到图像、嵌入等)进行流行度划分。数据规模为每次快照包含50个模型,以 CSV 格式存储,包含以下字段:快照日期(snapshot_date)、模型标识符(model_id)、作者/组织(author)、任务标签(pipeline_tag)、下载量(downloads)、点赞数(likes)和趋势评分(trending_score)。数据集适用于机器学习社区分析、模型趋势研究、任务流行度评估等应用场景。数据来源为 Hugging Face Hub 公共 API,采用 CC BY 4.0 许可证,允许免费使用和改编,包括商业用途,需注明出处。

The Datamata AI Model Popularity Index is a weekly updated dataset designed to track popularity metrics for the most popular and trending models on the Hugging Face platform. Based on weekly snapshots, it records each models recent downloads (past 30 days), likes, model task type (pipeline_tag), and trending score. The dataset aims to help users analyze dynamic changes in model popularity, identify models leading in downloads and likes, distinguish between weekly trending models and stable, high-download commonly used models, and categorize popularity by task types (such as text generation, text-to-image, embeddings, etc.). Each snapshot includes 50 models, stored in CSV format with the following fields: snapshot_date, model_id, author, pipeline_tag, downloads, likes, and trending_score. It is suitable for applications such as machine learning community analysis, model trend research, and task popularity evaluation. The data is sourced from the Hugging Face Hub public API and is licensed under CC BY 4.0, allowing free use and adaptation, including commercial purposes, with attribution required.

创建时间:
2026-06-27
原始信息汇总

Datamata AI Model Popularity Index 数据集概述

数据集简介

该数据集提供了 Hugging Face 平台上最受欢迎和最热门模型的每周流行度指标,包含每个模型在最近一次每周快照中的下载量、点赞数、任务类型和趋势排名等信息。

基本信息

  • 许可证CC BY 4.0(可免费使用和改编,包括商业用途,需注明出处)
  • 最新快照:2026-07-04
  • 当前版本模型数量:50
  • 更新频率:每周更新
  • 数据来源与方法论:https://www.datamatastudios.com/datasets

数据列说明

列名 类型 描述
snapshot_date 字符串 快照生成日期(UTC,格式:YYYY-MM-DD)
model_id 字符串 Hugging Face 模型标识符(例如 meta-llama/Llama-3-8B)
author 字符串 模型所属组织或用户(model_id 中斜杠前的部分),无命名空间的模型为空
pipeline_tag 字符串 模型的主要任务标签(如 text-generation、text-to-image),未标记则为空
downloads 数值 快照日期前 30 天内的 Hugging Face 下载量
likes 数值 快照日期时的 Hugging Face 点赞数
trending_score 数值 快照日期时的 Hugging Face 趋势评分,仅按下载量排名的模型为空

适用场景

  • 分析当前 Hugging Face 上按下载量和点赞数领先的模型
  • 识别本周热门模型(基于 trending_score)与持续高下载的稳定模型之间的差异
  • 研究不同任务类型(如文本生成、文本到图像、嵌入等)的流行度分布
  • 通过追加每周快照数据,追踪模型流行度随时间的变化趋势

数据构建方法

每周通过查询 Hugging Face Hub 公共 API,获取按过去 30 天下载量排序的顶级模型以及当前热门模型,并记录每个模型在快照日期下的下载量、点赞数、任务标签和趋势评分。完整方法和已知限制详见:https://www.datamatastudios.com/methodology

引用格式

Datamata Studios. "Datamata AI Model Popularity Index." 2026-07-04. https://www.datamatastudios.com/datasets. Licensed under CC BY 4.0.

搜集汇总
数据集介绍
ai-model-popularity 数据集图片
构建方式
该数据集由Datamata Studios团队构建,旨在追踪Hugging Face平台上最受欢迎模型的流行度变化。其构建过程遵循每周一次的更新频率,通过调用Hugging Face公开的Hub API,获取模型在近30天内的下载量、当前点赞数、任务标签及趋势评分等关键指标。每次快照均记录50个模型的最新数据,包括下载量排名靠前的模型与当前趋势上升的模型。完整的方法论与已知局限性已在官方网站上予以披露,确保数据收集过程的透明性与可重复性。
使用方法
使用该数据集时,用户可直接借助Pandas库从Hugging Face Hub流式读取CSV文件,无需预先下载。例如,通过`pd.read_csv('hf://datasets/datamatastudios/ai-model-popularity/ai-model-popularity.csv')`即可加载最新快照,并利用`sort_values('downloads', ascending=False)`快速查看当前下载量最高的模型。此外,亦可使用🤗 Datasets库的`load_dataset`方法将其加载为Dataset对象,便于整合进现代机器学习工作流中。
背景与挑战
背景概述
该数据集由Datamata Studios于2026年创建,旨在系统性地追踪Hugging Face平台上最具影响力AI模型的流行度演变。核心研究问题聚焦于如何量化开源模型在下载量、用户喜爱度及任务类型等维度的动态竞争格局。通过每周捕获前50个最热门模型的快照数据,该数据集为学术界和工业界提供了观察大语言模型、文本生成图像等前沿技术采纳趋势的独特窗口。其开放式许可协议(CC BY 4.0)和结构化设计使其成为分析AI模型社区生态、预测技术演进方向的重要基准资源。
当前挑战
该数据集面临的核心挑战在于如何准确界定和量化模型的动态流行度。Hugging Face平台上模型种类繁多且更新频繁,单一指标(如下载量)无法完全反映模型的实际影响力,而趋势分数则受平台推荐算法等黑箱机制影响,难以保证透明性和可比性。构建过程中需要平衡数据采集频率与API调用限制,同时处理重复模型、缺失标签及不同时间戳下数据一致性的技术难题。此外,模型流行度的快速更迭要求快照间隔足够短以捕捉瞬时变化,但过密采样又会引入噪声,影响数据可信度。
常用场景
经典使用场景
在人工智能模型生态快速演进的当下,该数据集以周为粒度捕捉Hugging Face平台上最受欢迎模型的下载量、点赞数、任务类别及趋势排名,为研究者提供了一扇观察模型流行度动态变化的窗口。经典使用场景包括纵向追踪明星模型(如Llama系列)的持续热度与新兴模型的爆发力,横向对比不同任务领域(如文本生成与文本到图像)的模型分布格局,以及识别那些虽不在趋势榜单却保持稳定高下载量的“常青树”模型。
解决学术问题
该数据集有效回应了学界对模型影响力量化与趋势演化的迫切需求。它解决了如何客观衡量模型在社区中的真实接受度而非仅依赖论文引用量的问题,使得研究者能够基于下载量与点赞数等行为指标评估模型的实际影响。此外,通过揭示模型流行度随时间波动的模式,它为探究技术扩散规律、社群偏好迁移以及开源AI生态的竞争态势提供了实证基础,对理解AI领域的知识传播与技术创新路径具有重要学术意义。
实际应用
在实际应用层面,该数据集能够辅助AI从业者制定模型选型与开发策略。开发者可据此识别高人气、社区验证充分的模型作为项目基座,企业团队则能通过分析任务标签下的模型流行度分布来优化技术栈的搭建方向。同时,该数据集的周度更新机制使得热点预警成为可能,可以帮助研究机构与创业公司及时捕捉新兴技术趋势,调整研发重心或市场布局,从而在快速变化的AI产业中占据先机。
数据集最近研究
最新研究方向
该数据集聚焦于Hugging Face平台上热门AI模型的动态流行度追踪,通过每周快照记录模型的下载量、点赞数、任务类型及趋势评分,为研究者提供了量化社区关注度与技术偏好变迁的窗口。当前前沿方向在于利用时序数据揭示大语言模型(LLM)和多模态生成模型的生态演化规律,例如分析Meta-Llama、Stable Diffusion等模型在下载与趋势得分上的异步波动,关联o3-mini等新发布模型对社区热点的冲击效应。结合开发者工具链的迁移行为,该数据可支撑模型采纳周期的预测研究,并为平台治理、资源分配策略提供实证基础,其价值在生成式AI行业加速内卷的背景下尤为凸显。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务