遇见数据集

hf-model-downloads-by-origin-2022-2026

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

本数据集名为按来源国统计的Hugging Face模型下载量(2022-2026年),旨在提供按模型来源国聚合的Hugging Face模型年度下载计数,以镜像OpenRouter风格的美国与中国份额图表。数据来源于2022年至2026年期间存档的Hugging Face Hub访问日志,采用与官方模型下载方法一致的计算方式(已验证误差约0.4%),将对特定触发文件(如config.json、.gguf、.mlmodel等)的成功解析请求计为一次下载。核心特征在于其来源国归属逻辑:重新托管或量化版本的下载量被归功于原始模型的来源国,而非重新托管者。归属规则基于可信的第一方组织所在国家,或通过仓库名称检测模型家族(例如,qwen/glm/deepseek系列归为中国,llama/gemma/phi系列归为美国,mistral/flux/stable-diffusion系列归为欧盟等)。没有明确基础模型谱系的社区模型被标记为社区/独立类别。数据集包含多个结构化文件:summary_by_category_year.csv提供按类别(美国/中国/欧盟/社区)和年份的最终聚合下载量;repo_classified.csv提供每年排名前5000的仓库的详细数据,包括仓库名、分配类别和年度下载量;downloads_by_namespace_year.csv提供原始的按命名空间和年份的下载数据(无国家归属);mapping.csv提供命名空间到类别和所有者的映射;classify.py包含可编辑的分类规则脚本;cat_year_origin.json为JSON格式的聚合摘要。数据集中展示了2023年至2026年(部分)美国与中国模型下载量占两者总和的百分比趋势,显示了中国份额从1%增长至18%的变化。需要注意的是,2026年数据仅包含1月至6月;国家/模型家族的映射是尽力而为且可通过脚本修改的;且每年仅统计了前5000个仓库的下载量,这些仓库覆盖了总下载量的95%以上。

This dataset, named HF model downloads by origin country (2022-2026), aims to provide annual download counts for Hugging Face models aggregated by model origin country, mirroring OpenRouter-style US vs China share charts. The data is sourced from archived Hugging Face Hub access logs from 2022 to 2026, using the same calculation method as the official model downloads (with a verified error margin of about 0.4%), counting successful parse requests for specific trigger files (e.g., config.json, .gguf, .mlmodel) as one download. The core feature is its origin country attribution logic: downloads of re-hosted or quantized versions are credited to the origin country of the original model, not the re-hoster. Attribution rules are based on trusted first-party organization countries or model family detection via repository names (e.g., qwen/glm/deepseek series attributed to China, llama/gemma/phi series to the US, mistral/flux/stable-diffusion series to the EU, etc.). Community models without clear base model lineage are labeled as Community/Independent. The dataset includes multiple structured files: summary_by_category_year.csv provides final aggregated downloads by category (US/China/EU/Community) and year; repo_classified.csv provides detailed data for the top 5000 repositories each year, including repository name, assigned category, and annual downloads; downloads_by_namespace_year.csv provides raw download data by namespace and year (without country attribution); mapping.csv provides namespace-to-category and owner mappings; classify.py contains an editable classification rule script; cat_year_origin.json is a JSON-formatted aggregation summary. The dataset shows the trend of US vs China model download shares as a percentage of their total from 2023 to 2026 (partial), indicating Chinas share growing from 1% to 18%. Note that 2026 data only includes January to June; country/model family mappings are best-effort and modifiable via script; and only the top 5000 repositories per year are counted, covering over 95% of total downloads.

创建时间:
2026-06-27
原始信息汇总

数据集概述:HF模型下载量按来源国家统计(2022-2026)

数据集名称:HF model downloads by origin country (2022–2026)
许可证:other
标签:huggingface-internal, analytics, downloads


数据内容与结构

该数据集统计了2022年至2026年间Hugging Face平台上的模型下载次数,按模型仓库和模型来源国家进行聚合,旨在用HF数据呈现类似OpenRouter的“中美份额对比”图表。

数据集包含以下文件:

  • summary_by_category_year.csv:按类别(美国/中国/欧盟/社区)和年份汇总的最终下载数据
  • repo_classified.csv:每年排名前5000的仓库及其分类、下载量
  • downloads_by_namespace_year.csv:按命名空间和年份的原始下载量(无国家归属)
  • mapping.csv:命名空间 → 类别 → 所有者的映射(首轮组织映射)
  • classify.py:组织+模型系列分类规则脚本(可重新运行以重新映射)
  • cat_year_origin.json:与summary_by_category_year.csv相同的JSON格式数据

下载计算方式

数据来源为归档的Hub访问日志(通过Athena查询elastic-cloud-archive-db.all_requests_reports),经过验证与官方下载徽章差异约0.4%。

下载定义为:对以下触发文件的GET/HEAD解析请求(状态码200/302/304/307):

  • config.json, config.yaml, hyperparams.yaml, params.json, meta.yaml
  • 任何.gguf / .mlmodel / .llamafile / .tflite / .pte文件

所有请求均经过Hub解析端点,因此Hub日志能捕获完整情况。


来源归属规则

重新托管者或量化版本被归功于原始模型所在国家,而非重新托管者:

  • unsloth/Qwen2.5-7B-GGUF → 中国
  • bartowski/Meta-Llama-3.1-8B-GGUF → 美国

规则:可信第一方组织 → 其所属国家;否则根据仓库名称检测模型系列:

  • qwen/glm/deepseek → 中国
  • llama/gemma/phi → 美国
  • mistral/flux/stable-diffusion → 欧盟
  • Community/Independent = 没有基础模型谱系的社区模型(如任务分类器、独立嵌入),无来源国家

主要数据(中美对比,占中美下载量百分比)

年份 美国 中国
2023 99% 1%
2024 92% 8%
2025 86% 14%
2026* 82% 18%

*2026年为部分年份(1月至6月),绝对总量较低,份额可比较。转折点出现在2024年(Qwen2/2.5、DeepSeek)。


注意事项

  • 2026年仅包含1月至6月数据,为部分年份
  • 国家/模型系列映射为尽力而为,可通过classify.py编辑修改(例如:all-MiniLM/mpnet/e5归为美国,bge归为中国,gte归为中国,bert/gpt2/roberta归为美国)
  • 仓库级别表格仅保留每年排名前5000的仓库,覆盖约95%以上的下载量
搜集汇总
数据集介绍
hf-model-downloads-by-origin-2022-2026 数据集图片
构建方式
该数据集通过对Hugging Face平台历年的模型下载访问日志进行深度解析与聚合,构建了一套精细化的下载量统计体系。数据源源自经过归档的Hub访问记录(elastic-cloud-archive-db.all_requests_reports),经由Athena查询引擎处理,覆盖2022年至2026年的时间跨度。下载行为被严格界定为针对特定触发文件(如config.json、config.yaml等)的GET/HEAD请求,并经过状态码筛选,确保统计口径与Hugging Face官方下载徽章高度吻合(误差控制在0.4%以内)。更为精妙的是,数据集通过一套可编辑的规则(classify.py)对模型进行来源国归属,将重新托管或量化后的模型重新追溯至原始开发者的所在国家,从而实现了跨国别下载份额的精准刻画。
特点
该数据集最显著的特点在于其开创性的国家归属分析视角,它模仿OpenRouter的“中美份额”图表,专门聚焦于模型下载量的地域分布。通过一套灵活且可编辑的规则集,数据集能够将来自不同组织(如Unsloth、bartowski)的重新托管模型,准确归因至原始模型的国家(如中国、美国或欧盟),从而揭示全球AI模型消费的真实地理版图。此外,数据集提供了多维度、分层级的文件结构,包括按类别和年份汇总的最终摘要(summary_by_category_year.csv)、按仓库细分的详细清单(repo_classified.csv),以及原始命名空间下载量记录(downloads_by_namespace_year.csv),为研究者提供了从宏观到微观的全面数据洞察。
使用方法
该数据集的使用方法极为灵活且可扩展。研究人员可直接利用预先处理好的CSV和JSON文件进行趋势分析,例如通过summary_by_category_year.csv观察中美两国在模型下载份额上的此消彼长,或利用repo_classified.csv深入探究特定模型的全球影响力。对于需要定制分类规则的高级用户,可运行classify.py脚本调整组织及模型家族的映射逻辑,以适应不断演变的AI生态。数据集的JSON格式版本(cat_year_origin.json)则便于直接导入编程环境进行复杂统计与可视化工作。用户需注意2026年数据为仅包含上半年的部分记录,且顶级仓库的截断(Top 5000)可能对极小众模型的分析有一定影响,但整体而言,该数据集为理解全球AI模型消费趋势提供了坚实的数据基础。
背景与挑战
背景概述
在全球人工智能模型生态快速演进的背景下,模型下载量的地理分布成为衡量各国技术影响力与生态活跃度的重要指标。Hugging Face作为全球最大的模型托管平台,其下载数据具有高度代表性。该数据集由Hugging Face内部团队创建,时间跨度覆盖2022年至2026年,旨在通过分析模型下载的来源国家归属,揭示中美欧及社区在基础模型生态中的份额变化。核心研究问题聚焦于量化不同国家/地区在开源模型生态系统中的实际影响力,特别是中美之间的竞争态势。数据集中展示了从2023年美国的绝对主导(99%)到2026年中国份额显著增长(18%)的演变趋势,为理解全球AI模型扩散格局提供了实证基础,对学术界与产业界均具重要参考价值。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,模型下载的地理归属难以精确界定——量化转发或精调后的模型可能模糊原始模型的国家起源,需通过复杂的分类规则(如识别模型家族名称或信任第一方组织)进行推断,这引入了主观性和误差。其次,构建过程中遭遇了技术性挑战:需处理海量Hub访问日志(源于Elastic Cloud归档数据),并复现Hugging Face官方下载统计方法至约0.4%的验证精度;同时,国家/家族映射规则需持续更新以应对新兴模型家族(如Qwen、DeepSeek),且部分模型(如社区独立模型)无法归因,导致数据覆盖不完全。此外,2026年仅包含上半年数据,限制了时间序列的完整性分析。
常用场景
经典使用场景
该数据集记录了2022年至2026年间Hugging Face平台上模型下载量的年度统计,按原始模型所属国家进行归因,尤以中美两国为核心对比对象。研究者可借助此数据追溯大语言模型与多模态模型在全球范围内的分发格局,以量化方式洞察不同国家在人工智能开源生态中的影响力演变。其经典用途在于绘制类似OpenRouter风格的“中美份额对比图”,通过历时性的下载占比曲线,揭示模型技术输出国的竞争态势与制衡关系。该数据集通过精准的请求日志解析与模型家族识别规则,确保了归因逻辑的可复现性,为宏观科技政策分析与开源社区生态研究提供了牢固的数据基础。
解决学术问题
在学术研究中,该数据集有效解答了关于开源模型技术扩散的国家边界与影响力分布这一核心问题。传统研究往往依赖于间接指标如论文引用或企业排名来估计技术主导权,而本数据集直接以模型下载行为作为代理变量,更真实地反映了技术产品的实际使用热度。它帮助研究者厘清了中美欧等主要经济体在全球模型供给链中的角色变迁,例如中国模型份额在2024年后因Qwen2与DeepSeek等系列而显著攀升。该数据集还挑战了“开源即无国界”的朴素假设,揭示了模型再托管与原产地归因之间的复杂张力,推动了技术地理学与科技民族主义在人工智能领域的交叉探索。
衍生相关工作
该数据集催生了一系列围绕模型国家归因与下载计量方法论的研究工作。经典的衍生工作包括对分类规则的迭代与精细化,例如针对多家族混合模型(如基于Mistral框架但由中国团队微调的变体)提出更鲁棒的溯源算法。另一重要方向是将下载数据与技术论文引用网络进行联合分析,以揭示“学术影响”与“工业部署”之间的不一致性。部分学者还基于此数据构建了预测模型,用以预估未来各主要国家在全球模型流量中的占比走势。此外,该数据集的整理逻辑已被引入到其他开源平台(如GitHub仓库星标的国家归因分析)的比较研究中,成为一种可迁移的分析范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务