遇见数据集

Radar HuggingFace Dataset

收藏
github2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

Radar HuggingFace Dataset 是一个开放、动态且版本化的HuggingFace生态系统数据集。每天有数千个模型在hub上发布,其API仅能回答模型当前的状态;而该数据集每天三次提供经过整理和丰富的内容快照,涵盖所有值得关注的信息:发布了什么模型、谁发布的、许可证类型、真实热度、分发格式、实际参数数量,以及哪些模型消失而无人宣布。

The Radar HuggingFace Dataset is an open, dynamic, and versioned dataset within the Hugging Face ecosystem. Thousands of models are published on the Hugging Face Hub every day, and its API can only return the current status of models; this dataset provides curated and enriched content snapshots three times per day, covering all noteworthy information: what models have been released, who released them, their license types, real-world popularity, distribution formats, actual parameter counts, and which models have vanished without prior announcement.

创建时间:
2026-08-19
原始信息汇总

Radar HuggingFace Dataset 数据集详情

数据集概述

Radar HuggingFace Dataset 是一个开放、实时更新且带版本管理的 HuggingFace 生态系统数据集,由 HF//RADAR 雷达系统生成,每天三次(06:00、14:00、22:00 西班牙时间)捕获 HuggingFace Hub 上值得关注的模型快照,并为每个模型生成西班牙语技术档案。该数据集并非 Hub 的简单镜像,而是经过筛选的策展层——仅收录具有已验证开放许可证且包含最低限度有用信息的模型。

核心目的

该数据集旨在回答 HuggingFace API 无法回答的历史与趋势性问题:

  • 发布内容与发布者:哪些组织主导 Hub,使用何种许可证、模型规模和格式(GGUF、MLX、safetensors 等)
  • 真实热度:按时间窗口统计下载量与点赞数,而非仅看有利于旧模型的累计值
  • 模型消亡记录:标记已从 Hub 移除的模型(removedremoved_at 字段),记录生态系统的"墓碑"
  • 生态演化追踪:每 12 小时更新并编号版本,形成无法事后从 API 重建的 OSS 生态系统时间序列

数据结构

数据按作者(组织或用户)分文件夹存储,每个模型包含两个文件:

data/ ├── qwen/ │ ├── qwen3.8-27b.json # 结构化元数据(遵循 SCHEMA.md v1) │ ├── qwen3.8-27b.md # 西班牙语技术档案 │ └── ... ├── meta-models/ │ ├── muse-glimmer-30b.json │ └── muse-glimmer-30b.md └── ...

  • 文件夹名为小写作者名,文件名为模型名,二者组合形成唯一 slug作者-模型名
  • 文件名冲突时(如大小写不同的重复上传),较新的模型添加 -2-3 后缀
  • 每个 .json 文件遵循 SCHEMA.md 版本 1,包含:许可证分类、真实参数数量、格式、基准测试、关键绩效指标、访问与移除标志
  • .md 文件是由雷达根据模型卡片和网络来源生成的西班牙语技术档案
  • 仓库根目录的 index.json 是轻量级清单,包含所有条目的关键字段,便于无需下载完整目录树即可浏览

更新机制

由雷达服务器上的 worker 每天三次执行更新流程:数据库导出 → 增量写入(仅重写变化内容)→ 结构化提交 → 推送。CI 验证每次推送,发布更新的批量数据并创建对应编号的 release。

  • 同一文件更新:模型 KPIs 变化时直接重写原文件,不新建文件
  • 历史保留:昨日数据保存在 git 提交历史中,以及编号的 release 快照(v1.0.0、v2.0.0 等)里
  • 已移除模型:不会删除文件,而是标记 removed: true 并注明移除日期;仅当模型从雷达数据库中删除时才移除文件

版本管理

每次含新数据的更新发布一个 release,版本号编码了时间段:

时段 版本递增 示例
06:00 早晨 major v3.0.0
14:00 下午 minor v3.1.0
22:00 夜晚 patch v3.1.1

例如 v14.2.1 表示数据集启动以来第 14 天的夜晚导出。Release 不可变,可固定版本以复现分析。格式变更会通过更新 schema 和 CHANGELOG.md 另行公告。

  • latest release(浮动):始终指向最新导出,其资源 URL 永久不变,适合持续消费
  • 结构化提交消息(如 data: +12 ~140 -1):标明每次更新的新增、修改和删除数量

使用示例

bash

获取单个模型元数据

curl -s https://raw.githubusercontent.com/686f6c61/radar-huggingface-dataset/main/data/qwen/qwen3.8-27b.json

python

使用 pandas 读取完整数据集(含档案)

import pandas as pd url = "https://github.com/686f6c61/radar-huggingface-dataset/releases/download/latest/models.jsonl.gz" df = pd.read_json(url, lines=True)

sql -- 使用 DuckDB 直接查询批量数据 SELECT author, COUNT(*) AS modelos FROM read_json(https://github.com/686f6c61/radar-huggingface-dataset/releases/download/latest/models.jsonl.gz, format=newline_delimited) GROUP BY author ORDER BY modelos DESC LIMIT 10;

许可证与声明

  • 许可证:CC-BY-4.0
  • 数据来源:HuggingFace Hub 元数据
  • 技术档案:由 HF//RADAR 生成
  • 使用要求:使用数据集时需链接到仓库或雷达站点
  • 免责声明:数据按"原样"提供;技术档案由 LLM 撰写,可能包含错误,在生产环境使用模型前请对照原始模型卡片核实
搜集汇总
数据集介绍
Radar HuggingFace Dataset 数据集图片
构建方式
在开源人工智能生态中,Hugging Face Hub每日发布海量模型,然而其官方API仅能反映模型当前的瞬时状态,难以支撑对生态演变的历史性洞察。Radar HuggingFace Dataset正是为解决这一局限性而生,它由HF//RADAR自动生成,是一个动态、版本化的数据集。该数据集每日三次定时采集,基于官方API与模型卡片,对每个值得关注的模型进行标准化元数据提取,并辅以由大语言模型生成的中文技术说明。其结构化存储采用按作者组织的目录,每个模型对应一个JSON元数据文件与一个Markdown说明文件,同时提供轻量级索引,便于全局检索。每次更新均通过Git提交与版本化Release实现差异记录,确保数据具备可追溯性。
特点
该数据集的核心特征在于其深度增值及时间维度的丰富性。它并非Hugging Face Hub的简单镜像,而是经过筛选的精选层,仅收录具有验证开放许可及具备基本元数据的模型。相较于单一时间快照,数据集捕捉了模型下载量、点赞数等指标的30日窗口动态趋势,从而能够真实反映模型的短期热度,避免历史积分类指标带来的偏差。尤为关键的是,它系统地追踪被下架或隐藏的模型,将这些生态内部的'数字墓碑'纳入记录,为研究开源模型的生命周期提供了独一无二的视角。此外,每个模型配备的中文技术卡片,有效弥补了原平台英文文档质量不均的不足,极大地降低了中文用户的使用门槛。
使用方法
数据集设计支持多种便捷的获取途径。对单个模型的快速查询,可直接通过curl命令访问对应的JSON文件获取元数据。对于大规模分析,用户可以通过加载位于'latest' Release下的完整JSONL文件,诸如使用Pandas库仅需一行代码即可将整个数据集读入数据框。同时,数据集也兼容DuckDB等现代化数据分析工具,支持从远程URL直接进行SQL查询,无需本地下载。版本化策略清晰,通过对Release版本号的解读,用户可以定位到特定日期和时段的快照,并能固定版本以复现实验。数据集的Git提交历史提供了细粒度的变化审计,而结构化提交信息则总结了每轮采集的数据变更状况。
背景与挑战
背景概述
Radar HuggingFace Dataset 是由 HF//RADAR 项目于近期创建的一个开放、活态且版本化的数据集,专注于捕捉 HuggingFace 生态系统的动态变化。该数据集由开发者 686f6c61 及其团队维护,旨在解决 HuggingFace 每日发布海量模型但 API 仅能反映当前状态的问题。通过每 12 小时自动采集数据,它提供了模型元数据、技术说明以及趋势分析,涵盖了发布者、许可证、下载量等关键信息。其核心研究问题在于追踪模型的真实影响力与生命周期,包括新增、消失及演进趋势。该数据集以其高频更新、版本化快照和西班牙语技术文档著称,为研究开源模型生态提供了宝贵的时间序列数据,对模型治理、趋势分析和可复现研究具有重要影响力。
当前挑战
在领域问题层面,该数据集面临 HuggingFace 生态动态监测的挑战:模型数量庞大且更新迅速,API 不提供历史数据,导致无法回溯模型的状态变化;同时,模型卡信息质量参差不齐,许可证分类和参数统计需人工核实,增加了数据清洗的难度。在构建过程中,挑战包括:确保每日三次采集的稳定性和数据一致性,处理模型重名冲突及大小写变体,维护增量写入与 git 历史的可读性,以及为每个模型生成准确的多语言技术文档,这需依赖 LLM 且需人工校对。此外,数据集的持续更新和版本管理需自动化流程,而社区贡献和标注质量的控制也是一大难点。
常用场景
经典使用场景
Radar HuggingFace Dataset作为开放生态的活体镜像,其核心应用场景在于构建对HuggingFace模型枢纽的动态监测与历史回溯体系。研究者可借助每日三次的高频快照,系统追踪模型发布、组织活跃度、许可协议分布及格式演进规律,将碎片化的实时API响应转化为可审计的时序数据流,为开源模型生态的量化分析提供坚实基础。
衍生相关工作
该数据集的衍生工作已催生多个前沿方向:以时序快照为基础的生态退化分析,追踪模型消亡速率与替代规律;基于趋势评分构建传播动力学模型,揭示开源模型的采纳周期;结合多语言档案的跨语种文档质量评估,推动技术传播公平性研究。此外,其结构化模式为构建模型知识图谱和自动化合规检查工具提供了范本,激发了社区对模型元数据标准的深度探索。
数据集最近研究
最新研究方向
在人工智能模型快速迭代的背景下,Radar HuggingFace Dataset为开源生态研究提供了前所未有的动态观测视角。该数据集每12小时对HuggingFace平台进行三次快照,不仅捕获模型发布、许可变更、格式分布与参数规模等静态元数据,更通过时间序列记录模型生命周期中的热度演化与消失现象。研究者可借此剖析组织发布策略、追踪开源许可趋势、量化模型影响力,并识别生态中的异常事件。其版本化设计与不可变快照支持可复现的纵向研究,为探讨AI模型的可追溯性、透明度及社区动力学提供了宝贵的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务