遇见数据集

Iris4ai/open_model_evolution_data

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集随论文《开放智能经济:追踪模型生态系统中的权力与参与》发布,对开放模型经济中的集中动态和演变特征进行了严格检查。它汇编了从2025年2月至今的每周模型下载历史,以及来自Hugging Face Model Hub的详细模型元数据,涵盖851,000个模型、每个模型超过200个聚合属性、22亿次下载。数据来源于每周快照和每日更新的另一个数据集,其中all_downloads_with_annotations.parquet包含所有下载,one_year_rolling.parquet仅统计模型创建后一年内的下载。研究人员可利用此数据集分析开放权重AI中经济权力的根本性重新平衡、模型属性(如平均模型大小增加、多模态生成、量化和专家混合架构的增长)的统计显著变化,以及数据透明度趋势和开发者中介的出现。项目还包括一个交互式仪表板,用于实时监控这些动态。

This dataset, released in conjunction with the paper Economies of Open Intelligence: Tracing Power & Participation in the Model Ecosystem, provides a rigorous examination of concentration dynamics and evolving characteristics in the open model economy. It compiles a history of weekly model downloads (February 2025-Present) alongside detailed model metadata from the Hugging Face Model Hub. The dataset encompasses 851,000 models, over 200 aggregated attributes per model, and 2.2 billion downloads. The data is compiled from weekly snapshots and updated daily from another dataset. all_downloads_with_annotations.parquet contains all downloads and one_year_rolling.parquet counts only downloads up to one year from model creation. Researchers can leverage this dataset to analyze the fundamental rebalancing of economic power in open-weight AI, statistically significant shifts in model properties (such as increases in average model size, growth in multimodal generation, quantization, and mixture-of-experts architectures), and trends in data transparency and the emergence of developer intermediaries. The project also features an interactive dashboard for real-time monitoring of these dynamics.

提供机构:
Iris4ai
搜集汇总
数据集介绍
Iris4ai/open_model_evolution_data 数据集图片
构建方式
该数据集依托于Hugging Face Model Hub的海量生态数据,通过系统性地汇编自2025年2月至今的每周模型下载历史记录,并整合详尽的模型元数据构建而成。数据来源包括官方每周快照和实时更新的数据仓库,涵盖了85.1万个模型、超过200项聚合属性以及22亿次下载量。数据集以两种形式呈现:`all_downloads_with_annotations.parquet`包含全部下载记录,而`one_year_rolling.parquet`则仅统计模型创建后一年内的下载行为,从而为分析开放权重AI领域的动态演变提供了结构化、可追溯的基础。
使用方法
研究者可直接利用该数据集开展多维度的量化分析,例如通过下载量时间序列评估模型的经济影响力变迁,或基于元数据属性探究模型架构与功能的演化规律。数据以Parquet格式存储,便于通过Python的Pandas、Dask或PySpark等工具进行高效加载与处理。建议结合项目提供的交互式仪表盘进行探索性分析,或针对`one_year_rolling`子集进行生命周期相关的纵向研究,以揭示开放模型生态中创新采纳与资源分配的动态机制。
背景与挑战
背景概述
随着开放权重人工智能的蓬勃发展,模型生态系统的经济动态与权力结构成为研究焦点。2025年2月,由Hugging Face社区与学术研究者联合发布的open_model_evolution_data数据集,依托论文《开放智能经济学:模型生态系统中的权力与参与追踪》,系统解析了开放模型经济中的集中化趋势与演化特征。该数据集囊括85.1万个模型、超过200项聚合属性及22亿次下载记录,为探究开源AI经济权力的再平衡提供了量化基础。其涵盖每周模型下载历史(自2025年2月起)与详细元数据,显著推动了模型规模增长、多模态生成、量化及混合专家架构等结构性变迁的研究,并对人工智能经济学、伦理及数据透明度领域产生了深远影响。
当前挑战
该数据集应对的核心领域挑战在于量化开放模型生态系统中经济权力的集中程度与参与模式,具体包括:1)揭示头部模型对下载量的绝对垄断与小型模型的边缘化现象,以及其如何重塑开源AI的经济格局;2)分析模型属性(如平均规模扩大、多模态生成普及)的统计显著性变化,以及这些变化对计算资源分配和开发者策略的影响。在构建过程中,挑战集中于:1)需整合来自不同快照源的异构数据(周快照与日更新数据),确保时空一致性;2)平衡数据聚合的粒度与隐私保护,避免因过度细化而泄露模型开发者的敏感信息;3)处理元数据标注的缺失与不一致性,例如某些模型未标明架构或许可证类型,需通过推断与清洗策略补充,以维持分析的鲁棒性。
常用场景
经典使用场景
在开放智能经济的研究领域中,open_model_evolution_data数据集为剖析开源模型生态系统的演进规律提供了不可多得的数据基石。研究者可借助该数据集追踪每周模型下载量的动态变化,并结合超过85万模型的丰富元数据,系统性地考察模型规模、多模态生成能力、量化技术以及混合专家架构等属性的统计显著性变化。该数据集的使用尤其适合那些旨在揭示开源AI领域权力重构与参与模式变迁的学术探索。
解决学术问题
该数据集的核心价值在于解决了开放模型经济中权力集中与参与模式演变这一关键学术问题。通过涵盖2.2亿次下载量的详尽记录,研究者得以实证检验开源AI领域经济权力的重新分配趋势,并量化分析模型属性随时间推移的根本性转变。其意义在于为理解开源生态系统的动态平衡提供严谨的数据支撑,推动了关于数据透明度、开发者中介角色涌现等前沿议题的学术讨论,对AI伦理与经济学交叉研究产生了深远影响。
实际应用
在实际应用层面,open_model_evolution_data数据集为AI生态系统中的多方参与者提供了决策支持。开发者可以依据模型下载趋势与属性演化数据,优化自身模型的设计策略与发布时机;平台运营者能够基于集中度分析,调整资源分配以促进生态健康;政策制定者则可利用其揭示的权力再平衡证据,制定更加合理的开源AI监管框架。此外,该数据集配套的交互式仪表盘实现了对市场动态的实时监测,降低了数据驱动的行业洞察门槛。
数据集最近研究
最新研究方向
本研究聚焦于开放权重人工智能生态系统中经济权力的再平衡与结构性演变趋势。借助涵盖85.1万个模型、超过200项属性及22亿次下载量的庞大数据集,研究者得以深入剖析模型规模的持续增长、多模态生成能力的扩张、量化技术与混合专家架构的兴起等关键特征。该数据集不仅揭示了数据透明度与开发者中介角色等新兴现象,更通过实时监测仪表盘为学术界与产业界提供了动态追踪开放模型经济权力的工具,对理解AI领域的权力集中与分散机制具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务