遇见数据集

Open Source AI Stack Gap Map Data

收藏
github2026-07-04 更新2026-07-06 收录
官方服务:

资源简介:

该数据集是开源AI堆栈差距地图背后的精选数据和模型,包含15个类别、249个组织和458个产品的信息,每个产品在开放性、采用度和能力三个维度上进行评分,数据以YAML格式存储在`sources/`目录中,并通过自动化管道验证和序列化。

This dataset comprises curated data and models underlying the Open-Source AI Stack Gap Map. It contains information on 15 categories, 249 organizations, and 458 products, with each product scored across three dimensions: openness, adoption, and capability. The data is stored in YAML format under the `sources/` directory, and validated and serialized via automated pipelines.

创建时间:
2026-06-09
原始信息汇总

数据集概述:Open Source AI Stack Gap Map

该数据集为开源人工智能(AI)技术栈的缺口地图(Open Source AI Stack Gap Map)提供底层数据与评分机制,旨在让社区清晰了解AI技术栈的组成、各环节的开放程度、使用广度及现存缺口,从而指导建设、投资与开源化方向。

核心数据规模

  • 类别 (Categories):15 个
  • 组织 (Organizations):249 个
  • 产品 (Products):458 个

数据结构与文件组织

所有核心数据以 YAML 格式 存储在 sources/ 目录下,具体包含以下子目录与关键文件:

路径 内容说明 关键规则
sources/organizations/ 组织元数据及其 products: 清单 每个产品标识符仅出现在一个组织清单中
sources/categories/ 类别定义(权重、副标题等)及有序的 products: 清单 显示顺序由清单决定;每个产品仅隶属于一个类别
sources/products/ 产品记录(名称、类型、描述、类型化资源链接) 组织归属信息写在组织文件中,不在此处
sources/scores/ 每个产品的 opennessadoptioncapability 评分 任何非空评分值必须附带 sources: 引用来源
sources/taxonomy.yaml 弧线分组与显示顺序;三个弧线对应Columbia本体层 每个类别仅出现在一个弧线中
  • 类别标识符使用下划线格式(如 base_pretrained);产品和组织标识符使用连字符格式(如 llama-3-1allen-ai)。
  • 产品资源键类型包括:githubnpmpypicratesgohuggingface_modelhuggingface_dataset
  • 所有文件类型的 JSON Schema 位于 docs/schemas/

评分机制

每个产品在三个独立、多源的维度上进行评分:

  • 开放性 (Openness):0–5 分,依据开放框架(模型采用 Model Openness Framework,软件采用 OSI 许可证分类)。
  • 采纳度 (Adoption):基于实际使用数据(下载量、活跃用户、部署量),而非 GitHub Stars。
  • 能力度 (Capability):优先使用社区基准评估,若无基准则使用功能覆盖情况。

类别则根据其下属产品汇总得出成熟度 阶段 (Stage)(0 级 Void 至 5 级 Mature)以及一份 缺口 (Gaps) 清单,指明开放生态中仍缺乏的部分。

分类法与开放性框架源自 2024 Columbia Convening on Openness in AI。完整的计算方法(阶段与缺口公式、各维度数据源、已知局限性)见 docs/methodology.md,该文件是权威来源,最终结论亦呈现在官方网站上

仓库布局

  • sources/:需要手动维护的 YAML 数据文件(组织、类别、产品、评分 + taxonomy.yaml)。
  • build/:确定性的验证→序列化→渲染管道。
  • notebooks/:自动生成的 ai-stack-map.py 及其它独立配套笔记本。
  • docs/:JSON Schemas、贡献指南、方法论和维护手册。
  • warehouse/:UDM SQL 和用于获取采纳/活动信号的抓取器。
  • skills/:与贡献指南相对应的智能体技能。
  • tests/:用于构建辅助工具的 pytest 测试套件。

如何贡献

社区可通过两种方式参与:

  1. 提交 Issue(无需代码):可通过以下模板提交建议:

  2. 提交 Pull Request:直接编辑 sources/ 目录下的文件。添加产品需要创建产品记录、评分(附引用来源)以及分别在类别和组织清单中注册。详细步骤见 CONTRIBUTING.md

基本规则:

  • 每个评分必须引用一手来源。
  • 不要手动编辑生成文件:build/notebook_data.jsonnotebooks/ai-stack-map.py 由机器人自动生成。
  • 每次 PR 都会触发 CI 验证(包括 build.validatepytest)。

本地运行

需 Python 3.12+ 及 uv。无需 API 密钥即可编辑源文件或进行验证:

bash uv sync uv run python -m build.validate # 进行架构与跨文件检查;必须输出 "0 error(s)" uv run pytest -q # 可选;与 CI 运行相同的测试套件

如需预览生成的地图(仅供预览,不要提交):

bash uv run python -m build.serialize # sources/ → build/notebook_data.json uv run python build/render.py # → notebooks/ai-stack-map.py uv run marimo export html notebooks/ai-stack-map.py -o /tmp/preview.html

使用仓库查询(pyoso)需要 OSO_API_KEY 环境变量。

搜集汇总
数据集介绍
Open Source AI Stack Gap Map Data 数据集图片
构建方式
该数据集的构建依托于社区协作的迭代式策展流程,所有原始信息均以YAML格式文件存放于sources/目录下,涵盖组织、产品、类别及评分四大模块。每条产品记录均附带跨多源验证的开放性、采纳度与能力评分,且每项评分必须引用一手来源。系统通过确定性验证流水线对YAML文件进行校验,并将其序列化为JSON格式供可视化地图渲染使用。数据集采用三元组架构(三大技术栈弧区),每一类别通过YAML清单与产品列表紧密绑定,确保层次结构的清晰与可维护性。
特点
该数据集的核心特色在于其多维度的开放性评估体系,并非简单二元判断,而是借鉴Model Openness Framework与OSI许可证分类,对模型与软件分别赋予0至5的等级评分。采纳度指标依托实际使用数据(如下载量、活跃用户数),避免依赖GitHub星标等表层指标。能力评估则依据社区基准测试与功能覆盖度。此外,数据集通过类别成熟度阶段与缺口分析,清晰标识开源生态中的空白领域,使整个开源AI技术栈的碎片化状态变得可读、可量化。
使用方法
用户可通过多种方式参与数据集的使用与完善:直接编辑sources/目录下的YAML文件以新增或修正产品信息,系统会在每次PR提交时自动运行验证与测试流程。本地运行需Python 3.12+与uv工具,执行uv sync初始化环境后,可通过validate与pytest命令检查数据完整性。如需预览生成的可视化地图,运行serialize与render脚本即可导出HTML文件。仓库中附有完整的贡献指南、评分方法论文档及JSON Schema,方便新参与者快速上手并遵循规范提交变更。
背景与挑战
背景概述
开源人工智能生态系统正经历着前所未有的繁荣,但其碎片化、重复开发与整体可视性匮乏的问题日益凸显。为应对这一困境,CurrentAI组织于近期发布了Open Source AI Stack Gap Map Data数据集,由该机构主导构建,旨在通过系统化的数据收录与评估框架,绘制一幅覆盖从基础设施到应用层的开源AI技术栈全景图。该数据集不仅收录了249个组织与458款产品,更开创性地设计了开放性、采纳度与能力三个独立维度的评分体系,并引用了哥伦比亚大学2024年关于AI开放性的研讨成果作为分类基准。其核心研究问题在于:如何量化评估开源AI各组件的成熟度与差距,从而引导社区资源投向最薄弱的环节。这一数据集为学术界与产业界提供了一个动态的、可验证的生态观察窗口,显著提升了开源AI生态系统的透明度和决策效率。
当前挑战
该数据集面临的挑战多维且深刻。在领域问题上,开源AI生态的开放性定义本身存在分歧,特别是开源权重与真正开源模型之间的界限模糊,使得基于Model Openness Framework等框架的评分难以达成普遍共识;同时,能力评估高度依赖社区基准测试的覆盖度,许多新兴或垂直领域缺乏标准化评测,导致评分体系存在内在的不完整性。在构建过程中,数据集采用众包策展模式,虽能汇聚群体智慧,但也引入了质量控制难题——每项评分都要求提供可验证的原始来源,这对贡献者的专业知识提出了极高要求;此外,YAML文件的跨文件一致性校验(如产品、组织与类别间的多重引用)易因人为疏忽产生断裂,需依赖自动化流水线进行严格校验。维持数据集的时效性亦是一大挑战,AI技术迭代迅猛,新工具与版本更新频繁,如何确保持续且低延迟的内容更新,避免地图迅速过时,是项目长期运行的关键瓶颈。
常用场景
经典使用场景
该数据集作为开源人工智能技术栈的生态图谱数据,经典使用场景是用于系统性地映射与量化AI开源生态的全景结构。研究者可借助其中包含的15个技术类别、249家组织与458款产品的结构化信息,对模型、工具链、平台等不同层次的开源程度、采纳水平与能力成熟度进行多维分析。数据集同时记录了每个产品的开放性评分及其引用来源,支持对开源基础设施空白区域的精确识别,为社区决策提供数据驱动的可视化参考。
衍生相关工作
该数据集催生了多项衍生性经典工作,包括基于其评分体系开展的AI开源组件采纳趋势分析、长期尾部分布探索以及地理维度的PyPI软件包使用模式研究。社区贡献机制和持续整合管道的设计,使得数据集的维护模式本身成为可复用的研究基础设施。相关方法论文档和评分指南已被后续生态测量项目广泛引用,形成了从单一图谱到系统性监测工具链的知识衍生脉络,进一步拓展了对AI开源生态系统动态演化的理解。
数据集最近研究
最新研究方向
在人工智能开源生态日益蓬勃却碎片化、重复性突出的背景下,Open Source AI Stack Gap Map Data数据集应运而生。它通过结构化 YAML 文件系统,细致收录了横跨15个类别、249个组织及458款产品的开源AI堆栈数据,并利用开放性、采用率与能力三维独立评分机制对每个产品进行量级评估。该数据集的前沿研究方向聚焦于借助社区驱动、持续迭代的众包方式,精准识别开源AI堆栈中的空白领域与发展瓶颈,从而引导开发者与投资者填补关键缺失。其研究成果不仅映射了2024年哥伦比亚大学开放AI会议提出的开放性框架,更在业界耦合了开放权重与开源区别的热点议题,推动AI生态向更透明、更健康的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务