遇见数据集

awesome-oss-research-data

收藏
github2026-04-30 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精心策划的列表,收录了开源软件开发领域的相关数据集、数据源和实证研究资源。它涵盖了开发活动、依赖网络、包下载统计、安全、社区健康、社区讨论、估值、资金、调查、源代码分析、悬赏平台、公共政策和通用网络档案等多个主题领域,旨在为研究人员提供公开可访问的数据和指标来源。

This is a curated list of datasets, data sources, and empirical research resources related to the field of open-source software development. It covers multiple thematic areas including development activities, dependency networks, package download statistics, security, community health, community discussions, valuation, funding, surveys, source code analysis, bounty platforms, public policy, and general web archives. It aims to provide researchers with publicly accessible data and metric sources.

创建时间:
2023-01-13
原始信息汇总

数据集概述

该页面是一个精心整理的开源软件(OSS)研究数据集与资源列表,专注于提供与开源软件开发相关的公开可获取的数据源、研究论文和工具。其核心优先收录原始数据可公开访问的资源,或基于公开来源推导的指标,同时涵盖仅提供高层洞察的数据源。

内容结构

页面内容按主题分为多个板块,每个板块下又细分为“数据集”和/或“研究”子类:

1. 开发活动

  • 数据集:
    • GHTorrent: GitHub REST API 历史数据的离线镜像。
    • GH Archive: 记录 GitHub 的公开活动时间线。
    • Ecosyste.ms: 支撑、维护和保护关键数字基础设施的工具和开放数据集。
    • GitHub 创新图谱: GitHub 全球活动随时间变化的高层洞察。
    • Census II & III: Linux 基金会关于 OSS 库生产使用情况的调查报告及数据。
    • OSSRank: 提供顶级项目、项目类型和贡献者映射的排名。
    • 开源贡献者指数 (OSCI): 衡量私营组织的活跃及总 GitHub 贡献者。
  • 研究: 涵盖一般贡献模式、企业驱动贡献、贡献者体验、项目特征等主题的学术论文及关联数据。

2. 依赖网络

  • ecosyste.ms: 开源依赖元数据解析与依赖树解析的 API 服务。
  • Libraries.io: 跨生态系统的软件包依赖关系时间序列数据。
  • Open Source Insights / deps.dev: Google 项目,构建跨生态系统的软件依赖图,包含版本和漏洞信息。
  • Repology: 监控多个生态系统仓库的软件包版本信息。
  • 软件生态系统分析数据 (DaSEA): 持续更新的软件依赖数据集。

3. 包下载统计

  • 列出了 PyPI、CRAN、RubyGems、Julia、npm、NuGet、PECL/Pear、crates.io、Clojars 等主要语言包管理器的下载统计数据获取方式。

4. 安全

  • CVE 项目: 通用漏洞披露项目,支持批量下载。
  • NIST 国家漏洞数据库 (NVD): 通用漏洞披露数据库。
  • CISA 已知被利用漏洞目录: 已知在野被利用的漏洞数据库。
  • GitHub 咨询数据库: 影响 GitHub 包的 CVE 和安全问题数据库。
  • 开源漏洞 (OSV) 数据库: 跨生态系统的漏洞数据库,包含 GitHub 咨询数据库。
  • CVEfixes 数据集: 自动收集的开源软件漏洞及其修复的数据集。
  • GitHub 问题数据集: 来自顶级语言顶级仓库的 GitHub 问题数据集。

5. 社区与项目健康

  • 数据集:
    • CHAOSS: Linux 基金会项目,定义 OSS 社区健康指标。
    • OpenSSF 最佳实践徽章项目: 项目列表及统计。
    • OpenSSF 关键性评分: 量化开源项目关键性的算法和数据。
  • 工具: isitmaintained.com, GitWhois 提供 GitHub 仓库的快速状态检查。
  • 研究: 关于开源社区健康分析指标及其对应叙述的学术论文。

6. 社区讨论

  • StackExchange: 公开的问答数据。
  • Linux 内核邮件列表 (LKML): Linux 内核邮件列表。
  • Apache / GNU / Python 邮件档案: 各个项目的邮件列表存档。
  • The Mail Archive & MARC: 公共邮件列表编目工具。

7. 估值

  • 收录了多篇关于开源软件对经济、创新、创业及商业价值影响的研究论文及其数据集(如 BEA 报告、哈佛商学院工作论文)。

8. 资助

  • 数据集:
    • GitHub Sponsors: 用户依赖项目列表导出。
    • jonathimer/awesome-oss-investors: 投资商业开源初创公司的风投列表。
    • Kivach, Ko-fi, Liberapay, Open Collective: 不同的捐赠与资助平台。
    • oss.fund: OSS 资助机会聚合器。
    • StackAid: 在项目依赖间平均分配捐赠。
    • Secure Open Source Rewards (sos.dev): 安全奖励计划。
    • ralphtheninja/open-funding: OSS 资助选项指南。
  • 研究: 关于开源软件资助模式、初创公司参与开源社区与融资关系的研究。

9. 调查

  • 汇集了来自 Linux 基金会、GitHub、Stack Overflow、GitLab、Tidelift、SlashData、O‘Reilly、FINOS、TODO Group 等机构的多项年度或特定主题调查,多数提供公开的高层洞察或匿名数据,时间跨度从 2003 年到 2024 年。

10. 其他资源

  • 该页面在开头提及另一个相关资源列表 dspinellis/awesome-msr,专注于实证软件工程/挖掘软件仓库的数据集。
搜集汇总
数据集介绍
awesome-oss-research-data 数据集图片
构建方式
该数据集以策展清单的形式构建,系统性地收录了与开源软件开发相关的数据集、数据源及实证研究成果。其筛选标准优先考虑原始数据公开可访问的来源,或基于公开数据衍生出的度量指标,同时也纳入了仅提供高层级见解的数据源。清单内容涵盖开发活动、依赖网络、包下载统计、安全、社区健康、估值、资助、调查等多个主题领域,每个条目均附有来源链接与简要描述,并整合了相关研究文献的引用信息。
使用方法
使用者可通过GitHub仓库直接访问该清单,按主题分类浏览所需的数据源或研究。每个条目均提供了外部链接或DOI标识,便于直接获取原始数据或报告。对于开发活动数据,可调用GitHub REST/GraphQL API或下载GHTorrent镜像;对于依赖分析,可利用ecosyste.ms API或Libraries.io数据集;安全数据则可通过CVE、OSV等数据库批量获取。研究者也可参考清单中的学术文献,获取可复用的数据集与代码。
背景与挑战
背景概述
开源软件(OSS)已成为现代数字基础设施的基石,其开发活动、依赖网络及社区健康等维度蕴含着丰富的研究价值。在此背景下,由学者与从业者共同维护的awesome-oss-research-data数据集应运而生,其GitHub仓库自创建以来持续收录与开源软件开发相关的实证研究资源。该数据集聚焦于原始数据可公开获取或指标源自公开渠道的来源,覆盖开发活动、安全漏洞、社区治理及经济估值等十余个主题,为计量软件工程、挖掘软件仓库及开源经济学等领域提供了系统化的数据索引。其核心研究问题在于如何通过整合异构数据源,揭示开源生态的演化规律、协作模式与风险特征,对理解开源软件的社会与技术影响力具有重要支撑作用。
当前挑战
该数据集面临的核心挑战在于开源生态的复杂性与动态性。首先,领域问题层面,如何从海量异构数据中提取可泛化的模式以表征开源软件的健康度与可持续性,例如开发活动数据(如GHTorrent)与安全漏洞库(如NVD)的关联分析,需应对数据稀疏性与噪声干扰。其次,构建过程中,数据源的异质性导致整合困难,例如不同包管理器(如PyPI与CRAN)的下载统计口径差异,以及依赖网络数据(如Libraries.io)的版本追溯偏差。此外,社区话语数据(如StackExchange)的语义解析与伦理合规性,以及资助与估值研究(如GitHub Sponsors)的隐私保护,均对数据集的时效性与代表性构成持续考验。
常用场景
经典使用场景
在开源软件生态系统的实证研究中,该数据集目录被广泛用于挖掘开发活动模式、依赖网络结构及社区健康状态。研究者常借助GHTorrent和GH Archive等数据源追溯GitHub历史活动,分析贡献者行为、项目演进轨迹与协作效率;同时,利用Libraries.io和Ecosyste.ms解析跨生态系统的依赖关系,揭示软件供应链中的耦合特征与潜在风险。这些场景为理解开源社区的动态演化提供了基础性数据支撑。
解决学术问题
该数据集目录解决了开源软件研究中的关键数据可获取性问题,使学者能够量化评估开发生产力、企业贡献影响及项目治理效能。例如,通过CHAOSS社区健康指标和OpenSSF关键性评分,研究者得以系统度量开源项目的可持续性与安全性;利用Census系列调查数据,可揭示库级应用依赖的分布特征。这些工作推动了软件工程领域从定性描述向数据驱动分析的范式转变,为制定开源治理策略提供了实证依据。
实际应用
在实际应用中,该数据集目录被企业、基金会和政策制定者用于优化开源战略与风险管理。企业通过OSSRank和Open Source Contributor Index评估技术选型与人才布局;安全团队借助CVE、NVD及OSV数据库构建漏洞监测体系,提升供应链韧性。此外,GitHub Innovation Graph和Linux Foundation报告为政府评估开源经济价值提供数据参考,助力制定促进数字公共产品发展的产业政策。
数据集最近研究
最新研究方向
在开源软件生态的蓬勃发展下,该数据集聚焦于开源软件领域的实证研究前沿,尤其关注开发活动模式、依赖网络分析、安全漏洞追踪以及社区健康评估等方向。当前研究热点紧密关联着开源供应链安全事件(如Log4j漏洞)与全球开发者协作格局的演变,例如通过GHTorrent和GH Archive等数据源,研究者得以量化分析企业驱动的贡献行为、地理分布对协作效率的影响,以及软件包依赖网络中的风险传播路径。这些研究不仅深化了对开源社区可持续性的理解,还为政策制定者和企业提供了评估开源软件经济价值与安全韧性的实证基础,推动了从单一代码质量向生态级治理的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务