遇见数据集

Powerset Research Data

收藏
github2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

这是一个公共数据集,包含约40万个活跃的GitHub仓库,由Powerset维护。数据集涵盖仓库、贡献者、活动、星标、语言、类别、README摘要、嵌入和项目元数据,无需凭证即可访问。可用于识别顶级开源开发者、分析快速增长的仓库和理解技术趋势。

This is a public dataset containing approximately 400,000 active GitHub repositories maintained by Powerset. The dataset covers repositories, contributors, activities, stars, programming languages, categories, README summaries, embeddings and project metadata, and is accessible without credentials. It can be used to identify top open-source developers, analyze rapidly growing repositories and understand technical trends.

创建时间:
2026-05-18
原始信息汇总

数据集概述

本数据集由 Powerset 维护,包含约 40万个活跃的GitHub公开仓库的公共数据。数据用于识别顶级开源开发者、分析快速增长仓库以及理解技术趋势,对AI代理和SQL工作流免费可用。

数据内容

数据集包括仓库、贡献者、活动、星标、语言、类别、README摘要、嵌入向量和项目元数据等字段。无需凭证即可访问。

访问方式

提供两种主要访问方式:

  1. MCP服务器:通过 https://research-mcp.powerset.dev/mcp/ 连接支持MCP协议的客户端(如Claude、Codex、Cursor)进行对话式查询。无需身份验证。也可作为 ChatGPT应用 使用。
  2. DuckDB + Agent技能:直接连接到托管的DuckLake目录(路径:ducklake:https://research-data.powerset.dev/github-public/latest/public.ducklake),运行SQL查询。可选配包含模式上下文、查询模式和示例的技能文件(路径:powerset-research-data/SKILL.md)。

数据表结构

数据目录名为 github。主模式表通过 github.<表名> 引用,分析表通过 github.analytics.<表名> 引用。

主模式表

表名 描述 关键列
repos 至少10个星标的活跃仓库,使用 stars_count 获取当前星标总数。 repo_node_id, name_with_owner, stars_count, fork_count, pushed_at, created_at
repo_metadata 仓库元数据:描述、主题、语言、许可证、所有者类型、观察者、开放问题数量、功能标志。 repo_node_id, description, topics, language, license_key, owner_type, watchers_count, open_issues_count
repo_scores Powerset计算的排名分数和分组。 repo_node_id, name_with_owner, score_overall, cohort_group, star_cohort
repo_categories 每个仓库的顶级类别分配。 repo_node_id, top_category_id, top_category, similarity
repo_category_similarities 仓库与类别的相似度分数。 repo_node_id, category_id, similarity
repo_contributors 每个仓库的贡献者信息和贡献数量。 repo_node_id, user_id, login, contributions, type
repo_readme_summaries 仓库README内容的纯文本摘要。 repo_node_id, name_with_owner, summary, content_hash, generated_at, tier
repo_readme_summary_embeddings README摘要嵌入向量(FLOAT[]),用于语义相似度搜索。 repo_node_id, content_hash, embedding, _generated_at
github_users 数据集中用户的公开GitHub个人资料字段。 user_id, login, name, company, location, bio, followers_count
repo_pulls 大约过去两年的Pull Request元数据(不含正文)。 repo_node_id, pull_number, title, state, user_id, user_login, created_at, merged_at
repo_issues 大约过去两年的Issue元数据(不含正文),包含PR,使用 is_pull_request 过滤。 repo_node_id, issue_number, title, state, user_id, user_login, created_at, is_pull_request
repo_stars_daily 每个仓库的每日星标计数。 repo_node_id, starred_date, stars_delta

分析模式表

表名 描述 关键列
analytics.category_stats 类别级别的聚合统计和示例。 top_category_id, top_category, repo_count, total_stars, stars_90d, activity_90d
analytics.language_category_stats 每种主要语言内类别级别的聚合统计。 language, top_category_id, top_category, repo_count, total_stars, stars_90d
analytics.repo_activity_monthly 每月每仓库的星标、问题、PR和提交活动计数。 repo_node_id, month, stars, issues_opened, prs_opened, prs_merged, commits
analytics.repo_activity_summary 滚动每仓库活动计数和最后活动时间戳。 repo_node_id, stars_30d, stars_90d, prs_merged_90d, commits_90d, last_activity_at
analytics.repo_profile 分析就绪的仓库档案,包含元数据、类别、分数和README摘要。 repo_node_id, name_with_owner, name_with_owner_lower, stars_count, score_overall
analytics.repo_profile_with_activity analytics.repo_profile 与滚动活动摘要字段的连接。 repo_node_id, name_with_owner, score_overall, stars_90d, activity_90d
analytics.repo_readme_similar_repos 每个仓库前100个README摘要最近邻。 source_repo_node_id, similar_repo_node_id, rank, similarity
analytics.repo_top_contributors 每个仓库的顶级贡献者档案和贡献计数。 repo_node_id, user_id, login, contributions, contributor_rank, followers_count
analytics.repo_topic_index 每个仓库主题一行,用于主题搜索、过滤和分面。 topic, repo_node_id, name_with_owner, stars_count, score_overall, top_category

数据覆盖范围与限制

  • 仓库范围:至少10个GitHub星标且在过去90天内有过推送的活跃公开仓库。
  • Pull Requests:仅包含过去大约2年内创建的PR。更早的PR不包含在内。
  • Issues:仅包含过去大约2年内创建的Issue。更早的Issue不包含在内。Issue数据包含PR和Issue,需使用 is_pull_request 列区分。
  • 星标历史:GitHub Stargazers API 每个仓库最多返回约40,000个星标事件。对于超过40k星标的仓库,repo_stars_daily 历史不完整,SUM(stars_delta) 会低估真实总数。应使用 repos.stars_count 获取准确的当前星标数。
  • 快照:数据以不可变的时间戳快照形式发布。latest/ 指针在新快照发布时更新。快照并非实时,GitHub活动与数据可用性之间存在延迟。
搜集汇总
数据集介绍
Powerset Research Data 数据集图片
构建方式
Powerset Research Data 数据集由 Powerset 团队构建,聚焦于 GitHub 生态中活跃且具备影响力的开源项目。数据采集范围涵盖大约 40 万个活跃的 GitHub 仓库,筛选标准为星标数不低于 10 且在过去 90 天内有推送活动的公开仓库。数据集以不可变快照形式发布,通过将 Parquet 文件存储在 Cloudflare R2 上并形成冻结的 DuckLake 目录,实现高效的数据共享与查询。快照定期更新,并维护一个指向最新版本的 'latest/' 指针,确保用户总能获取到相对较新的数据。
特点
该数据集具备多维度的丰富性与实用性。其内容不仅涵盖仓库的基础元数据(如星标数、语言、许可证、主题标签),还包含由 Powerset 计算得出的排名得分、类别归属、贡献者信息、README 摘要及其向量嵌入。尤为独特的是,数据集预先计算了仓库间的 README 摘要相似度矩阵,支持快速的语义近邻检索。分析模式中提供了按语言、类别聚合的统计视图以及月度活动数据,极大便利了技术趋势洞察与开发者发现等研究工作。
使用方法
使用者拥有两种灵活的接入方式。其一为通过 MCP 服务器连接,支持 Claude、Codex、Cursor 等 MCP 兼容客户端以对话形式进行自然语言查询,无需任何认证。其二为直接使用 DuckDB 进行 SQL 分析,用户只需执行一条 ATTACH 语句即可将远程的冻结 DuckLake 目录挂载为本地数据库,随后便可通过标准 SQL 对 github 目录下的数十张表进行灵活查询。数据集同样配备技能文件,可为 AI 代理提供模式上下文与查询示例,降低上手门槛。
背景与挑战
背景概述
在开源生态蓬勃发展的当下,对海量GitHub仓库进行系统性分析与洞察已成为技术趋势追踪、人才发现及项目评估的关键。Powerset Research Data数据集由Powerset公司于近年创建,收录了约40万个活跃的GitHub公共仓库信息,覆盖贡献者、活动记录、星标数、编程语言、分类标签、README摘要及嵌入向量等丰富元数据。该数据集的建立旨在为AI代理与SQL工作流提供免费、开放的结构化数据支持,从而赋能开发者社区与研究者高效识别顶尖开源人才、洞察快速增长项目并理解技术演进脉络。其通过MCP服务器与DuckDB双重访问接口的设计,降低了数据获取门槛,在开源数据分析领域具有显著的实践价值与影响力。
当前挑战
该数据集面临的核心挑战包括:1) 数据覆盖与时效性矛盾——限定于近90天内有过推送且星标数≥10的公共仓库,导致大量低活跃度或新兴项目被排除,同时快照非实时,存在数据延迟;2) 数据完整性与精度局限——Star历史记录受限于GitHub API最多返回约4万条事件的约束,超星标仓库的日增星统计存在低估;Issues与PR仅覆盖近两年数据,历史全貌难以追溯;3) 构建过程中的工程挑战——需从GitHub海量API请求中高效抽取、去重并压缩为Parquet格式,处理大规模嵌入向量的存储与相似性检索,以及维护多表之间的关联一致性,对数据管道与存储架构提出了较高要求。
常用场景
经典使用场景
Powerset Research Data数据集汇聚了约40万个活跃GitHub仓库的元数据、贡献者信息、星标动态、编程语言分布、项目分类以及README摘要与语义嵌入等丰富信息。在开源生态研究领域,该数据集常被用于挖掘顶尖开源开发者、追踪高速增长仓库的演变轨迹以及洞察技术趋势的迁移路径。借助其提供的MCP服务器或DuckDB接口,研究者可无缝执行复杂的SQL查询,例如按地理位置与影响力定位最具系统架构能力的工程师,或依据README相似性发现功能相近的开源替代方案,从而深入理解开源社区的协作网络与创新扩散模式。
解决学术问题
该数据集有效解决了开源软件生态研究中长期面临的数据分散、更新滞后及跨仓库对比困难等核心难题。学术工作者得以系统性地分析数以万计仓库的星标增长曲线、贡献者活跃度与类别归属,进而量化评估项目影响力与生命力。其预计算的README摘要嵌入与相似性排名表,为语义层面上的项目聚类、技术领域迁移以及知识重叠度的量化提供了坚实基础,极大地推动了对开源协作机制、技术采纳规律及人才流动趋势的实证研究,成为计算社会科学与软件工程交叉领域的重要基础设施。
衍生相关工作
围绕该数据集已衍生出多项经典工作,包括基于README摘要嵌入构建的语义搜索工具,使研究者能以自然语言查询功能相近的仓库,突破传统标签分类的局限性。另一重要方向是开发者影响力排名模型,通过融合贡献频次、粉丝数及项目辐射力等多维特征,构建更公正的社区角色评估体系。此外,有工作利用星标时间序列数据预测仓库的增长轨迹,或通过贡献者共现网络揭示跨项目的技术人才流动图谱。这些衍生成果进一步放大了原始数据的学术与商业价值,推动了开放科学数据的二次创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务