Powerset Research Data
收藏资源简介:
这是一个公共数据集,包含约40万个活跃的GitHub仓库,由Powerset维护。数据集涵盖仓库、贡献者、活动、星标、语言、类别、README摘要、嵌入和项目元数据,无需凭证即可访问。可用于识别顶级开源开发者、分析快速增长的仓库和理解技术趋势。
This is a public dataset containing approximately 400,000 active GitHub repositories maintained by Powerset. The dataset covers repositories, contributors, activities, stars, programming languages, categories, README summaries, embeddings and project metadata, and is accessible without credentials. It can be used to identify top open-source developers, analyze rapidly growing repositories and understand technical trends.
数据集概述
本数据集由 Powerset 维护,包含约 40万个活跃的GitHub公开仓库的公共数据。数据用于识别顶级开源开发者、分析快速增长仓库以及理解技术趋势,对AI代理和SQL工作流免费可用。
数据内容
数据集包括仓库、贡献者、活动、星标、语言、类别、README摘要、嵌入向量和项目元数据等字段。无需凭证即可访问。
访问方式
提供两种主要访问方式:
- MCP服务器:通过
https://research-mcp.powerset.dev/mcp/连接支持MCP协议的客户端(如Claude、Codex、Cursor)进行对话式查询。无需身份验证。也可作为 ChatGPT应用 使用。 - DuckDB + Agent技能:直接连接到托管的DuckLake目录(路径:
ducklake:https://research-data.powerset.dev/github-public/latest/public.ducklake),运行SQL查询。可选配包含模式上下文、查询模式和示例的技能文件(路径:powerset-research-data/SKILL.md)。
数据表结构
数据目录名为 github。主模式表通过 github.<表名> 引用,分析表通过 github.analytics.<表名> 引用。
主模式表
| 表名 | 描述 | 关键列 |
|---|---|---|
repos |
至少10个星标的活跃仓库,使用 stars_count 获取当前星标总数。 |
repo_node_id, name_with_owner, stars_count, fork_count, pushed_at, created_at |
repo_metadata |
仓库元数据:描述、主题、语言、许可证、所有者类型、观察者、开放问题数量、功能标志。 | repo_node_id, description, topics, language, license_key, owner_type, watchers_count, open_issues_count |
repo_scores |
Powerset计算的排名分数和分组。 | repo_node_id, name_with_owner, score_overall, cohort_group, star_cohort |
repo_categories |
每个仓库的顶级类别分配。 | repo_node_id, top_category_id, top_category, similarity |
repo_category_similarities |
仓库与类别的相似度分数。 | repo_node_id, category_id, similarity |
repo_contributors |
每个仓库的贡献者信息和贡献数量。 | repo_node_id, user_id, login, contributions, type |
repo_readme_summaries |
仓库README内容的纯文本摘要。 | repo_node_id, name_with_owner, summary, content_hash, generated_at, tier |
repo_readme_summary_embeddings |
README摘要嵌入向量(FLOAT[]),用于语义相似度搜索。 |
repo_node_id, content_hash, embedding, _generated_at |
github_users |
数据集中用户的公开GitHub个人资料字段。 | user_id, login, name, company, location, bio, followers_count |
repo_pulls |
大约过去两年的Pull Request元数据(不含正文)。 | repo_node_id, pull_number, title, state, user_id, user_login, created_at, merged_at |
repo_issues |
大约过去两年的Issue元数据(不含正文),包含PR,使用 is_pull_request 过滤。 |
repo_node_id, issue_number, title, state, user_id, user_login, created_at, is_pull_request |
repo_stars_daily |
每个仓库的每日星标计数。 | repo_node_id, starred_date, stars_delta |
分析模式表
| 表名 | 描述 | 关键列 |
|---|---|---|
analytics.category_stats |
类别级别的聚合统计和示例。 | top_category_id, top_category, repo_count, total_stars, stars_90d, activity_90d |
analytics.language_category_stats |
每种主要语言内类别级别的聚合统计。 | language, top_category_id, top_category, repo_count, total_stars, stars_90d |
analytics.repo_activity_monthly |
每月每仓库的星标、问题、PR和提交活动计数。 | repo_node_id, month, stars, issues_opened, prs_opened, prs_merged, commits |
analytics.repo_activity_summary |
滚动每仓库活动计数和最后活动时间戳。 | repo_node_id, stars_30d, stars_90d, prs_merged_90d, commits_90d, last_activity_at |
analytics.repo_profile |
分析就绪的仓库档案,包含元数据、类别、分数和README摘要。 | repo_node_id, name_with_owner, name_with_owner_lower, stars_count, score_overall |
analytics.repo_profile_with_activity |
analytics.repo_profile 与滚动活动摘要字段的连接。 |
repo_node_id, name_with_owner, score_overall, stars_90d, activity_90d |
analytics.repo_readme_similar_repos |
每个仓库前100个README摘要最近邻。 | source_repo_node_id, similar_repo_node_id, rank, similarity |
analytics.repo_top_contributors |
每个仓库的顶级贡献者档案和贡献计数。 | repo_node_id, user_id, login, contributions, contributor_rank, followers_count |
analytics.repo_topic_index |
每个仓库主题一行,用于主题搜索、过滤和分面。 | topic, repo_node_id, name_with_owner, stars_count, score_overall, top_category |
数据覆盖范围与限制
- 仓库范围:至少10个GitHub星标且在过去90天内有过推送的活跃公开仓库。
- Pull Requests:仅包含过去大约2年内创建的PR。更早的PR不包含在内。
- Issues:仅包含过去大约2年内创建的Issue。更早的Issue不包含在内。Issue数据包含PR和Issue,需使用
is_pull_request列区分。 - 星标历史:GitHub Stargazers API 每个仓库最多返回约40,000个星标事件。对于超过40k星标的仓库,
repo_stars_daily历史不完整,SUM(stars_delta)会低估真实总数。应使用repos.stars_count获取准确的当前星标数。 - 快照:数据以不可变的时间戳快照形式发布。
latest/指针在新快照发布时更新。快照并非实时,GitHub活动与数据可用性之间存在延迟。




