遇见数据集

TrustMRR Census Dataset

收藏
github2026-09-07 更新2026-09-09 收录
官方服务:

资源简介:

来自TrustMRR的完整匿名数据集,包含所有10,150个产品,每个产品包含收入字段(月订阅收入、过去30天收入、总生命周期收入)以及匿名化后的产品标识、创始人信息等。数据可用于分析独立产品收入分布。

The full anonymous dataset from TrustMRR comprises all 10,150 products. Each product contains revenue-related fields including monthly subscription revenue, revenue in the past 30 days, and total lifetime revenue, as well as anonymized product identifiers, founder information and other relevant data. This dataset can be utilized to analyze the revenue distribution of independent products.

创建时间:
2026-09-07
原始信息汇总

数据集概述

该仓库提供了一份对 TrustMRR 平台的完整普查数据与相关脚本。TrustMRR 是一个独立产品排行榜,其收入数据直接连接支付提供商,仅展示经过验证的收入。数据集共包含 10,150 个产品记录,抓取于 2026-09-04。

核心发现

  • 从未盈利的产品(三个收入字段均为零)有 2,654 个,占比 26.1%
  • 此前流传的“58% 产品零收入”说法在算术上正确但统计口径有误——它仅统计了 revenue.mrr(月度订阅收入),忽略了非订阅收入(如一次性模板销售、按次付费等)。例如 ShipFast 终生收入达 $1,270,003 但 mrr 为 0。
  • 全站 last30Days(近30天实际收入)总和是 mrr 总和的 2.08 倍,剔除最大离群值 Gumroad 后仍有 1.69 倍,说明平台上约 40% 的收入并非订阅收入。

数据集文件

文件路径 说明
data/startups-anon.jsonl 10,150 条匿名化记录,每行一条
data/head_freshness-anon.json 对 mrr ≥ $5,000 的 390 条记录及 40 条随机对照的同步新鲜度审计
data/report_v2.txt report_v2.py 的输出,为所有分析数字的来源
data/staleness.json 同步延迟的中间结果
data/fetched_pages.json 抓取时的分页日志
report_v2.py 分析脚本,仅读取本地文件,无需网络
fetch.py 从 API 拉取完整排行榜(需自行配置 API 密钥,约 1 小时,限制 20 次/分钟)
staleness.py 读取每个详情页的最近同步日期及过期标志
anonymize.py 从原始数据构建匿名数据集并验证
analyze.py, clean_head.py 早期脚本,已被 report_v2.py 取代,保留以溯源自证

匿名化说明

原始数据包含每个产品的名称、创始人 handle 等身份信息。为避免暴露未盈利产品及其创始人的身份,发布的版本去除了名称、slug、描述、网站及创始人 handle,并用加盐哈希替代身份标识。所有分析性信息均完整保留:founder_id 保留创始人集中度,id 可与新鲜度审计关联,AI 关键词匹配结果预计算在 ai_related 字段中。运行 anonymize.py --check 可验证匿名文件精确复现六项关键指标。

三个收入字段

  • revenue.mrr — 月度订阅收入,一次性产品销售恒为 0
  • revenue.last30Days — 近 30 天实际收款(含订阅与非订阅)
  • revenue.total — 终生收入

影响统计数字的方法细节

  • 头部数据排除过期记录:mrr ≥ $5,000 的 390 条记录中,有 37 条被标记为过期或超过 30 天未同步,其 mrr 合计 $6,726,998(占全站的 37.4%),其中最大一条(占全站 mrr 的 19.8%)显示“Stripe API key expired”且最后同步于 2026-04-20。清理后 353 条记录超过 $5,000,占比 3.5%(原始为 3.8%)
  • 年龄:从 foundedDate 计算至 2026-09-05,按月均 30.44 天计算;1,529 条记录(15.1%)无有效成立日期
  • AI 分类:匹配名称、描述和类别中的关键词,命中率 49.7%;平台自身类别字段给出 21.2%
  • 分页非随机:API 按产品名称字母序分页,前两页中 mrr ≥ $5,000 的产品占比 7.0%(全站为 2.5%),抽取前 N 页会使头部占比虚增一半
  • 92 条记录的 mrr > 0total == 0,字段相互矛盾,被单独计为不一致记录
  • API 返回 10,150 条记录而网站首页显示 10,048 条,差异约 1%

数据无法回答的问题

  • 自选择样本:仅愿意连接支付提供商并公开收入的人才会出现在此,无法描述未参与者
  • 左截断:平台于 2025-10-31 上线,此前消失的产品从未有机会出现
  • 退出偏差:月收入超 $5,000 的产品中约三成在挂牌出售,售出后即退出榜单

因此 3.5%、5.1% 和 19.2% 等数字均为时点存量数据,不能用作任何人的成功概率。

许可

代码基于 MIT 许可证。数据来源于 TrustMRR 的公共 API,权利归平台及各个产品所有者所有。数据仅用于核查已发布的结论,并非产品的再分发。

搜集汇总
数据集介绍
TrustMRR Census Dataset 数据集图片
构建方式
该数据集对TrustMRR平台上的10,150个独立产品进行了全面普查,数据于2026年9月4日通过官方API抓取,覆盖平台所有列表产品。为保护未盈利产品及其创始人的隐私,数据集经过匿名化处理,移除名称、创始人标识等身份信息,并采用加盐哈希替代,同时预计算AI相关字段以保留分析价值。原始数据包含各产品的订阅月收入(MRR)、30天收入及终身收入三项核心指标,并附加了数据新鲜度审计与同步状态信息。
使用方法
数据集及分析脚本存放于GitHub仓库,采用JSONL格式存储匿名化数据,无需API密钥即可离线复现分析报告,运行`python3 report_v2.py`可生成论文中全部数据。若需更新数据,用户可配置自有TrustMRR API密钥,运行`fetch.py`进行全量抓取,随后通过`staleness.py`检查同步状态,并用`anonymize.py`重建匿名数据集。分析脚本支持生成报告,所有字段均已文档化,便于研究者验证结论或开展下游统计与机器学习应用。
背景与挑战
背景概述
TrustMRR Census Dataset由独立研究员于2026年9月创建,旨在全面普查独立产品收入排行榜TrustMRR上的10,150个产品。该数据集的核心研究问题在于质疑社区中流传的“58%产品零收入”论断,通过区分订阅收入(MRR)与总营收,揭示实际仅有26.1%的产品从未盈利。数据集匿名化处理以保护隐私,同时保留分析所需的全部关键字段,为独立开发者生态的收入分布提供了前所未有的量化视角,对理解微型SaaS和数字产品经济具有重要参考价值。
当前挑战
该数据集的构建面临多重挑战。领域层面,TrustMRR平台仅收录愿意连接支付提供商并公开收入的产品,导致样本自选择偏差,且平台自2025年10月上线,早期失败产品未被纳入,存在左截断问题,同时高收入产品约三成在售,售出即下架,造成退出偏差。构建过程中,API分页按产品名排序,前两页高收入产品占比异常,需全量抓取而非抽样;37条高收入记录因Stripe密钥过期或同步超30天被视为过时数据,清理后前5千美元以上产品占比从3.8%降至3.5%;92条记录MRR大于0但总营收为0,数据自相矛盾,需单独标注。
常用场景
经典使用场景
TrustMRR Census Dataset作为独立开发者经济领域的全景式普查数据,常被用于剖析微型软件产品商业模式的真实面貌。研究者可借助该数据集对超过一万个产品的订阅收入、近30日收入及终身收入进行多维交叉分析,从而刻画不同收入层级产品的分布格局。其独特的匿名化处理机制,在保护隐私的同时保留了创始人集中度、AI相关性等关键属性,使得复制研究、验证统计结论、开展横向对比分析成为可能,是探索长尾市场结构与独立开发者生存状态的理想数据基石。
解决学术问题
该数据集精准回应了独立开发者社区中长期存在的认知偏差问题,即仅凭订阅收入为零便断言产品不盈利的谬误。通过引入三个相互独立的收入维度,并纠正分页抽样偏差、剔除过期记录等系统性方法,它提供了更为精准的盈利状况度量。数据集解决了在非上市公司财务数据稀缺背景下,如何基于公开API构建可靠样本、规避左截断与退出偏倚等难题,为平台经济、创业成功学等领域的实证研究提供了方法论范例,推动了关于独立开发者真实收入分布的学术讨论。
实际应用
在实际应用中,该数据集可直接服务于独立开发者的市场策略制定与竞品分析。通过对AI相关产品、高收入产品(月收入超过五千美元)的特征提取,开发者能识别出高潜力细分领域,调整产品定价与订阅模式。同时,支付平台与聚合服务商可依此评估不同收入结构产品的服务需求,优化其商户支持方案。投资人与孵化器亦能利用数据洞察独立产品赛道的退出概率与增长上限,辅助其决策。数据集的匿名化属性保障了竞品调研的合规性,但其详细的收入字段与时间标记亦为实时市场监测奠定了坚实基础。
数据集最近研究
最新研究方向
独立开发者经济收入结构的深度剖析成为当前热点,TrustMRR普查数据集首次以全量普查方式揭示了平台收入真实分布。研究发现,仅以订阅制MRR衡量收入会严重低估实际盈利状况,约40%的现金流来自非订阅模式,而真正零收入产品占比仅为26.1%,远低于此前流传的58.4%。该数据集在方法论上引入数据新鲜度清洗、字段矛盾识别等精细处理,有效校正了排名榜顶部的统计偏差。其匿名化发布策略及可复现分析框架,为独立开发者生态研究提供了高标准的数据伦理范例,对理解小产品商业成功概率及平台经济研究具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务