遇见数据集

majia-huiyuan

收藏
github2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

开源会员运营数据集:一个完整的连锁会员数据中台样板间,包含54个模拟数据集,涵盖会员注册、订单、发券、积分、私域触达、投诉评价、加盟分账、门店成本等全链路数据,用于会员运营和数据分析的参考。

Open-Source Member Operation Dataset: A complete reference demonstration of a chain store member data middle platform, which contains 54 simulated datasets covering end-to-end data including member registration, order transactions, coupon issuance, point management, private domain engagement, complaints and reviews, franchise revenue sharing, store cost accounting and other related scenarios, serving as a reference for member operation and data analysis.

创建时间:
2026-07-12
原始信息汇总

数据集概述:majia-huiyuan · 会员运营家底(开源样板间)

这是一个完整的、可复制的连锁会员数据体系,基于一家虚构的咖啡连锁企业构建,旨在为会员运营、数据分析及数据建设从业者提供可直接参考的样板。

  • 虚构企业规模:8 万会员、1200 家门店、141 个加盟商、74 个商品、129 万笔订单。
  • 核心资产:54 个数据集、25 条数据加工链、12 张看板、约 2900 行实战公式库。
  • 数据性质:全部由程序模拟生成,与任何真实企业无关,个人标识已打码。采用 MIT 协议,可自由使用和商用。
  • 适用人群:会员、私域业务的从业者;数据分析、数据建设人员;希望从零搭建会员数据体系的人;AI Agent。
  • 技术细节:SQL 方言为 Spark 3.4,数据体系在观远 BI 环境下搭建,但五层架构、字段设计和 SQL 逻辑均平台无关。

数据分层架构

所有数据集按数据行业通用的五层模型组织,数据流向为:档案柜(DIM)+ 流水账(DWD)→(25 条加工链)→ 台账(DWS)→ 驾驶舱(ADS)。此外还包括质检层(DQC)和参数表(param)。

层级 行话 人话描述 数量
DIM 维度层 档案柜:会员、门店、商品等基础档案 10
DWD 明细层 流水账:订单、券事件、积分等发生的每一件事 16
DWS 汇总层 台账:按人、店、月汇总,计算复购率、RFM 分层 16
ADS 应用层 驾驶舱:给老板、店长、运营看的最终报表 8
DQC 质检层 质检员:用于数据对账和报警 1
param 参数表 阈值配置:如流失天数判断,写在表中而非公式里 3

54 个数据集总览

DIM 档案柜(10 个)

  • dim_会员主档
  • dim_会员身份桥
  • dim_门店主档
  • dim_加盟商主档
  • dim_商品主档
  • dim_券模板
  • dim_活动主档
  • dim_员工导购
  • dim_成本科目
  • dim_日期

DWD 流水账(16 个)

  • dwd_订单
  • dwd_订单商品
  • dwd_会员注册绑定
  • dwd_券事件
  • dwd_积分事件
  • dwd_会员触达
  • dwd_私域事件
  • dwd_活动参与
  • dwd_评价
  • dwd_投诉
  • dwd_会员经营任务
  • dwd_加盟合同明细
  • dwd_加盟分账明细
  • dwd_门店成本明细
  • dwd_门店投资明细
  • dwd_门店目标

DWS 台账(16 个)

  • dws_会员RFM分层
  • dws_会员生命周期
  • dws_会员同期群留存
  • dws_私域转化漏斗
  • dws_券效益分析
  • dws_渠道迁移分析
  • dws_商品销售分析
  • dws_门店日报
  • dws_目标达成
  • dws_新店爬坡_Comp老店
  • dws_单店利润月汇总
  • dws_成本结构汇总
  • dws_加盟商经营汇总
  • dws_加盟回本测算
  • dws_员工导购效能
  • dws_体验口碑汇总

ADS 驾驶舱(8 个)

  • ads_高层经营驾驶舱
  • ads_会员私域驾驶舱
  • ads_会员经营任务池
  • ads_门店每日指挥台
  • ads_活动权益复盘
  • ads_单店利润健康
  • ads_加盟商单店报告
  • ads_异常归因清单

DQC + param(4 个)

  • dqc_归因清单对账
  • param_会员生命周期阈值
  • param_利润健康阈值
  • param_豁免日历

12 张看板

覆盖从老板、店长到加盟商的不同角色,看板清单可在目录结构中查看,每张看板的卡片明细见看板/页面文档/

具体看板包括:高层经营驾驶舱、会员私域驾驶舱、会员经营任务池、门店每日指挥台、活动权益复盘、体验风险专题、单店利润健康、加盟商单店报告、总览(ECharts 重构版)、异常归因作战页、外卖业绩近 30 天 GMV、参赛作品提交页。

公式库:60+ 段可直接抄的 SQL

公式库包含约 2900 行实战 SQL,蒸馏自两段连锁餐饮 BI 实战履职,按主题分为 9 册,可配合样板间结构直接使用:

分册 管什么
01 日期与时间 日期处理、时段、跨月对齐
02 顾客与会员 新老客、复购、RFM 分层、留存流失
03 营收 KPI 客单价、同店、会员贡献占比
04 渠道与门店 堂食外卖分流、门店生命周期
05 券与折扣 核销率、折扣分桶
06 SQL 工具箱 字符串拆解、开窗排名
07 数据质量坑 NULL/空串处理、口径歧义
08 ETL 工程范式 宽表底座、对账、Cohort 网格
09 生产 ETL 索引 39 个生产 ETL 索引与复用决策

目录结构

清单/ 三张总清单 CSV(数据集 / ETL / 看板,含 ID) 公式库/ 餐饮 BI 公式实战库(README + 9 册) 分享/ 直播分享书面实录(34 页插画长文) 数据集/ 结构定义/ 每个数据集的字段结构说明 数据样本/ 每个数据集 200 行模拟样本 CSV 原始JSON/ 观远平台原始定义 ETL/ 逻辑SQL/ 25 条加工链的节点结构和 SQL 逻辑 原始JSON/ 平台原始定义 看板/ 页面文档/ 每张看板放置的卡片明细 页面JSON/ 页面布局原始定义

三种主要用途

  1. 业务同学:对照 数据集/数据样本 理解会员运营常用概念(如复购、流失)在数据中的实际体现,并使用 清单/数据集清单.csv 自查公司会员体系的缺失。
  2. 数据同学:直接从结构定义获取字段结构,从逻辑SQL获取加工口径,从公式库获取通用算法 SQL(如 RFM 打分、回本偏离度计算),替换表名即可应用。
  3. 整套复刻:配合 原始JSON 和观远 BI 官方 CLI 可半自动重建,或基于五层结构、字段设计、SQL 逻辑在任何 BI 或数仓中实施。
搜集汇总
数据集介绍
majia-huiyuan 数据集图片
构建方式
在会员运营领域,数据字段定义、计算口径与看板搭建常因横跨业务与技术两端而成为难以系统学习的模糊地带。为破解这一困局,该数据集以一家虚构的咖啡连锁企业为蓝本,模拟生成8万会员、1200家门店、141个加盟商、74个商品及129万笔订单的全链路运营数据。参照数据行业通用的五层架构——维度层、明细层、汇总层、应用层与质检层,辅以参数配置表,构建了54个数据集的完整资产体系。数据流经由25条加工链串联,从档案柜与流水账归拢至台账,最终呈现在驾驶舱内,每一环节均以SQL逻辑明确记录口径,确保了体系的完整性与可复现性。
使用方法
该数据集提供三种灵活的使用路径。业务人员可对照样本数据与数据集清单,核查自身会员体系的完整性,识别缺失层级。数据人员可直接复用结构定义中的字段设计与公式库中的标准SQL,快速迁移至自有数仓或BI平台。对于希望完整复刻的用户,观远BI平台支持通过原始JSON配合官方CLI工具半自动化重建,而五层架构与SQL逻辑本身具备平台无关性,适用于任何技术底座。推荐用户将仓库地址接入AI工具,通过自然语言指令即可完成体系对比、口径翻译或看板规划,无需额外学习仓库结构,极大提升了数据资产的复用效率。
背景与挑战
背景概述
majia-huiyuan数据集由资深用户运营专家马甲(@maojiebc)于2026年创建,旨在构建一套完整的连锁会员数据中台开源样板间。该数据集以虚构的咖啡连锁为蓝本,涵盖54个数据集、25条数据加工链及12张看板,模拟了8万会员、1200家门店、129万笔订单的全链路运营场景。核心研究问题聚焦于会员数据体系的标准化构建,填补了业务与数据人员之间在字段定义、口径计算及看板搭建上的鸿沟。凭借其开源特性和详实的实战公式库,该数据集对连锁零售、数据中台及用户运营领域产生了显著影响,成为行业学习与复用的重要参照。
当前挑战
该数据集面临多重挑战。首要挑战在于解决连锁会员运营中业务逻辑与数据技术脱节的领域难题,需将复杂的会员生命周期管理、RFM分层、券效益分析等业务概念转化为标准化、可复用的数据口径与加工逻辑。其次,构建过程中需模拟跨多系统(会员、交易、营销、私域、财务等)的异构数据整合,并确保数据格式、时间窗口及标识符的一致性。此外,如何设计通用性与行业适配性并存的五层数据架构,并在无真实企业数据依赖下验证其合理性,亦是关键难点。最后,维持数据集的开源社区共建与持续迭代,同样构成生态维系的挑战。
常用场景
经典使用场景
在连锁零售与餐饮行业的数据分析领域,majia-huiyuan数据集作为一套完整的会员运营数据样板间,其最经典的使用场景在于为从业者提供从零搭建会员数据体系的全链路参考。研究人员与业务分析师可借助该数据集模拟的54张表结构,深入理解维度层、明细层、汇总层、应用层与质检层的分层逻辑,并直接复用25条数据加工链中的口径定义,例如RFM分层、同期群留存和私域转化漏斗的计算方式,从而快速掌握会员数据资产的标准化构建方法。
解决学术问题
该数据集致力于破解长期以来横亘在业务与数据团队之间的‘三不管地带’难题,即字段定义模糊、口径计量不一致以及看板搭建缺乏规范。通过提供一份包含129万笔订单、8万会员的全链路模拟数据,它使得研究者能够围绕会员生命周期管理、复购率分析、券效益评估和渠道迁移行为等经典学术议题展开实证研究,其意义在于将零散的业务经验转化为可复用的数据工程范式,显著降低了连锁企业开展会员数据分析的门槛。
实际应用
在实际产业应用中,majia-huiyuan数据集常被企业数据团队或BI工程师作为搭建商业智能看板的‘图纸’与‘零件库’。例如,运营人员可直接参考‘高层经营驾驶舱’与‘门店每日指挥台’的数据结构,快速生成面向老板或店长的可视化报表;同时,公式库中收录的60余段经过实战检验的SQL算法,可直接迁移至企业现有数据仓库中,用于自动计算客单价、同店同比以及会员私域转化漏斗等核心KPI,从而大幅缩短从数据建设到业务决策的落地周期。
数据集最近研究
最新研究方向
当前会员运营数据体系建设正从零散的业务需求驱动,转向全链路标准化与AI协同化的范式跃迁。majia-huiyuan项目以虚构咖啡连锁为蓝本,完整构建了涵盖会员档案、订单交易、私域触达、加盟分账及门店成本等54个数据集的五层数据中台,并配套25条加工链与12张角色化看板,其核心价值在于为行业提供了可复用的数据定义与计算口径样板。该项目在2026年观远AI创新赛直播中演示了如何将区域运营巡店分析从数小时压缩至分钟级,体现了数据体系与AI Agent深度整合的前沿方向。通过形成一套贯通业务语言与技术实现的基准参照,majia-huiyuan正在推动会员运营从经验判断走向数据驱动的标准化重建,尤其对连锁零售领域构建可移植的智能决策底座具有里程碑式的示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务