遇见数据集

SDataPro/maycee-retail-dataset

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Maycee Retail Dataset是一个现实的合成澳大利亚零售数据集,专为SQL学习、数据工程实践、分析工程、商业智能演示以及大型语言模型/文本到SQL评估而设计。该数据集覆盖了2017年1月1日至2019年12月31日的时间范围,包含3年的每日时间深度。具体数据包括164,968笔交易、417,907个行项目、8,762次退货,以及截至免费层窗口结束的完整当前状态维度快照。数据集由13个表格组成,包括事实表(如交易、项目、退货)和维度表(如客户、产品、商店、区域、类别、品牌、供应商、日期维度等)。这些表格模拟了零售业务中的星型模式结构。此外,数据集中还包含了故意设计的数据质量场景,例如2018年7月1日至9月30日期间的POS电话捕获中断(导致新注册客户的电话号码字段为NULL)以及2019年11月至12月交易的年终退货积压(部分退货日期在原购买窗口之后的1月至2月),这些场景用于数据质量学习和基准测试。数据集以Parquet文件格式存储,支持通过Hugging Face的datasets库加载或直接使用DuckDB查询。免费层数据基于CC BY 4.0许可发布,允许商业使用,但需注明出处。

Maycee Retail is a realistic synthetic Australian retail dataset for SQL learning, data engineering practice, analytics engineering, BI demos, and LLM/text-to-SQL evaluation. This free Hugging Face release covers 2017-01-01 to 2019-12-31: 3 years of daily temporal depth (2017-2019). It contains 164,968 transactions, 417,907 line items, 8,762 returns, and full current-state dimension snapshots as of the end of the free-tier window. The dataset includes fact tables (transactions, items, returns) and dimension tables (customers, products, stores, regions, districts, categories, brands, suppliers, date_dim), totaling 13 tables in a star-schema structure. It also incorporates deliberate data quality scenarios for learning and benchmarking, such as a POS phone capture outage from 2018-07-01 to 2018-09-30 (where customer.phone is NULL for sign-ups in this quarter) and a year-end returns backlog for Nov-Dec 2019 transactions (some returns have return_date in Jan-Feb after the original purchase window). The data is stored in Parquet files optimized for datasets.load_dataset() and direct DuckDB reads. The free tier is released under CC BY 4.0 license, allowing commercial use with attribution.

提供机构:
SDataPro
搜集汇总
数据集介绍
SDataPro/maycee-retail-dataset 数据集图片
构建方式
Maycee Retail Dataset是一个针对澳大利亚零售场景的合成数据集,由SDataPro基于真实零售业务逻辑生成。该数据集采用星型模式设计,包含多个事实表和维度表,覆盖2017年至2019年共三年的每日交易记录。构建过程中,数据集通过模拟POS系统故障、退货积压等异常场景,融入真实数据质量缺陷,以支持SQL学习、数据工程实践和AI评估。HuggingFace版本以分片Parquet文件形式存储,事实表按日期分区,便于按时间筛选和高效加载。
特点
该数据集涵盖164,968笔交易、417,907个订单项和8,762个退货事件,包含13张表,如交易、商品、退货等事实表,以及客户、产品、门店、促销等维度表。其突出特点在于保留了两项有意引入的数据质量问题:2018年第三季度的客户电话缺失和2019年底退货日期延后,这些异常被清晰文档化,为数据清洗和异常检测提供了真实场景。此外,数据集支持表格分类、回归和表问答等多种任务,兼具时间序列特征和SQL基准测试用途。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载数据,调用`load_dataset`并指定配置名称(如'transactions')即可获取相应表为Pandas DataFrame。支持在Python中使用merge操作进行表间关联查询,或通过DuckDB直接读取Parquet文件执行SQL分析。例如,利用`hf://`协议路径可将交易表与客户表基于`customer_id`连接,筛选特定年份的数据。该数据集结构清晰,适合进行数据工程练习、BI看板制作和文本转SQL模型评估。
背景与挑战
背景概述
Maycee Retail Dataset是由SDataPro团队于2026年发布的一个面向零售领域的关系型数据集,专门为SQL学习、数据工程实践、分析工程、商业智能演示以及大语言模型(LLM)的Text-to-SQL评测而设计。该数据集模拟了澳大利亚零售业务,包含2017年至2019年共计164,968笔交易、417,907条商品明细及8,762条退货记录,并整合了客户、产品、门店、促销等维度表,形成符合星型模式的规范化数据仓库结构。其核心价值在于为零售数据分析技术的研究与开发提供真实且可复现的基准环境,尤其推动了结构化查询语言生成与时间序列分析领域的进展。
当前挑战
该数据集面临的主要挑战来自两方面:其一,零售数据分析领域长期存在数据质量与跨表关联的难题,如部分销售时段因POS系统故障导致客户电话字段缺失,以及年末退货积压导致退货日期超出原购买窗口,这些人为嵌入的异常场景虽贴近真实业务,却对SQL查询的鲁棒性和一致性提出严苛要求;其二,数据集的构建过程中,需在合成数据中巧妙平衡真实性与可控性,既要确保各维度表(如区域、分类、品牌)之间的逻辑自洽与时间序列的连贯性,又要通过精细设计的数据稀疏性和异常注入来模拟现实中的信息不完整性,这给数据生成与验证流程带来了较高的技术复杂度。
常用场景
经典使用场景
在零售数据分析领域,Maycee Retail Dataset 作为一份高度逼真的合成澳大利亚零售数据,最经典的使用场景聚焦于 SQL 学习与数据工程实践。它构建了包含事实表与维度表的星型模式,模拟了交易、商品、客户、门店等真实零售业务实体,为学习者提供了从基础查询到复杂多表联接、聚合分析的完整演练环境。同时,研究者可借助其时间序列属性进行销售趋势挖掘、季节性模式识别与预测建模,亦可将数据集作为 BI 工具演示与 LLM/Text-to-SQL 评估的标准基准。
实际应用
在实际产业应用中,该数据集广泛服务于零售企业的数据驱动决策流程。分析师可利用其丰富的维度和度量字段构建客户细分、促销效果评估与库存周转分析模型,并通过整合数十个促销周期与退货记录优化供应链效率。数据集的时间序列属性支持对历史销售波动的复现,辅助管理层识别高价值客户群体与调整定价策略。此外,其标准化的星型模式设计降低了 BI 工具接入门槛,企业可将其作为 ETL 流程开发与数据仓库迁移的测试沙盘。
衍生相关工作
该数据集的发布催生了一系列衍生研究工作,涵盖零售推荐系统、时序预测与自然语言查询接口等领域。基于其多维星型模式,研究者发展了面向复杂多表联接的文本到 SQL 评估框架,将数据集的交易与客户表作为黄金测试集。在数据工程方面,衍生工作围绕其内置的数据质量场景构建了自动化清洗管道与回填算法评估平台。此外,该数据的合成属性激发了关于隐私保护与合成数据在零售分析中应用效果的对比研究,推动了可解释 AI 与可复现数据分析方法论的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务