遇见数据集

shopify-products-catalog-sample

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

本数据集为 Shopify 独立站(DTC 商店)产品目录与价格历史的免费样本,通过抓取公开、无需登录的 Shopify 商店 `products.json` 端点构建。样本覆盖 386 家商店、533,479 个 SKU 行(2026-08-01 快照),完整数据集含 4,100+ 商店、6.18M SKU,并每周更新快照,同时生成价格变化和可用性变化事件。数据集包含两个配置:`catalog`(每行代表一个产品变体在每个快照的信息,主键为 `store_domain, variant_id, fetched_at`,共 21 个字段,如 `store_domain`, `country_guess`, `product_id`, `title`, `product_type`, `vendor`, `tags`, `variant_id`, `sku`, `price`, `compare_at_price`, `available`, `image_count`, `published_at`, `fetched_at`, `niche` 等)和 `price_changes`(派生事件:新上架、价格涨跌、可用性翻转,含新旧值和日期)。适用于电商与 DTC 市场研究、价格监控与动态定价模型训练、产品目录丰富与匹配基准、从可用性和价格变化事件中提取需求信号。数据收集遵循合规原则:仅使用公开、未认证的 Shopify 端点,限制速率,不包含产品描述 HTML 或图片文件(仅 `image_count`),无个人数据,每行均标注来源。已知限制包括 `country_guess` 为推断值、商店偏向中小型独立 DTC 商店、价格历史深度取决于快照频率。本样本采用 CC BY-NC 4.0 许可证(非商业评估),完整数据集需商业许可。

This dataset is a free sample of product catalog and price history from Shopify independent stores (DTC stores), built by scraping the public, unauthenticated `products.json` endpoint of Shopify stores. The sample covers 386 stores and 533,479 SKU rows (snapshot dated 2026-08-01), while the full dataset contains 4,100+ stores and 6.18M SKUs, with weekly snapshot updates and generated price change and availability change events. The dataset includes two configurations: `catalog` (each row represents information of a product variant in each snapshot, primary key is `store_domain, variant_id, fetched_at`, with 21 fields such as `store_domain`, `country_guess`, `product_id`, `title`, `product_type`, `vendor`, `tags`, `variant_id`, `sku`, `price`, `compare_at_price`, `available`, `image_count`, `published_at`, `fetched_at`, `niche`, etc.) and `price_changes` (derived events: new listings, price increases/decreases, availability flips, with old and new values and dates). It is suitable for e-commerce and DTC market research, price monitoring and dynamic pricing model training, product catalog enrichment and matching benchmarks, and extracting demand signals from availability and price change events. Data collection follows compliance principles: only public, unauthenticated Shopify endpoints are used, rate limited, no product description HTML or image files (only `image_count`), no personal data, and each row is source-annotated. Known limitations include `country_guess` being an inferred value, store bias towards small and medium-sized independent DTC stores, and price history depth depending on snapshot frequency. This sample is licensed under CC BY-NC 4.0 (non-commercial evaluation), and the full dataset requires a commercial license.

创建时间:
2026-08-02
原始信息汇总

数据集概述

shopify-products-catalog-sample 是一个由 DataForge(Zalize)发布的免费样本数据集,内容为独立 DTC(直接面向消费者)Shopify 商店的产品目录及价格历史数据。数据来源于公开、无需登录的 products.json 端点,覆盖 386 家商店、533,479 个 SKU 行(2026-08-01 快照)。完整数据集可扩展至 4,100+ 商店、6.18M SKU,并以周为单位刷新快照,同时生成价格和可用性变更事件。


配置文件

配置名 文件 说明
catalog catalog_sample_500.csv 500 个产品变体行(跨商店分层随机样本),21 个字段。
price_changes price_changes_sample.csv 快照间派生的价格/可用性变更事件样本。

数据模式

  • catalog:每个产品变体每个快照一行,主键为 (store_domain, variant_id, fetched_at)。字段包括 store_domaincountry_guessproduct_idtitleproduct_typevendortagsvariant_idskupricecompare_at_priceavailableimage_countpublished_atfetched_atniche 分类(12 种基于关键词的利基类别,如 apparel、food_beverage 等)。
  • price_changes:派生的变更事件,包括新列表、价格上涨/下跌、可用性翻转,附有旧/新值和日期。

潜在用途

  • DTC 电商市场研究及利基/供应商格局分析。
  • 价格监控和动态定价模型训练。
  • 产品目录增强或匹配基准测试。
  • 利用可用性和价格变更事件生成需求信号。

数据来源与合规性

  • 仅使用公开、未认证的 Shopify products.json / meta.json 端点,遵守速率限制,使用可识别用户代理,无不正当规避手段。
  • 不重新分发产品描述 HTML 或图片文件(仅提供 image_count),不包含个人数据。
  • 每行数据包含 store_domainfetched_at 以提供溯源,并提供数据删除请求通道:https://data.zalize.com/data-removal

已知局限

  • country_guess 基于商店货币/元数据推断,US_OR_GLOBAL 标记无国家信号的美元商店(本样本中约 99%)。
  • 商店集合偏向小型/中型独立 DTC 商店,不包含大型平台。
  • 价格历史深度随快照频率增长,本样本反映初始快照状态。

许可与引用

  • 样本许可:CC BY-NC 4.0(非商业评估),完整数据集采用分级商业许可,详情见 https://data.zalize.com/datasets/shopify-products-price-history-dataset
  • 引用要求:需标注 "DataForge (data.zalize.com)" 并链接至 https://data.zalize.com,完整指南见 https://data.zalize.com/citation

使用示例(Python)

python from datasets import load_dataset

ds = load_dataset("zalizedata/shopify-products-catalog-sample", "catalog", split="train") print(ds[0])

可用配置:catalogprice_changes

搜集汇总
数据集介绍
shopify-products-catalog-sample 数据集图片
构建方式
该数据集源自对独立DTC Shopify店铺公开且无需登录的products.json端点的系统性采集,构建过程中严格遵守合规要求,仅抓取公开可访问的数据,并采用速率限制与身份标识以确保数据获取的合法性。样本集包含386家店铺的533,479条SKU记录,以及通过分层随机抽样得到的500条产品变体数据,同时衍生出价格变动与库存状态变化的事件记录。
特点
数据集的独特之处在于其精细的粒度与广泛的应用潜力,涵盖21个字段,包括店铺域名、产品类型、标签、价格及库存状态等,并辅以基于关键词规则的利基市场分类。此外,价格变动事件数据为动态定价模型与市场趋势分析提供了宝贵的时序信息,而明确的溯源机制与合规声明则增强了数据的可信度与实用性。
使用方法
使用者可通过HuggingFace的datasets库便捷加载数据,选择catalog或price_changes配置以适配不同的分析需求。该数据集适用于电商市场研究、价格监控模型训练、目录匹配基准测试及需求信号挖掘等场景,其结构化格式便于与现有数据分析流程无缝集成。
背景与挑战
背景概述
该数据集由DataForge(Zalize旗下)于2026年创建,旨在系统性地捕获独立DTC Shopify店铺的公开商品目录及价格动态。研究团队通过合法访问无需登录的`products.json`端点,构建了覆盖386家店铺、53万余条SKU记录的样本快照,全量数据规模达4100余家店铺与618万SKU。其核心研究问题聚焦于电商市场结构分析、价格监测模型训练及商品目录匹配基准的建立。该数据集以周频快照形式提供价格与可用性变化事件,为动态定价研究和需求信号挖掘提供了独树一帜的时序数据基础,在电商研究领域具有开创性的参考价值。
当前挑战
该数据集面临的挑战主要体现在领域问题和构建过程两个层面。在领域层面,电商目录数据常面临店铺异构性、商品属性稀疏及价格噪声等问题,而本数据集通过明确的schema分层和事件化处理缓解了部分难题,但`country_guess`字段因店铺元数据缺失,约99%的样本仅能标记为`US_OR_GLOBAL`,限制了地域维度分析的精度。在构建过程中,大规模抓取需严格遵循合规框架,仅使用非认证端点、限制速率并标识UA,且不绕反爬机制,这导致数据覆盖偏向中小型DTC店铺,缺乏大型市场平台的代表性;同时价格历史深度受快照频率制约,初始样本仅反映早期状态,长期追踪的完整性仍待时间积累。
常用场景
经典使用场景
该数据集作为Shopify独立站(DTC)产品目录与价格历史记录的代表性样本,为电子商务与市场研究领域提供了宝贵的实证数据。其经典使用场景聚焦于对DTC市场格局的洞察,通过涵盖386家店铺、逾53万条SKU记录的大规模样本,研究者能够深入剖析不同细分领域(如服装、食品饮料等)的产品构成、品牌分布与定价策略。数据集中丰富的结构化字段,如产品类型、供应商、标签及价格信息,为进行类别分析、价格带研究和市场细分提供了坚实基础,是描绘DTC电商生态全貌的得力工具。
实际应用
在实际应用层面,该数据集为电商企业、市场咨询机构及价格监测平台提供了实用的数据基础。企业可利用其进行竞品价格监控与动态定价策略的制定,通过分析不同店铺、不同品类产品的价格区间与变动趋势,优化自身产品定价与促销方案。市场研究机构可借助该数据快速洞察DTC市场的新兴品牌、热门品类与消费趋势,为商业决策提供数据驱动的依据。此外,该数据集还可用于产品目录匹配与富集系统的开发验证,提升电商平台在商品推荐、库存管理等方面的智能化水平,具有广泛的商业应用前景。
衍生相关工作
该数据集的发布衍生了一系列富有成效的研究与实践工作。基于其价格变化事件数据,研究者构建了动态定价与需求预测模型,探讨了价格波动与库存状态之间的关联机制;产品目录的丰富字段则促进了电商知识图谱构建、商品属性补全等方向的发展,相关成果常作为产品匹配与推荐算法的基准测试集。此外,该数据集也启发了关于公开数据采集合规性、数据隐私保护等伦理议题的讨论,推动了负责任的数据共享实践。其数据更新机制与开源精神,为构建持续演进的电商研究基础设施提供了范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务