遇见数据集

new-shopify-stores

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集提供新创建的Shopify商店信息,包括尚未上线(处于密码页面状态)的商店。数据源自公开的证书透明度日志、公共DNS和RDAP注册信息,以及每个商店的公开店面元数据。截至2026年9月30日,数据集记录了2792个在2026年9月26日后检测到的商店,覆盖100个国家,其中1216个(44%)仍处于预上线状态。主要国家包括美国(917)、法国(195)、英国(164)、印度(141)、巴基斯坦(136)、西班牙(123)。主要分类包括综合性商店(329)、时尚配饰(240)、家居园艺(149)、美容护肤(131)、珠宝手表(90)。数据集提供三个配置文件:latest_sample(最新50个商店样本)、stats_by_country(按国家的商店及预上线计数)、stats_by_niche(按分类的商店及预上线计数)。样本包含字段:域名、商店名称、国家、货币、分类、状态(预上线或已上线)、产品数量、运输目的地、注册日期、证书首次可见日期、首次检测日期、DNS状态。数据集每日自动刷新,适用于市场研究、品牌保护和电子商务趋势分析。许可证为CC-BY-4.0。

This dataset provides information on newly created Shopify stores, including those that have not yet gone live (in password page state). Data is sourced from public certificate transparency logs, public DNS and RDAP registration information, and each stores public storefront metadata. As of September 30, 2026, the dataset records 2792 stores detected after September 26, 2026, covering 100 countries, with 1216 (44%) still in pre-launch status. Major countries include the United States (917), France (195), the United Kingdom (164), India (141), Pakistan (136), and Spain (123). Major categories include General Store (329), Fashion Accessories (240), Home & Garden (149), Beauty & Skincare (131), and Jewelry & Watches (90). The dataset provides three configuration files: latest_sample (latest 50 store samples), stats_by_country (stores and pre-launch counts by country), and stats_by_niche (stores and pre-launch counts by niche). Sample fields include: domain, store name, country, currency, category, status (pre-launch or launched), product count, shipping destinations, registration date, certificate first seen date, first detection date, and DNS status. The dataset is refreshed daily and is suitable for market research, brand protection, and e-commerce trend analysis. License: CC-BY-4.0.

创建时间:
2026-09-28
原始信息汇总

数据集概述

基本信息

  • 数据集名称:New Shopify Stores, including pre-launch
  • 许可证:CC-BY-4.0
  • 语言:英语(en)
  • 数据规模:n<1K
  • 标签:shopify、ecommerce、certificate-transparency、market-research、tabular

数据集简介

该数据集收录了在自定义域名获得 HTTPS 证书当天被检测到的 Shopify 商店,通常在商店仍处于密码页面(即上线前)阶段时即可发现。

数据来源:公开的 Certificate Transparency 日志、公开 DNS 与 RDAP,以及各商店自身的公开店面元数据。

统计信息(截至 2026-09-30)

  • 自 2026-09-26 起共检测到 2873 家商店
  • 覆盖 102 个国家
  • 其中 1260 家(44%)仍处于上线前(pre-launch)状态

排名靠前的国家:美国(948)、法国(203)、英国(168)、印度(143)、巴基斯坦(138)、西班牙(128)

排名靠前的细分领域(niche):综合商店(339)、时尚与服饰(243)、家居与园艺(151)、美容与护肤(136)、珠宝与手表(92)

文件结构

配置(Config) 文件 内容
latest_sample(默认) data/latest_sample.csv 最近检测到的 50 家商店
stats_by_country data/stats_by_country.csv 按国家统计的商店数与上线前数量(全库)
stats_by_niche data/stats_by_niche.csv 按细分领域统计的商店数与上线前数量(全库)

字段说明(样本列)

domain、store_name、country、currency、niche、status、products、ships_to、registered_on、cert_seen、first_seen、dns_status

  • status:取值为 pre-launch(密码页面)或 live
  • niche:根据公开的产品标题推测;在首个产品出现之前为 Unknown (no products yet)

更新说明

当检测到新商店时,文件会自动刷新(最近刷新时间:2026-09-30 19:24 UTC)。

使用示例

python from datasets import load_dataset ds = load_dataset("jowalker/new-shopify-stores", "latest_sample")

获取完整数据

  • 全部 2873 家商店的单一 CSV(无需订阅):Full Snapshot Pack ($4.99)
  • 按状态、国家和细分领域整理好的现成列表,外加一份市场报告:Agency Pack ($19)
  • 按需获取的新商店,可筛选,按结果付费:Apify Actor
  • 面向 AI 智能体(MCP 服务器)和 n8n 工作流:GitHub

披露:本数据集由上述工具的制作者发布。

法律声明

本文件仅用于市场研究和品牌保护目的,按“现状”和“可用”基础提供,不作任何形式的保证。

记录仅来源于公开可访问的来源(Certificate Transparency 日志、公开 DNS 与 RDAP 注册库,以及商店的公开店面元数据);不收集或提供任何个人身份信息(PII)。

本数据集独立开发,与 Shopify Inc. 或本文件中提及的任何品牌无关联、未获其授权或背书。责任限于订单所支付的价格。

仅包含商业层面的公开数据:无电子邮件、电话号码或个人姓名。

搜集汇总
数据集介绍
new-shopify-stores 数据集图片
构建方式
该数据集依托公开的证书透明度日志、DNS与RDAP注册信息以及各店铺公开的店面元数据,构建了一套针对Shopify新上线店铺的自动化检测流程。每当某一定制域名获得HTTPS证书时,系统即将其识别为潜在的新店铺,即便该店铺尚处于密码保护页面阶段,仍可被纳入采集范围。通过交叉比对域名注册时间、证书签发时间及店铺公开商品信息,数据集进一步推断店铺所属国家、货币类型与经营品类,并持续动态刷新,从而形成一份涵盖预上线与已上线状态的店铺名录。
特点
数据集以表格形式呈现,包含店铺域名、名称、所属国家、币种、品类、运营状态、商品数量、配送范围、注册日期、证书检测日期、首次发现日期及DNS状态等字段。其突出特征在于能够捕捉店铺正式上线前的预发布阶段,并依据公开商品标题推测经营品类,在尚无商品时标记为未知。样本覆盖全球多个国家与细分市场,统计文件按国家和品类分别汇总店铺总数及预发布数量,便于开展市场结构与区域分布分析。
使用方法
使用者可通过Hugging Face数据集库加载最新样本或按国家、品类聚合的统计文件,快速浏览近期检测到的店铺列表。若需获取全部记录或按状态、国家、品类筛选的定制化列表,可借助外部快照包、代理工具或按需查询接口完成。对于人工智能代理及自动化工作流,可通过MCP服务器或n8n工作流集成,将新店铺检测结果直接嵌入市场监测与品牌保护流程中,实现持续追踪与动态更新。
背景与挑战
背景概述
随着电子商务生态的持续扩张,识别并追踪新兴在线店铺成为市场情报与品牌保护领域的关键议题。new-shopify-stores数据集由独立开发者于2026年构建,依托公开的证书透明度日志、DNS与RDAP注册信息以及店铺公开元数据,在自定义域名获得HTTPS证书当日即捕获Shopify店铺,甚至早于其密码页撤除之前。该数据集以表格形式记录了2938家店铺的国别、品类、上线状态等维度,为研究跨境电商格局、早期市场信号及品牌侵权监测提供了独特的时效性数据源,对市场营销与知识产权保护实践具有参考价值。
当前挑战
电子商务店铺追踪领域的核心难题在于如何在极早期阶段准确识别尚未公开运营的在线店铺,并对其属性进行可靠推断。该数据集的构建面临多重挑战:证书透明度日志中域名数量庞大且噪声显著,需精准过滤出真实Shopify店铺;店铺在预上线阶段缺乏商品信息,导致品类标注只能依赖有限元数据并存在不确定性;跨102个国家的DNS与RDAP数据质量参差不齐,增加了国别归属判定的难度;此外,公开数据源中个人身份信息的规避与合规使用亦对数据采集流程提出了严格要求。
常用场景
经典使用场景
在电子商务市场情报与竞争分析的语境下,该数据集最为经典的应用在于对新兴Shopify店铺进行早期识别与动态追踪。借助证书透明度日志中对自定义域名HTTPS证书签发事件的实时监测,研究者与从业者能够在店铺正式上线之前便捕获其存在,并持续观察其从密码保护状态向公开运营状态的转化过程。此类数据通常被用于构建新店铺发现管道,结合国家分布与细分品类标签,对全球范围内电商创业活动的时空脉络进行细粒度刻画。
衍生相关工作
围绕该数据集,已衍生出若干相互关联的工具与产品化工作,形成了从数据获取到应用落地的完整链条。全量快照包与按状态、国家、品类整理的代理包,将原始检测结果转化为可直接用于市场报告的成品数据集。面向自动化流程的Apify Actor支持按条件筛选并按结果计费,满足实时监测需求。面向人工智能代理的MCP服务器与n8n工作流则进一步将新店铺发现能力嵌入自动化决策系统,拓展了该数据在智能代理生态中的复用边界。
数据集最近研究
最新研究方向
在电子商务市场情报与品牌保护领域,针对新创独立站的前瞻性监测已成为前沿研究热点。该数据集依托证书透明日志、公共DNS及RDAP注册信息,实现了对Shopify店铺在正式上线前(即密码页阶段)的精准捕获,为市场趋势分析、竞品动态追踪及品牌侵权预警提供了独特的数据基础。当前研究焦点在于利用此类预发布信号进行早期市场进入策略建模、跨境电商品类分布预测,以及基于公开元数据的自动化合规审查。其影响在于将电商研究的时间窗口从“已上线”前移至“预发布”,显著提升了市场响应速度与决策前瞻性,同时为AI智能体在实时商业情报中的应用提供了结构化数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务