遇见数据集

193k-prices-period-care-atlas

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集名为“Period Care Prices Raw Dataset (2026)”,由CostInflation团队发布,是一个固定研究快照,包含192,500条经过质量过滤的未聚合价格观察数据,覆盖9个经期护理产品类别(如卫生巾、卫生棉条、月经杯、月经盘、经期热敷贴、经期止痛药、经期内裤、护垫、女性湿巾)、12个美国邮编市场以及2026年7月21日至8月18日共29个连续日期。每条记录代表一个经期护理产品标题、邮编市场、日期、所列数量和价格的产品级观察,不表示销售、订单、需求、库存、市场份额、个人使用、健康结果或医疗建议。数据格式为CSV,包含16列:series_id(类别键)、series_title(类别标题)、canonical_url(相关类别页面URL)、geography_type(地理级别,始终为postal_code)、geography_id(五位数美国邮编)、geography_label(邮编市场标签)、observed_date(观察日期)、product_name(产品标题)、quantity_value(解析后的产品数量)、quantity_unit(数量单位)、quantity_name(数量名称)、price_amount(所列价格)、currency_code(货币代码,始终为USD)、normalized_price_amount(标准化到类别比较目标的价格,未解析或不相容时为空)、normalized_quantity_value(类别特定比较目标数值:1、4、40或100)、normalized_quantity_unit(比较目标单位,始终为units)。数据集适合用于分析经期护理产品在时间、地理和类别间的价格分布、变异性,以及标准化价格与非标准化价格的对比等研究。所有预期日期、邮编市场和类别×邮编×日期组合均完整存在,没有重复行。标准化价格仅在相同series_id内可比,且未建立不同材料、用途等之间的等效性。数据集采用CC0 1.0通用许可,可自由复用。

The dataset is named "Period Care Prices Raw Dataset (2026)", released by the CostInflation team. It is a fixed research snapshot containing 192,500 quality-filtered, unaggregated price observations covering 9 period care product categories (e.g., sanitary pads, tampons, menstrual cups, menstrual discs, period heat patches, period pain relief, period underwear, panty liners, feminine wipes), 12 U.S. postal code markets, and 29 consecutive dates from July 21 to August 18, 2026. Each record represents a product-level observation of a period care product title, postal code market, date, listed quantity, and price, and does not imply sales, orders, demand, inventory, market share, personal use, health outcomes, or medical advice. The data format is CSV with 16 columns: series_id (category key), series_title (category title), canonical_url (relevant category page URL), geography_type (geographic level, always postal_code), geography_id (5-digit U.S. postal code), geography_label (postal code market label), observed_date (observation date), product_name (product title), quantity_value (parsed product quantity), quantity_unit (quantity unit), quantity_name (quantity name), price_amount (listed price), currency_code (currency code, always USD), normalized_price_amount (price normalized to category comparison target, empty when unparsed or incompatible), normalized_quantity_value (category-specific comparison target value: 1, 4, 40, or 100), normalized_quantity_unit (comparison target unit, always units). The dataset is suitable for analyzing the price distribution, variability, and comparison of normalized vs. non-normalized prices of period care products across time, geography, and categories. All expected dates, postal code markets, and category×postal code×date combinations are fully present with no duplicate rows. Normalized prices are comparable only within the same series_id, and no equivalence is established between different materials, uses, etc. The dataset is licensed under CC0 1.0 Universal, free to reuse.

创建时间:
2026-08-26
原始信息汇总

Period Care Prices Raw Dataset (2026) 数据集概述

基本信息

  • 数据集名称: Period Care Prices Raw Dataset (2026)
  • 许可证: CC0 1.0 Universal
  • 语言: 英语
  • 任务类型: 表格回归
  • 标签: 零售与购物、经济学、美国、时间序列分析、数据可视化
  • 数据规模: 192,500 条记录(大于100K小于1M)
  • 格式: CSV / USD

数据内容

  • 观察窗口: 2026年7月21日至8月18日,共29天
  • 地理覆盖: 12个美国ZIP市场
  • 类别覆盖: 9个月经护理产品类别(包括:卫生湿巾、月经杯、月经盘、经期热敷贴、卫生巾、经期止痛产品、护垫、经期内裤、卫生棉条)
  • 完整网格: 类别 × ZIP × 日期 = 3,132 个单元格,全部覆盖
  • 不同产品标题: 1,644 个
  • 数据行数: 192,500 行,16列

关键字段说明

  • price_amount: 列出的价格(美元)
  • normalized_price_amount: 按类别固定比较目标标准化后的价格(约66.0%的行包含此字段)
  • normalized_quantity_value: 类别的标准化数量目标(1、4、40或100单位)
  • geography_id: 五位数美国邮编(需以文本格式加载)
  • observed_date: 观察日期(YYYY-MM-DD格式)

可比价格方法

  • 127,087 行(66.0%)具有非空标准化价格,基于已解析的正数数量和固定类别目标
  • 65,413 行(34.0%)由于数量无法解析或与类别目标不兼容,保留原价且标准化价格字段为空
  • 仅可在相同 series_id 内比较标准化价格值

数据质量与限制

  • 所有29个日期、12个ZIP市场和3,132个完整单元格均存在
  • 无重复公开行,无公式开头产品标题
  • 产品标题为描述性文本,非稳定的产品标识符
  • ZIP标签描述特定市场,不代表全市、都市、州或国家估计
  • 数据集不包含配送费、税费、促销折扣、购买行为、使用情况、健康结果或产品性能信息
  • 不可用于剂量、有效性、舒适度、安全性或生命周期成本的等效性比较

预期用途

  • 比较一次性与可重复使用经期护理产品的价格分布
  • 分析12个ZIP市场间的地理价格差异
  • 追踪29天窗口内的日度类别中位数和离散度
  • 对比可重复使用与一次性产品的价格模式,但不主张等效性

文件与结构

  • 文件大小: 70,489,018 字节
  • 数据分割: 仅训练集(192,500条样本)
  • 无计划更新,为固定研究快照

数据集来源

由CostInflation团队准备和发布,应用了一致的类别分配、地理标签、重复过滤、安全过滤和类别内可比价格计算。数据文件名为 costinflation-period-care-atlas-prices-2026-07-21-to-2026-08-18.csv

搜集汇总
数据集介绍
193k-prices-period-care-atlas 数据集图片
构建方式
该数据集是CostInflation团队针对美国经期护理产品市场构建的一份固定研究快照,涵盖了从2026年7月21日至8月18日、跨越12个美国邮政编码市场的192,500条未聚合的价格观测记录。数据采集覆盖9大产品类别,包括卫生棉条、卫生巾、月经杯等,每条记录均经过类别筛选、安全过滤及精确去重处理,确保数据的纯净度与可靠性。数据集提供了产品标题、观察日期、地理位置、标称数量与价格等16个字段,并特别设计了标准化价格字段,将标称价格按类别内固定的比较目标(如40片或1件)进行换算,以便于同类产品间的横向比较。该构建方式旨在提供一个分析就绪的原始数据层,而非经过聚合的指数,为后续研究提供灵活的基础。
特点
该数据集的核心特点在于其结构化的维度和高质量的数据预处理。数据覆盖了完整的3,132个类别×邮编×日期单元格,无缺失,确保了面板数据的平衡性。其中,66%的行包含可比较的标准化价格,其余行则保留了原始标价,体现了对数据异质性的透明处理。此外,数据集中无精确重复行,产品标题无公式引导字符,且所有非空标准化价格均基于正向解析的数量。数据集的另一个突出特点是其类别内比较的严谨性,明确区分了可重复使用与一次性产品,并强调标准化比较不涉及功效或安全性等效,为研究者提供了清晰的解释边界。这些特征使得数据集在时间序列分析、地理价格差异研究以及产品定价模式探索方面具有很高的应用价值。
使用方法
该数据集以CSV格式提供,可通过Pandas等工具直接加载分析。使用时应注意将geography_id字段读作字符串以避免前导零丢失,并将series_id转换为类别类型。典型应用包括计算各类别在各邮编市场的价格中位数、追踪29天窗口内的价格分布变化,或比较不同类别间标准化价格的方差。数据集附带的Python示例展示了如何快速生成类别层面汇总统计。研究者可进一步构建回归模型,探究产品标题措辞、包装数量与价格离散度之间的关系,或利用其丰富的维度进行地理经济学分析。由于数据集为固定快照,不提供更新,适合作为历史对照基准。在使用时,应遵循文档中的解释性指南,避免将类别间标准化价格视为等效性评价。
背景与挑战
背景概述
在2026年,美国经济持续面临通胀压力,日用消费品价格波动受到广泛关注。为深入探究经期护理产品这一细分市场的价格动态,CostInflation团队于同年7月至8月精心构建了此数据集,收录了192,500条经严格质量筛选的价格观测记录,覆盖9大类产品、12个美国邮政编码市场及29个连续日期。该数据集旨在以标准化的可比价格字段揭示产品标价与包装规格之间的复杂关系,为消费物价研究、时空价格差异分析及经济学建模提供了珍贵的高分辨率微观数据,对推动零售价格透明化及消费者权益保护研究具有开创性意义。
当前挑战
数据集面临的核心挑战在于构建过程中的多维数据整合与标准化难题。一方面,产品标题多为非结构化文本,不同商家对同一产品的命名及规格描述差异显著,且部分产品数量信息不明确,导致可比价格的计算率仅为66.0%,剩余34.0%的观测值因数量不兼容而难以标准化,制约了跨产品价格比较的全面性。另一方面,价格数据受促销、税费及地域供需差异影响,简单标价无法反映真实购买成本;同时,各项产品在材质、使用周期及功效上的本质差异,使包装数量标准化后的价格比较仍可能产生误导,此类领域问题要求研究者具备精细的类别感知能力,方能正确解读价格信号。
常用场景
经典使用场景
该数据集为经期护理产品价格研究提供了精细的原始观测样本,涵盖9大品类、12个美国邮政编码市场及连续29天的价格记录。其经典使用场景在于进行细粒度的时间序列与地域差异分析,研究者可据此解析不同品类(如可重复使用与一次性产品)在特定市场中的价格动态与分布特征。凭借标准化的可比价格字段,该数据支持构建稳健的价格指数,评估区域市场间的价格离散程度,并探究产品标题文本与包装数量对报价离散度的影响,从而揭示经期护理产品零售定价的内在规律。
解决学术问题
该数据集有效解决了经期护理产品价格研究中长期存在的数据碎片化与可比性缺失问题。在学术层面,它突破了以往研究受限于单一地理区域或短暂时间窗口的瓶颈,提供了包含类别、地理与时间三维度的系统化观测,使研究者能够可靠地检验价格异质性假说,并控制产品规格差异进行跨区域比较。其公开的标准化方法亦为后续研究树立了方法论基准,促进了关于经期产品可负担性及其社会经济影响的实证分析,进而为公共卫生政策与消费者权益研究提供了关键证据。
衍生相关工作
围绕该数据集,可衍生出一系列富有价值的后续研究与实践工作。在经济与统计领域,可构建基于该数据的时间序列预测模型,探究短期价格波动的影响因子,或构建空间计量模型分析地理邻近性对价格传导的作用。在数据科学层面,对产品名称的文本挖掘有助于自动分类与命名实体识别,进而提升零售价格数据的自动化处理能力。同时,基于其可比价格方法,可拓展至其他消费品类,形成价格监测的通用框架,为建立全国性的生活成本指数或构建开放价格数据库提供范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务