遇见数据集

457k-prices-build-a-burger

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集是一个固定研究快照,包含457,352条经过质量过滤的未聚合价格观测,覆盖10个汉堡配料类别、12个美国邮政编码市场和29个连续日期(2026年7月21日至8月18日)。数据集旨在研究汉堡常见配料在不同美国邮政编码市场和不同日期之间的标价及包装标准化价格差异。每条记录代表一个产品在特定类别、市场、日期的包装数量和标价观测,并包含一个源中立的包装等效价格字段(当数量可解析时)。数据集的字段包括:类别标识符、类别标题、相关URL、地理类型、邮政编码、地理标签、观测日期、产品名称、解析的包装数量、数量单位、数量描述、标价金额、货币代码、标准化价格金额、标准化数量值和标准化数量单位。数据集支持10个汉堡配料类别(如汉堡面包、牛肉饼、美国奶酪、生菜、洋葱、泡菜、蛋黄酱、番茄酱、芥末、泡菜酱),每个类别有特定的比较目标。所有29个日期、12个邮政编码市场和3480个类别×邮政编码×日期单元格均完整覆盖。数据集适用于时间序列分析、零售价格比较、数据可视化以及经济学研究,可用Pandas等工具进行快速分析。该数据集由CostInflation团队发布,采用CC0 1.0通用许可证,允许无限制重用。

This dataset is a fixed research snapshot containing 457,352 quality-filtered, unaggregated price observations covering 10 hamburger ingredient categories, 12 U.S. ZIP code markets, and 29 consecutive dates (July 21 to August 18, 2026). The dataset aims to study the differences in list prices and package-standardized prices of common hamburger ingredients across different U.S. ZIP code markets and dates. Each record represents a products package quantity and list price observation for a specific category, market, and date, and includes a source-neutral package equivalent price field (when quantity is parseable). The dataset fields include: category identifier, category title, related URL, geography type, ZIP code, geography label, observation date, product name, parsed package quantity, quantity unit, quantity description, list price amount, currency code, standardized price amount, standardized quantity value, and standardized quantity unit. The dataset supports 10 hamburger ingredient categories (e.g., hamburger buns, beef patties, American cheese, lettuce, onion, pickles, mayonnaise, ketchup, mustard, relish), each with a specific comparison target. All 29 dates, 12 ZIP code markets, and 3,480 category × ZIP code × date cells are fully covered. The dataset is suitable for time series analysis, retail price comparison, data visualization, and economic research, and can be quickly analyzed using tools like Pandas. It is released by the CostInflation team under the CC0 1.0 Universal License, allowing unrestricted reuse.

创建时间:
2026-08-24
原始信息汇总

数据集概述

该数据集是一个固定研究快照,记录了美国12个ZIP市场中10个汉堡配料类别的457,352条未聚合、经质量筛选的价格观测数据,时间跨度为2026年7月21日至8月18日,共29天。

核心信息

项目 内容
名称 Burger Ingredient Prices Raw Dataset (2026)
发布方 CostInflation Team
许可协议 CC0 1.0 Universal
语言 英语
任务类型 表格回归
数据规模 457,352行(约457K),文件大小约130.7MB
数据格式 CSV,货币为美元(USD)
时间范围 2026-07-21 至 2026-08-18(29天)
地理覆盖 12个美国ZIP市场(邮政编码)
类别数量 10个汉堡配料类别
完整度 3,480个 类别×ZIP×日期 单元格全部覆盖,无缺失
重复行 0(已去除精确重复)
更新频率 无(固定快照,不再更新)

数据字段(16列)

  • 标识series_idseries_titlecanonical_url
  • 地理geography_type(固定为postal_code)、geography_id(5位邮编,需按文本处理)、geography_label
  • 时间observed_date(YYYY-MM-DD格式)
  • 产品product_name(描述性标题,非稳定产品ID)
  • 数量与价格quantity_valuequantity_unitquantity_nameprice_amountcurrency_code(固定为USD)
  • 标准化字段normalized_price_amount(可为空)、normalized_quantity_valuenormalized_quantity_unit

数据含义与可比价格方法

  • 每行表示:一个类别中,某个产品标题在特定ZIP市场、特定日期的包装数量与标价观测,并非销售、订单或库存记录。
  • 价格保留price_amount为原始标价;若包装数量可解析,normalized_price_amount按类别专属的比较目标缩放,便于跨产品比较。
  • 比较目标:如汉堡面包按10个、牛肉饼按1磅、美国奶酪按0.375磅等(详见README中的类别参考表)。
  • 注意:仅在同一series_id内比较标准化值;数量未解析或不兼容的行,normalized_price_amount为空。

类别参考

类别键 类别名称 比较目标
hamburger_bun 汉堡面包 10个
beef_patties 牛肉饼 1磅
american_cheese 美国奶酪 0.375磅
lettuce 生菜 1个
onions 洋葱 1磅
pickles 腌黄瓜 16液量盎司
mayonnaise 蛋黄酱 30液量盎司
ketchup 番茄酱 20盎司
mustard 芥末 12盎司
pickle_relish 腌黄瓜酱 12液量盎司

数据质量与解释

  • 质量筛选:已进行类别、安全性和精确重复过滤,不含公式引导的产品标题。
  • 可比价格:268,580行(58.73%)有可比价格;188,772行(41.28%)无法比较,标准化价格字段为空。
  • 限制:产品标题为描述性文本,非稳定ID;ZIP标签仅代表所选市场,不代表城市、都市区、州或全国估计;不含运费、税费、促销、购买、消费或库存信息。

使用建议

适合用于:

  • 跨ZIP市场的类别内可比价格分布比较;
  • 29天窗口内的每日中位数和离散度变化分析;
  • 基于类别比较目标构建购物篮场景;
  • 研究哪些产品标题和包装格式最可能导致可比价格缺失。

快速开始(Pandas示例)

数据集提供Python代码示例,演示如何加载CSV(将geography_id按字符串处理)并计算核心类别的标准化价格中位数。数据文件名为:costinflation-build-a-burger-prices-2026-07-21-to-2026-08-18.csv

搜集汇总
数据集介绍
457k-prices-build-a-burger 数据集图片
构建方式
该数据集源自CostInflation团队发布的固定研究快照,旨在捕捉美国汉堡原料市场的价格动态。构建过程严格遵循质量筛选流程,包括类别筛选、安全过滤及精确去重,最终汇聚了457,352条未聚合的价格观测记录。数据覆盖2026年7月21日至8月18日连续29天,横跨12个美国邮政编码市场及10大汉堡原料类别,如牛肉饼、汉堡面包、芝士等。每条记录详尽记载了产品标题、观测日期、地理信息、包装数量与标价,并衍生出标准化价格字段,以便跨产品比较。数据集的完整性与一致性通过确保所有28,800个可能的类别-地区-日期组合均有观测得以保障,为学术研究与产业分析奠定了坚实的数据基础。
特点
该数据集的显著特点在于其细粒度的观测粒度与多维度的信息整合。每行代表单一产品在特定市场与日期的价格观测,而非聚合指数,从而保留了原始市场异质性。数据集不仅包含原始标价(price_amount),还提供了基于类别特定比较目标(如每磅、每单位)的标准化价格(normalized_price_amount),极大增强了跨类别与跨市场的可比性。此外,数据经过严格的质量控制,确保无精确重复记录,且所有标准化价格均基于可解析的包装数量,保证了数据的可靠性。其覆盖范围广泛,包含2,541种不同的产品标题,为研究价格分布、市场波动及产品多样性提供了丰富的素材。
使用方法
该数据集的使用灵活多样,适用于多种研究场景。研究者可借助Pandas等工具快速加载数据,并利用series_id、geography_id、observed_date等字段进行分组聚合,分析不同类别、市场或时间维度的价格分布与趋势。例如,可计算市内类别的标准化价格中位数,或追踪29天内的日度价格波动。数据集设计清晰,提供了详细的列说明与代码示例,便于用户上手。对于跨类别比较,建议使用normalized_price_amount字段,因其已基于统一标准调整。此外,数据集的CC0许可允许自由复用与二次加工,为构建价格预测模型、进行经济分析或教学演示提供了便捷、可靠的公开数据源。
背景与挑战
背景概述
该数据集由CostInflation团队于2026年创建,旨在捕捉美国汉堡配料市场的价格动态。其核心研究问题在于,如何通过细粒度的价格观测揭示不同邮政编码区域间及时间序列上的价格差异。数据集包含了2026年7月21日至8月18日期间,12个美国邮政编码市场、10类汉堡配料共计457,352条价格观测记录,为零售经济学和时空价格分析提供了宝贵资源。其影响力在于,为研究者提供了一个质量过滤、来源中立的研究快照,促进了价格比较方法论的探讨,并支持了购物篮情景构建、价格分布特征分析等多元研究路径。
当前挑战
该数据集面临的挑战主要来自两个方面。首先,在领域问题层面,零售价格分析长期受困于产品规格的多样性,使得跨品牌、跨包装的同类商品难以直接比较;本数据集通过引入标准化的可比价格字段,缓解了这一问题,但仍有41.28%的观测因包装规格无法解析而缺乏可比价格,凸显了现实数据中规格信息的复杂性。其次,在构建过程中,团队需对不同来源的原始价格数据进行质量筛选,包括类别判定、安全过滤及精确去重,并在缺乏稳定产品标识符的前提下,依靠文本描述进行归类,这可能导致产品匹配误差;同时,数据仅覆盖特定时间窗口与地理区域,限制了其结论的普适性,存在选择偏差风险。
常用场景
经典使用场景
该数据集以其细粒度的时空粒度和标准化的价格比较字段,成为研究美国本土食品零售价格动态的宝贵资源。其经典的用途在于开展跨区域、跨时点的汉堡原料价格分布比较分析,研究者可借此考察不同邮编市场之间在各类产品上的价格离散程度,并追踪29天观测窗口内价格中位数与波动性的演变轨迹。数据集中包含的标准化价格(normalized_price_amount)使得不同包装规格的产品具备了可比性,从而为构建清晰的购物篮价格指数提供了坚实的数据基础,适用于区域经济差异和短期价格传导机制等议题的实证检验。
衍生相关工作
围绕此数据集,催生了多方面的衍生工作。研究者利用其时间与空间双重维度,构建了区域性的食品价格预测模型,探索短期价格波动的驱动因子。数据集中标准化价格的设定也启发了关于多元商品价格指数编制方法的探讨,推动了对传统指数计算方式的改进。同时,对未解析可比价格行(41.27%)的建模分析,引出了关于产品描述规范性与包装异质性对价格可比性影响的研究分支,这些工作进一步丰富了零售价格数据挖掘与清理方法论的理论体系。
数据集最近研究
最新研究方向
该数据集以其细粒度的时空价格观测,为零售经济学与通货膨胀研究提供了前沿的数据基础。其覆盖12个美国邮政编码市场、连续29天、涵盖10类汉堡食材的逾45万条价格记录,开创了以标准化包装价格进行跨区域比较的新范式。当前研究趋势聚焦于利用此类高频、微观价格数据构建精密的区域价格指数,并借助时间序列分析与数据可视化技术,揭示供应链动态、季节性波动及市场分割现象。该数据集不仅助力于消费者价格行为的精细建模,还为食品通胀的实时监测与预测提供了宝贵资源,对经济学与数据科学研究具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务