遇见数据集

pricetra-pricing

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

PriceTrail(价迹)是一个持续更新的开源数据集,专注于 AI 和 SaaS 产品的定价信息。数据集包含两个主要部分: - `price_cards.jsonl`:每条记录为一个结构化的定价观测值,包含工具名称、厂商、档位、价格、计费周期、数据来源、抓取时间等13个字段。 - `price_changes.jsonl`:每条记录为两次快照之间检测到的定价变更事件,包括涨价、降价、新增/下架档位、取消免费档、计费周期变更等8个字段,变更类型有 new、price_up、price_down、free_tier_cut、feature_cut、tier_added、tier_removed、cycle_change。 数据集按固定节奏(默认每12小时)从真实定价页面重新生成,因此天然构成一份定价时间序列,可用于竞品情报、采购决策、风险投资研究以及模型训练。当前版本(截至生成时)包含 13,107 条定价卡片记录和 13 条定价变更记录。数据采用 CC-BY 4.0 许可协议发布,来源价格页面保留各自条款,数据集通过 source_url 保留归属。 该数据集覆盖了 PriceTrail 管道能够抓取和解析的公开定价页面(包括 AI、SaaS、DevOps、协作工具等),但部分厂商由于机器人检测或登录墙尚未收录,因此不声称完全覆盖所有厂商。数据集字段定义详见 schema.json。

PriceTrail is a continuously updated open-source dataset focusing on pricing information of AI and SaaS products. The dataset consists of two main parts: price_cards.jsonl (each record is a structured pricing observation, containing 13 fields such as tool name, vendor, tier, price, billing cycle, data source, crawl time, etc.) and price_changes.jsonl (each record is a pricing change event detected between two snapshots, including price increase, price decrease, new/removed tier, free tier cancellation, billing cycle change, etc., with 8 fields and change types: new, price_up, price_down, free_tier_cut, feature_cut, tier_added, tier_removed, cycle_change). The dataset is regenerated at a fixed interval (default every 12 hours) from real pricing pages, forming a pricing time series that can be used for competitive intelligence, procurement decisions, venture capital research, and model training. The current version contains 13,107 pricing card records and 13 pricing change records. The data is released under the CC-BY 4.0 license and covers public pricing pages of AI, SaaS, DevOps, collaboration tools, etc., but does not claim full coverage of all vendors.

创建时间:
2026-08-18
原始信息汇总

数据集概述:PriceTrail / 价迹

PriceTrail / 价迹 是一个持续更新的开源 「AI / SaaS 定价」数据集,提供结构化的定价快照卡与定价变更时间线,覆盖多语言(英文和中文)和多语种场景。

核心内容

  • price_card:每条记录包含13个字段,如工具名称、厂商、档位、价格、计费周期、生效日期、来源URL、快照引用、抓取时间、语言和类别,用于描述具体的定价观测。
  • price_change:每条记录包含8个字段,如变更类型、变更前/后值、检测时间及证据快照引用,用于描述两次快照之间发生的定价变更事件。
  • 变更类型词汇表包括:new(新增)、price_up(涨价)、price_down(降价)、free_tier_cut(取消免费档)、feature_cut(功能削减)、tier_added(新增档位)、tier_removed(下架档位)、cycle_change(计费周期变更)。

数据规模与更新

  • 当前版本包含 14,175 条定价卡片记录和 13 条定价变更记录。
  • 数据集按固定节奏(默认每12小时)重新生成,始终反映最近观测到的定价情况,可作为 定价时间序列 用于竞品情报、采购决策、VC研究与模型训练。

许可与覆盖范围

  • 数据集中的派生定价观测(结构化价格点、变更事件、来源信息)采用 CC-BY 4.0 许可。
  • 数据集独立于任何厂商或产品,不构成附属或赞助关系;所有产品名称和商标归各自所有者所有。
  • 覆盖范围仅限于可公开解析的定价页面,部分设有机器人或登录墙的厂商(如一些LLM提供商和设计套件)未包含在内,数据集不声称完整的厂商覆盖。

数据加载示例

python from datasets import load_dataset cards = load_dataset("Myco-Net/pricetra-pricing", data_files="data/price_cards.jsonl")["train"] changes = load_dataset("Myco-Net/pricetra-pricing", data_files="data/price_changes.jsonl")["train"]

搜集汇总
数据集介绍
pricetra-pricing 数据集图片
构建方式
在AI与SaaS服务快速迭代的背景下,定价信息的动态追踪成为竞品分析与市场决策的关键环节。PriceTrail数据集通过自动化流水线,以固定周期从公开可解析的定价页面中抓取结构化观测数据,生成定价快照卡与变更事件。具体而言,管道持续监控目标工具与厂商的定价页面,提取工具名称、厂商、档位、价格、计费周期、来源链接及抓取时间等字段,形成价格卡片;随后,通过比对相邻两次快照,检测并记录价格上调、下调、档位增减、免费档取消、计费周期变更等事件。整个数据集每12小时重新生成一次,确保始终反映最新观测到的定价状态。
特点
该数据集的核心特点在于其兼具时间序列与多语言属性。快照卡与变更事件分别以JSONL格式存储,前者包含58461条结构化定价观测,后者记录26条变更事件,涵盖价格涨跌、档位调整等八种变更类型。数据覆盖AI、SaaS、DevOps及协作工具等多个类别,且明确声明仅包含可公开解析的定价页面,对受机器人或登录墙限制的厂商予以排除,保证了覆盖范围的诚实性。同时,数据集以CC-BY 4.0许可发布,保留来源链接以尊重原始条款,并声明与任何厂商无附属关系。
使用方法
使用该数据集时,研究者可通过Hugging Face的datasets库直接加载两个数据文件。例如,加载价格卡片使用load_dataset函数并指定data_files为"data/price_cards.jsonl",加载变更事件则指定为"data/price_changes.jsonl"。数据适用于表格到文本生成、时间序列预测等任务,也可用于竞品情报、采购决策、风险投资研究及模型训练。用户需注意数据集的新鲜度,因其每12小时重新生成,建议在分析时确认最新版本。此外,使用时应遵守CC-BY 4.0许可,并保留对原始来源的署名。
背景与挑战
背景概述
在人工智能与SaaS产业迅猛演进的背景下,定价策略已成为企业竞争、采购决策与投资研判的核心变量。传统定价信息散落于各厂商官网,缺乏结构化、时序化的公开记录,难以支撑大规模定量分析。PriceTrail/价迹数据集由Myco-Net团队于近年构建并持续维护,旨在解决AI与SaaS定价数据碎片化、非结构化及难以追溯的痛点。该数据集涵盖58,461条定价快照与26条变更事件,以时间序列形式捕捉定价动态,为竞品情报、风险投资研究及模型训练提供了宝贵的实证基础,对推动定价科学从静态描述向动态洞察的范式转变具有显著影响力。
当前挑战
该数据集所应对的领域问题,在于突破传统定价数据静态、孤立且难以获取的局限,构建一个能够反映市场动态的定价时间序列。其构建过程亦面临多重挑战:其一,数据来源高度异质,需从不同厂商的公开定价页面中解析结构、术语及计费模式各异的繁杂信息;其二,诸多厂商将定价页面置于反爬机制或登录壁垒之后,致使数据集无法囊括全部市场参与者,存在覆盖偏差;其三,定价变更事件的检测需在稀疏快照间进行精确比对与语义消歧,以区分真实变更与页面噪声;其四,多语言环境下术语对齐与货币标准化亦为技术难点,共同制约着数据集的广度与深度。
常用场景
经典使用场景
在软件即服务与人工智能产品快速迭代的市场环境中,定价策略的动态监测成为企业竞争分析的核心环节。该数据集以结构化定价快照与变更事件时间线为基本单元,构建了一套覆盖多厂商、多档位、多计费周期的定价观测体系。其最经典的使用场景在于对竞品定价轨迹进行细粒度追踪与量化建模,研究者可借助price_cards与price_changes两个子集,系统性地刻画某一细分领域内定价水平的时序演化规律,进而支撑价格弹性估计、市场定位比较以及定价策略反事实推演等分析任务。
解决学术问题
长期以来,定价研究受困于数据可得性不足与观测口径不一致的双重约束,尤其针对SaaS与AI服务这类订阅制产品,公开可用的纵向定价数据极为稀缺。该数据集通过持续再生成的采集机制与统一的模式定义,有效缓解了定价时间序列研究中样本偏误与字段异质性问题,为实证产业组织理论、动态定价模型以及竞争情报方法学提供了可复现的数据基础。其意义在于将定价观测从零散个案提升为可计算、可审计的开放资源,推动了定价科学从定性描述向数据驱动范式的转变。
衍生相关工作
围绕该数据集,已衍生出一系列与定价智能相关的研究与应用工作。在方法层面,基于价格变更事件序列的异常检测与因果推断模型被用于识别涨价驱动因素;在应用层面,竞品定价监测仪表盘与自动化采购比价系统相继涌现。此外,该数据集的结构化字段设计亦为表格到文本生成任务提供了素材,催生了面向定价情报的自动报告生成与摘要系统,进一步拓展了其在自然语言处理与商业分析交叉领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务