遇见数据集

Sample historical valuation-percentile dataset for top 50 US & HK stocks

收藏
github2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集包含美国50大和香港50大股票的历史估值数据样本,包括市盈率(PE)、市净率(PB)、市销率(PS)及其历史百分位数,时间跨度最长20年。

This dataset contains historical valuation data samples for the top 50 stocks in the United States and the top 50 stocks in Hong Kong. The included metrics cover price-to-earnings ratio (PE), price-to-book ratio (PB), price-to-sales ratio (PS), as well as their respective historical percentiles, with a maximum time span of 20 years.

创建时间:
2026-09-06
原始信息汇总

数据集概述

本数据集为历史估值百分位样本数据,覆盖美国(US)和中国香港(HK)市场,分别选取市值前50大的股票,提供最长20年的PE、PB、PS及其历史百分位数据。

数据内容与格式

  • 数据文件:sample_data/valuation_percentile_sample_20y.csv
  • 主要字段包括:市场(US/HK)、代码(如 AAPL.O0700.HK)、公司名称、估值日期(每周五)、市盈率(pe)、市净率(pb)、市销率(ps)以及对应的20年历史百分位(0–100)。
  • 百分位含义:例如,pe_pct_20y 为85,表示该股当期PE高于其自身历史PE的85%,即相对自身历史估值偏高,而非相对市场估值。

脚本与工具

仓库提供以下脚本,用于数据探索和样本再生:

  • scripts/read_stock_history.py:查询单只股票的历史数据,可用参数 --plot 绘制图(需安装 matplotlib)。
  • scripts/export_valuation_sample.py:从Postgres数据库提取数据并计算百分位,可重新生成样本CSV;支持通过环境变量或 .env 文件配置数据库连接,无硬编码凭据。

方法与局限性

  • 百分位采用简化因果滚动窗口算法,在每周时点将该周数值与该股票自身截至该周的历史数据比较,非getstockcheck.com站点完整生产引擎(站点还计算全市场横截面、行业相对百分位以及股息/回购收益率等指标)。
  • 负的PE/PB/PS值被剔除(即亏损期不计入百分位池)。
  • 新股上市数据不足约1年时,百分位显示为 NaN
  • 数据仅供研究/教育用途,不构成投资建议,不保证无数据缺口或第三方数据错误。

许可与完整数据

  • 代码以 MIT许可证 发布;样本数据来源于第三方市场数据,仅供参考用途。
  • 完整数据集(US / HK / A股市场,每周更新,3Y/5Y/10Y/20Y × 市场/行业百分位矩阵)及交互图表,详见:https://www.getstockcheck.com
搜集汇总
数据集介绍
Sample historical valuation-percentile dataset for top 50 US & HK stocks 数据集图片
构建方式
该数据集是StockCheck平台公开的估值历史百分位样本,聚焦于美股和港股市场中按市值排序的前50大上市公司。构建过程依托Postgres数据库,通过脚本export_valuation_sample.py提取股票代码及其经清洗的估值历史记录,并依据滚动窗口算法计算每周PE、PB、PS值相对自身历史数据的百分位排名。样本时间跨度长达20年,对亏损期间产生的负值予以剔除,确保指标解释的一致性。对于上市时间不足一年的新标的,其估值百分位以缺失值NaN表示,直至积累足够历史数据。数据以CSV格式存储,包含市场、代码、名称、计算日期及三项估值指标及其对应的20年百分位字段,结构清晰且便于分析。
特点
该数据集的核心特色在于采用简化的因果滚动窗口计算方法,将单只股票当前估值与自身历史分布对比,有效剥离市场整体波动影响,凸显个股估值在其历史轨迹中的相对位置。数据集仅覆盖头部50家企业,保障了样本的代表性与数据密度,同时每周更新频率兼顾了时效性与稳定性。此外,开放的最小化依赖脚本read_stock_history.py支持单股历史查询与可视化,为用户提供了低成本的数据探索入口。尽管样本规模有限,但数据质量严格把控,排除负值并标注新上市标的的缺失情况,充分考量了金融数据异质性特征,适用于教学与研究场景。
使用方法
该数据集的使用方法简洁直观,用户可借助内置脚本进行个股估值历史回溯,例如通过read_stock_history.py输入股票代码查询特定标的的PE/PB/PS及其多年百分位走势,并可选择绘图功能直观呈现估值变化。对于希望深入探索的研究者,export_valuation_sample.py支持从自有数据库重新生成样本,允许调整市值排名数量与时间跨度,且通过环境变量或.env文件安全配置数据库凭据,不包含硬编码密码。数据文件直接加载至Pandas等工具即可分析,结合百分位数值可快速识别估值高低点,为进一步研究提供了基础工具。该数据集同时作为StockCheck完整数据产品的预览,完整版涵盖更广泛市场与多维度百分位矩阵,并持续更新,用户可据此拓展深度分析场景。
背景与挑战
背景概述
该数据集由StockCheck项目于近年创建,旨在提供美国及中国香港市值前50大上市公司的历史估值百分位样本数据。其核心研究问题在于如何通过滚动窗口方法,计算市盈率、市净率及市销率相对于个股自身历史分布的百分位排名,以辅助投资者识别估值偏离程度。该数据集不仅揭示了跨市场、跨时间维度的估值动态,还为金融计量与量化投资领域提供了标准化的参照基准,对推动估值分析方法的透明化与可复现性具有重要意义。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两个层面。在领域问题层面,核心难题在于估值百分位的时效性与因果性——需要确保历史窗口计算不引入未来函数,同时处理亏损期间负值指标的剔除,以及次新股因历史数据不足导致的百分位缺失。在构建过程中,挑战则集中于多源市场数据的清洗与对齐,包括不同交易所代码格式的标准化、公司市值排名变动导致的样本动态调整,以及跨20年时间跨度中数据质量与连续性的保障。此外,如何在简化公开样本与生产级计算引擎之间维持方法一致性,也是持续面临的考验。
常用场景
经典使用场景
该数据集汇集了美国与香港市值前50大上市公司长达二十载的市盈率(PE)、市净率(PB)与市销率(PS)历史估值及相应滚动百分位,为量化金融研究提供了丰富的历史估值基准。其典型应用场景聚焦于个股估值纵向对比分析,研究者可借此剖析特定股票当前估值水平在自身历史区间内的相对位置,从而判别其是否处于历史性高估或低估区间。此数据集尤为适配于因子投资策略的回测、均值回归理论的实证检验以及市场有效性假说的探究。
解决学术问题
在金融经济学与资产定价的学术探索中,该数据集有效攻克了长期估值时序数据获取困难与股票间估值横截面比较失真等问题。凭借跨市场、长时域、高频率的标准化估值指标及其历史百分位,它助力学者精准刻画个股估值的动态演化路径,深入审视估值回归的时序特征。此数据集极大推动了关于估值指标预测能力、市场情绪代理变量有效性及跨市场统一定价模型构建的研究,为行为金融学中的锚定效应与过度反应假说提供了坚实的数据支撑。
衍生相关工作
经由该数据集的启发与赋能,一系列极具影响力的衍生科研工作得以展开。研究者借助其长跨度百分位序列,开发出融合估值分位的多因子模型,显著提升了横截面股票收益的预测精度。在人工智能与金融交叉领域,该数据成为训练深度学习时序预测模型(如Transformer架构特征工程)的优质语料,催生了探究估值惯性效应的经典论文。此外,围绕数据揭示的估值极端现象,派生出关于市场异常轮动、行业估值拥挤度的系统系实证研究,丰富了市场微观结构理论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务