遇见数据集

pairbook-us-stock-etf-correlation

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

PairBook US Stock & ETF Correlation Snapshot 是一个包含美国上市股票和ETF的金融相关性数据集。该数据集提供了4700多只股票和ETF的周回报相关性(基于1年、3年、5年窗口)、年化协方差、相对于SPY的贝塔系数、年化波动率以及ETF持仓重叠度。数据以CSV文件形式提供,包含两个文件:symbols.csv(每只资产一行,字段包括符号、名称、类型、行业分组、3年贝塔、3年年化波动率、1年/3年/5年回报率)和pairs.csv(每对资产一行,共52000多对,字段包括资产A、资产B、1年/3年/5年相关性、3年年化协方差、持仓重叠度)。相关性计算基于周五到周五的周回报皮尔逊相关系数,持仓重叠度基于发行人披露的最小共同权重。数据来源于公开的收盘价和发行人披露信息,并每日刷新。该数据集适用于金融量化分析、投资组合构建、风险管理和相关性研究等场景。许可协议为CC BY 4.0,允许个人、研究和商业用途,但需注明出处(链接回https://www.pairbook.io/)。

PairBook US Stock & ETF Correlation Snapshot is a financial correlation dataset covering US-listed stocks and ETFs. It provides weekly return correlations (based on 1-year, 3-year, and 5-year windows), annualized covariances, beta relative to SPY, annualized volatilities, and ETF holding overlaps for over 4,700 stocks and ETFs. Data is provided as CSV files: symbols.csv (one row per asset with fields: symbol, name, type, industry group, 3-year beta, 3-year annualized volatility, 1-year/3-year/5-year return) and pairs.csv (one row per pair, over 52,000 pairs, with fields: asset A, asset B, 1-year/3-year/5-year correlation, 3-year annualized covariance, holding overlap). Correlations are calculated using Pearson correlation on Friday-to-Friday weekly returns; holding overlap is based on the minimum common weight disclosed by issuers. Data is sourced from public closing prices and issuer disclosures, refreshed daily. The dataset is suitable for quantitative finance analysis, portfolio construction, risk management, and correlation research. Licensed under CC BY 4.0, allowing personal, research, and commercial use with attribution (link back to https://www.pairbook.io/).

创建时间:
2026-08-27
原始信息汇总

PairBook 美股与 ETF 相关性快照数据集

该数据集提供了 4,700 多只美股和 ETF 的周度收益率相关性、年化协方差、贝塔系数、年化波动率以及 ETF 持仓重叠度等信息。数据基于每周(周五至周五)的收益率计算,覆盖 1 年、3 年和 5 年窗口。

数据文件

数据集包含两个配置文件:

配置名称 文件名 内容说明
symbols symbols.csv 每行对应一个资产,包含:代码、名称、类型(股票或 ETF)、分组(行业或 ETF 类别)、3 年期 SPY 贝塔系数、3 年期年化波动率百分比、1/3/5 年收益率百分比
pairs pairs.csv 每行对应一个资产对(52,000+ 对),包含:资产 A、资产 B(按字母顺序)、1/3/5 年相关系数(基于周收益率的皮尔逊相关系数)、3 年期年化协方差(百分比平方)、持仓重叠度百分比(当任一基金未披露持仓时为空)

计算方法

  • 相关性:基于每周(周五至周五)收益率计算的皮尔逊相关系数,覆盖 1/3/5 年窗口。
  • 持仓重叠度:计算各基金披露的持仓组合中,最小公共权重的总和。
  • 贝塔系数:相对于 SPY 的 3 年期贝塔系数。
  • 资产筛选:资产需具备约 10 个月的历史数据;剔除数据过期或价格低于 1 美元的资产。

许可与使用

  • 许可证:CC BY 4.0(知识共享署名 4.0 国际版)。
  • 使用范围:可免费用于个人、研究和商业用途,但需注明来源(链接至 https://www.pairbook.io/ )。
  • 数据来源:来源于公开的日终价格和发行人披露信息。
  • 免责声明:本数据集不构成投资建议。
搜集汇总
数据集介绍
pairbook-us-stock-etf-correlation 数据集图片
构建方式
该数据集是基于PairBook平台实时更新的金融数据构建而成的静态快照,涵盖了超过4700只美国上市股票与ETF的周度收益率相关性、年化协方差、相对SPY的贝塔系数、年化波动率及ETF持仓重叠度等信息。构建过程中,采用Pearson相关系数方法,基于周五至周五的周度收益率序列,分别计算1年、3年和5年窗口期的相关性指标;同时,根据发行人的投资组合披露信息,计算持仓重叠度,即各资产共同权重的总和;贝塔系数则以SPY为基准,基于3年的收益率数据进行估算。为确保数据质量,所有资产需具备约十个月的历史交易记录,并剔除价格低于1美元或数据陈旧、不活跃的序列。数据以CSV格式提供,分别为symbols.csv(资产基本信息及风险收益指标)和pairs.csv(资产对之间的相关性及协方差等指标),覆盖超过52000个资产对,为投资者和研究机构提供了全面而精细的市场关联性视角。
特点
该数据集的核心优势在于其多维度的关联性刻画与广泛的资产覆盖,兼具学术严谨性与投资实务价值。它不仅提供了不同时间窗口(1/3/5年)的相关系数,使研究者能够捕捉短期与长期关联模式的动态变化,还引入了年化协方差和贝塔系数,为资产定价与风险对冲提供了量化依据。ETF持仓重叠度的数据尤为独特,填补了市场上关于基金成分重叠量化研究的空白,有助于深度解析ETF之间的同质化风险。此外,所有指标均基于公开的日线收盘价和披露信息计算,保证了数据的透明性与可复现性。数据集以CSV格式存储,结构简洁,便于直接导入分析工具,且采用CC BY 4.0许可,允许自由使用于学术、商业及个人研究,极大地促进了金融领域的数据共享与创新。
使用方法
使用者可直接从HuggingFace数据集页面加载CSV文件进行数据分析,或通过PairBook官网提供的免费JSON API访问实时数据及完整的计算方法文档。数据集适用于多种金融研究场景,如构建统计套利策略时,可依据pairs.csv中的相关系数筛选高相关资产对,并利用协方差与贝塔系数进行风险中性组合设计;在ETF研究方面,可结合持仓重叠度评估基金产品的差异化特征或潜在的流动性风险。此外,symbols.csv中的波动率与收益数据可用于资产配置与绩效归因分析。数据不构成投资建议,但作为量化分析的基础数据源,其方法论清晰、来源可靠,适合作为学术论文或专业投资决策的参考依据。
背景与挑战
背景概述
pairbook-us-stock-etf-correlation数据集由PairBook平台于近期创建并维护,旨在为金融研究社区提供美国上市股票与ETF之间相关性的高精度快照。该数据集涵盖了超过4,700种资产及52,000多个资产对的周度收益相关矩阵,并辅以年度化协方差、Beta系数、波动率及ETF持仓重叠度等关键指标。其核心研究问题在于揭示跨时间窗口下资产间动态关联结构,为投资组合优化、风险管理及量化策略开发提供数据基础。该数据集通过免费JSON API实时更新,并在CC BY 4.0许可下开放,对金融数据科学领域具有显著的实用价值,促进了可复现的金融实证研究。
当前挑战
该数据集面临的挑战首先在于金融领域的固有复杂性:资产收益相关性随时间非平稳波动,短窗口(如1年)与长窗口(如5年)所得结论可能迥异,为动态风险管理与资产配置带来困难。其次,构建过程中需处理数据质量与完整性问题:资产需经历约十个月的历史数据积累,剔除价格低于阈值的样本,以及处理ETF持仓未完全披露导致的缺失值,这些都增加了数据清洗与验证的复杂性。此外,在计算相关性和协方差时,需确保周度收益的时间对齐及异常值处理,以维护统计估计的稳健性。这些挑战对于维持数据集的准确性和时效性至关重要。
常用场景
经典使用场景
PairBook US Stock & ETF Correlation Snapshot数据集作为金融领域内稀有的横截面相关性与协方差数据资源,其经典使用场景聚焦于量化投资策略的基石——配对交易。研究者可依托该数据集的周度收益率相关性矩阵,识别出具有长期稳定统计关系的股票或ETF对,进而构建均值回归策略。该数据集提供的1年、3年和5年多窗口相关性,使得策略能够适应不同市场周期,规避短期噪声干扰,为统计套利模型的开发与回测提供了坚实的数据基准。
解决学术问题
该数据集直面了金融学术研究中长期存在的痛点:资产间相关性矩阵的获取往往受限于数据供应商的高昂成本与不透明性。它系统性地解决了公开可得的高质量相关性数据缺失问题,使得学者能够验证资产定价理论、考察市场联动性、分析行业间风险传染等核心议题。通过提供标准化的beta(相对SPY)与波动率指标,数据集为风险因子建模和资产配置优化研究提供了便捷的实证分析工具,极大地降低了重复数据清洗的成本,提升了研究的可复现性。
衍生相关工作
该数据集的衍生工作极大丰富了量化金融的实践图谱。其中,最具代表性的方向是基于相关性的网络分析,研究者利用pairwise相关系数构建股票市场的关联网络,进而识别系统重要性节点与社区结构,为系统性风险监测提供了新视角。另一类经典工作是机器学习驱动的配对选择,研究者将相关性特征作为输入,训练分类或排序模型,以自动发现非显性的高概率收敛资产对,推动了配对交易从启发式规则向数据驱动范式的演进。此外,数据集中的beta与波动率指标也被广泛应用于风格因子(如低波动异象)的实证检验,为行为金融理论提供了量化佐证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务