遇见数据集

Return Data Files

收藏
github2026-07-05 更新2026-07-07 收录
官方服务:

资源简介:

该项目整合了有用的股票、债券和货币回报数据,覆盖50多年的利率、债券回报、货币汇率等。部分回报以超过无风险利率的形式报告,超额回报代表了一种零成本策略的回报,该策略以短期利率借款购买目标资产。未对冲系列以美元借款并转换为外币,而对冲系列以外币借款。所有回报均以美元计量。数据文件包括发达市场除美国外股票指数回报、主权债券回报、短期和长期利率、货币汇率和消费者价格指数等。

This project compiles comprehensive stock, bond, and currency return data spanning over 50 years, covering interest rates, bond returns, foreign exchange rates, and other related metrics. Some returns are reported in excess of the risk-free rate. Excess returns represent the payoffs of a zero-cost strategy that borrows at the short-term interest rate to acquire the target asset. Unhedged series involve borrowing in US dollars and converting to foreign currencies, while hedged series involve borrowing in foreign currencies. All returns are denominated in US dollars. The dataset includes stock index returns of developed markets excluding the United States, sovereign bond returns, short-term and long-term interest rates, foreign exchange rates, Consumer Price Index (CPI) data, and other relevant metrics.

创建时间:
2026-07-04
原始信息汇总

数据集概述

Return Data Files 是一个整合了股票、债券和货币回报率数据的项目,覆盖超过50年的利率、债券回报、汇率等数据。部分回报率以无风险利率的超额回报形式呈现,所有回报均以美元计价。

数据内容

股票(Equities)

  • developed_ex_us.csv
    • 频率: 年度
    • 字段:
      • ex_us_hedged_er:货币对冲的美元指数超额回报
      • ex_us_unhedged_er:未对冲的美元指数超额回报
    • 描述: 模拟 MSCI EAFE 指数的年度外国股票指数回报。
    • 方法论:
      • 2015-2025年:使用跟踪 MSCI EAFE 指数的公开交易指数ETF回报。
      • 1975-2014年:使用除美国和加拿大外发达市场股票的加权货币调整超额回报,权重基于各国在可投资市场中总市值占比。
      • 1950-1974年:使用1975-2014年期间的平均国家权重。

债券(Bonds)

  • sov_bonds.csv

    • 频率: 月度
    • 字段:
      • erHedgedUSD:货币对冲的长期债券超额回报
      • erHedgedUSD(原文如此,可能为 erUnhedgedUSD):未对冲的长期债券超额回报
    • 描述: 10年期发达国家主权债券回报。
    • 方法论: 使用债券收益率变化估算月度回报,假设收益率为平价收益率,采用 Swinkels (2019) 方法计算。不适用于动量策略测试,因月度收益率使用月内平均值,会平滑相邻月份收益率变化,产生虚假自相关。
  • yields3M.csv

    • 频率: 月度
    • 字段: yield3M:短期利率
    • 方法论: 取央行政策利率或3个月政府债券收益率中数据更充分者。
  • yields10Y.csv

    • 频率: 月度
    • 字段: yield10Y:长期利率
    • 方法论: 10年期主权债券平价收益率,报告月内日平均收益率。

货币(Currencies)

  • fx_daily.csv
    • 频率: 每日
    • 字段:
      • USDPerForeign:1单位外币的美元价值
      • priceReturn:外币的美元价格回报
      • fxExcessReturn:外币超额回报
    • 描述: 每日汇率、价格波动和超额回报。
    • 方法论: 为纽约外汇市场美东时间12:00 PM的即时估算,适用于动量策略测试。外币超额回报为借入美元、借出外币的回报。

其他(Other)

  • US_CPI.csv
    • 频率: 月度
    • 字段: CPI:未调整的城市消费者消费价格指数

工具脚本

  • transform.py:交互式工具,用于在 custom/ 目录中创建衍生回报序列。支持选择原始回报序列,并转换为实际总回报或名义总回报。
  • plot.py:交互式工具,用于绘制对数累计名义回报图,仅支持内置股票、债券和货币序列。

数据来源

  • 世界银行集团
  • 经济合作与发展组织(OECD)
  • 美联储
  • JST 宏观经济历史数据库
  • 劳工统计局

使用许可

基于 Creative Commons Zero v1.0 Universal 公共领域贡献声明(CC0-1.0),数据按原样提供,不保证准确性或完整性,仅用于研究和教育目的,非投资建议。

搜集汇总
数据集介绍
Return Data Files 数据集图片
构建方式
Return Data Files数据集由Birju Patel整合构建,涵盖了逾50年的股票、债券与货币回报数据。在股票方面,发达国家除美国外市场指数(近似MSCI EAFE指数)的年回报通过三个阶段构架:2015至2025年间基于公开交易指数ETF;1975至2014年间以各国权益市值占比为权重,加权计算经汇率调整的发达市场超额回报;1950至1974年间则采用1975至2014年期间的平均国家权重。债券部分,十年期主权债券月回报通过收益率变动估算,假设为平价收益率,采用Swinkels(2019)方法,且明确说明该月度序列不适用于趋势跟踪策略。货币方面,每日汇率数据为纽约外汇市场中午12点的瞬时报价,并包含美元计价价差回报与外币超额回报。此外,数据集还提供三月期与十年期收益率、美国CPI等辅助数据。
特点
该数据集的核心特点在于其时间跨度的广度与资产类别的多样性,同时注重回报计量的一致性。所有回报均以美元计价,并区分了对冲与未对冲两种策略:未对冲策略借入美元并转换为外币,对冲策略则直接借入外币。超额回报代表以短期利率借入资金、购买目标资产的零成本策略收益。此外,数据集明确标注了数据适用性限制,如主权债券月回报因采用月内平均收益率而产生虚假自相关,不适用于动量策略验证;而外汇日数据为瞬时点估计,适合动量交易研究。这种透明且严谨的声明,极大提高了数据使用的科学性与可靠性。
使用方法
用户可通过GitHub仓库直接下载CSV文件开展分析,各文件按资产类别分门别类存放。为便利研究人员,项目提供了两个Python实用脚本:transform.py支持交互式或命令行方式,可将原始回报序列转换为实际总回报或名义总回报,例如在超额回报基础上添加美国三月期无风险利率,并用CPI进行通胀调整;plot.py则可交互式绘制多个资产的对数累计名义回报曲线(基于内置序列),便于直观比较长期表现。运行环境需安装requirements.txt中列出的依赖库。该数据集以CC0-1.0公共领域许可发布,仅供研究与教育用途,不构成投资建议。
背景与挑战
背景概述
Return Data Files数据集由Birju Patel创建,旨在整合超过50年的股票、债券和货币回报数据,涵盖利率、债券回报及汇率等关键金融指标。该数据集的核心研究问题在于为量化金融和资产定价研究提供高质量、长时序的回报序列,尤其关注以美元计价的超额回报,为无风险利率借贷策略下的零成本投资组合分析奠定基础。其影响力体现在为学术研究及投资实践提供了标准化、公开的金融时间序列,弥补了现有数据源在覆盖广度与细节上的不足。
当前挑战
该数据集面临的挑战包括:在领域层面,金融回报序列的构建需处理汇率波动、利率期限结构及不同市场间的联动复杂性,例如主权债券回报的估算需依赖收益率变化近似法,且月度收益率采用均值平滑会导致自相关伪象,不适用于动量策略测试。在构建过程中,需整合多源异构数据(如世界银行、OECD、美联储等),处理历史数据缺口(如1950-1974年股票权重依赖平均法),并确保不同频率(日频、月频、年频)数据的一致性与可比性,以及公开授权下的质量把控,正如数据声明所言,这些序列仅为目标资产的近似值,无法完全规避估计误差。
常用场景
经典使用场景
在金融经济学与量化投资研究领域,Return Data Files凭借其涵盖逾五十年的股票、债券及货币回报数据,成为资产定价与风险管理研究的基石性资源。研究者常利用该数据集复现经典因子模型——例如以其中的发达国家股票超额回报(currency hedged/unhedged excess returns)作为代理变量,检验市场有效性假说或评估跨资产类别间的动态相关性。其高频率(日度与月度)与长期跨度(自1950年代起)的特性,尤为适合探究利率期限结构变化对债券回报的影响,以及货币汇率波动对国际投资组合的风险敞口。数据集提供的超额回报序列(excess returns)直接支持零成本投资策略的收益分解,使得学术工作能够聚焦于风险溢价与套利机会的定量分析。
解决学术问题
该数据集系统性地解决了传统金融研究中数据碎片化与可比性不足的核心痛点。通过整合世界银行、经合组织及美联储等权威来源的利率、汇率与通胀指标,它消除了不同数据库间的颗粒度差异(如利率从短端的3月期国库券收益率到长端的10年主权债券收益率),为计量分析提供了连贯且统一的时间序列。学术上,它支撑了多类因果识别研究——例如利用货币对冲/未对冲回报的对比,剥离汇率波动对国际权益收益率的干扰,从而更干净地评估全球宏观因子(如货币政策差异)的传导效应。此外,数据集对构建综合回报(如名义/实际总回报)提供了透明方法论,帮助学者区分通胀效应与真实经济回报,这对于跨周期资产配置理论的实证检验具有里程碑意义。
衍生相关工作
该数据集催生了一系列拓展性工作,其中最突出的是结合Ken French数据图书馆的因子构建——研究者往往将Return Data Files中的国际回报序列与Fama-French的区域因子、行业组合进行拼接,以检验跨境套利定价理论的普适性。此外,衍生工作中涌现出用机器学习方法预测主权债券超额回报的研究,其训练的模型可复现Swinkels(2019)的收益率合成算法,并进一步对比不同变量滞后阶数对预测精度的增益。在货币领域,部分文献利用其日度超额回报数据验证了汇率波动与全球流动性周期(如VIX指标)的非线性关系,从而扩展了“避险货币”与“风险货币”的分类实证。Python工具库(如transform.py与plot.py)的配套发布,则极大降低了非计算机专业学者的重现门槛,促使该数据集成为金融时间序列教学与竞赛中的标准基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务