遇见数据集

ohlcv-750

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

OHLCV多市场股票数据集是一个包含约763只股票每日价格数据的开源数据集,覆盖新西兰(NZX)、澳大利亚(ASX)和美国(S&P 500)三个主要股票市场。数据时间范围为2023年7月14日至2026年7月24日,通过Raspberry Pi 24/7守护进程在每个交易日收盘后自动进行每日增量更新,确保数据的时效性。数据集以Parquet格式存储,包含以下字段:ticker(股票代码,如AAPL、BHP.AX、FPH.NZ)、market(市场标识符,包括US、ASX、NZX)、date(交易日期,格式为YYYY-MM-DD)、open(开盘价,已进行拆分和股息调整)、high(最高价)、low(最低价)、close(收盘价)和volume(日交易量)。该数据集适用于时间序列预测、金融分析、股票市场研究等任务,为研究者和开发者提供了跨市场的标准化价格数据。

The OHLCV Multi-Market Stock Dataset is an open-source dataset containing daily price data for approximately 763 stocks, covering three major stock markets: New Zealand (NZX), Australia (ASX), and the United States (S&P 500). The data spans from July 14, 2023, to July 24, 2026, and is automatically updated incrementally on a daily basis after each trading days close via a Raspberry Pi 24/7 daemon process, ensuring data timeliness. The dataset is stored in Parquet format and includes the following fields: ticker (stock symbol, e.g., AAPL, BHP.AX, FPH.NZ), market (market identifier, including US, ASX, NZX), date (trading date in YYYY-MM-DD format), open (opening price, adjusted for splits and dividends), high (highest price), low (lowest price), close (closing price), and volume (daily trading volume). This dataset is suitable for tasks such as time series forecasting, financial analysis, and stock market research, providing standardized price data across markets for researchers and developers.

创建时间:
2026-07-24
原始信息汇总

数据集名称

OHLCV Multi-Market Equity Dataset

标签

金融、OHLCV、股票、权益、NZX、ASX、S&P500

任务类别

时间序列预测

数据规模

样本数量:100,000 < n < 1,000,000

数据配置

  • 配置名称:default
  • 数据文件
    • 分割:训练集(train)
    • 路径:data/ohlcv.parquet

数据集概览

该数据集包含约763只股票的每日OHLCV(开盘价、最高价、最低价、收盘价、成交量)价格数据,覆盖新西兰(NZX)、澳大利亚(ASX)和美国(S&P500)三个市场。

覆盖范围

  • 市场:ASX(澳大利亚)、US(美国)、NZX(新西兰)
  • 股票代码数量:约763只
  • 日期范围:2023-07-14 至 2026-07-24
  • 更新频率:每日自动增量更新,每个交易日收盘后通过树莓派24/7服务自动完成。

数据模式

列名 类型 描述
ticker 字符串 交易所股票代码(例如:AAPL, BHP.AX, FPH.NZ)
market 字符串 市场标识(US, ASX, NZX)
date 字符串 交易日期(YYYY-MM-DD)
open 浮点数 开盘价(已除权除息调整)
high 浮点数 最高价
low 浮点数 最低价
close 浮点数 收盘价
volume 浮点数 日成交量

使用示例

python import pandas as pd df = pd.read_parquet("hf://datasets/stratos-org/ohlcv-750/data/ohlcv.parquet") print(df.head())

搜集汇总
数据集介绍
ohlcv-750 数据集图片
构建方式
该数据集名为ohlcv-750,专注于金融领域的多市场价格数据构建。数据集汇集了来自新西兰NZX、澳大利亚ASX及美国S&P 500三大市场的约763只股票的日频OHLCV(开盘价、最高价、最低价、收盘价、成交量)数据。数据时间跨度从2023年7月14日至2026年7月24日,通过部署在Raspberry Pi上的24/7自动化守护进程,在每个市场收盘后执行每日增量更新,确保数据时效性与完整性。数据集以Parquet格式存储,包含ticker、market、date、open、high、low、close、volume八个字段,其中价格数据已进行拆股和股息调整。
特点
该数据集的核心特点在于其跨市场覆盖与高频更新机制。覆盖NZX、ASX及S&P 500三个具有代表性的市场,提供了约763只股票的统一数据视图,便于进行跨市场比较与多资产分析。数据通过自动化流水线实现每日收盘后增量更新,保证了时间序列的连续性与新鲜度,适用于量化策略的回测与实时监控。此外,所有价格字段已进行拆股与股息调整,免去了使用者自行处理公司事件的工作,降低了数据清洗的复杂度。数据集规模在10万至100万条记录之间,兼顾了样本量与存储效率。
使用方法
该数据集的使用便捷高效,主要依赖Python生态中的数据分析库。用户可通过pandas库的read_parquet函数直接读取托管在Hugging Face上的Parquet文件,例如执行`pd.read_parquet('hf://datasets/stratos-org/ohlcv-750/data/ohlcv.parquet')`即可加载全部数据。返回的DataFrame包含ticker、market、date、open、high、low、close、volume字段,用户可直接用于时间序列建模、技术指标计算、因子构建或机器学习预测等任务。数据集默认配置为训练集,适用于金融时间序列预测场景,并可通过Hugging Face的Datasets库进行更灵活的流式加载与分片处理。
背景与挑战
背景概述
在高频金融数据日益成为量化投资与市场分析核心驱动的背景下,OHLCV(开盘价、最高价、最低价、收盘价、成交量)时间序列数据的可得性与完整性对构建稳健的预测模型至关重要。由stratos-org团队于近期创建的ohlcv-750数据集,通过部署于Raspberry Pi的24/7持续运行守护进程,实现了对澳大利亚证券交易所(ASX)、新西兰证券交易所(NZX)及美国标普500指数成分股共计约763只股票日频OHLCV数据的自动化每日增量更新,数据时间跨度自2023年7月14日至2026年7月24日。该数据集填补了多市场统一、高时效性日频金融数据集的空白,为时间序列预测、风险建模及跨市场套利策略研究提供了标准化的基准资源。
当前挑战
该数据集所解决的领域核心挑战在于:传统多市场金融数据获取常受限于数据源碎片化、更新滞后及调整不一致问题(如拆股、股息调整),而ohlcv-750通过统一的分红拆股调整规则与自动化增量更新机制,为时间序列预测任务提供了清洁、可比、实时的数据基础。构建过程中面临的主要挑战包括:低功耗设备的数据可靠性保障(Raspberry Pi的持续运行稳定性与网络中断恢复)、多交易所数据格式与传输协议的异构兼容、以及大规模增量更新中的内存与存储管理瓶颈。此外,590天的数据窗口虽保证了短期趋势分析的充分性,但缺乏更长时间维度的历史周期(如跨越牛熊市),可能限制长记忆性金融模型的训练与评估。
常用场景
经典使用场景
在金融时间序列分析领域,OHLCV(开盘价、最高价、最低价、收盘价、成交量)数据是量化研究的基石。ohlcv-750数据集汇集了来自新西兰NZX、澳大利亚ASX和美国S&P500三大市场的约763只股票日频行情数据,跨越2023至2026年的完整交易日窗口。这一多市场、多标的的标准化结构化数据集,天然适配于金融预测模型的训练与评估,尤其适用于股票价格趋势预测、波动率建模以及多市场联动分析等经典任务,为跨市场量化策略的复现与对比提供了统一的数据底座。
实际应用
在实务界,ohlcv-750数据集的价值体现在自动化交易系统与投资决策支持中。其每日自动增量更新的机制,确保模型能够跟随市场节奏持续迭代,这对高频量化基金的信号生成引擎尤为重要。投资机构可利用该数据集训练多因子选股模型,执行跨市场套利策略的回测,或构建基于价格形态识别的技术分析工具。此外,数据集对三大市场的同时覆盖,使风险管理团队能够更准确地评估国际投资组合的地域分散化收益与尾部风险关联。
衍生相关工作
该数据集的发布催生了若干具有启发意义的研究分支。基于其多市场属性,研究者开发了用于验证跨市场动量溢出效应的基准模型,并对比了不同市场微观结构对预测精度的干扰。另有一些工作专注于利用该日频数据重构高频特征,如构建日内波动率代理变量与跳跃检测指标,从而在不增加数据粒度的情况下提升模型对市场突变事件的响应能力。此外,该数据集也被用作对抗样本攻击下的金融预测鲁棒性测试平台,检验价量特征在极端行情中的稳定性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务