遇见数据集

pulseedge-trading-ai-v5

收藏
Hugging Face2026-09-11 更新2026-09-12 收录
官方服务:

资源简介:

PulseEdge Trading AI v5 (categorized lake) 是一个用于金融研究的私有数据集,包含股票和ETF的多频率OHLCV数据(日、小时、15分钟、5分钟、1分钟),以及丰富的辅助数据,包括宏观指标、微观结构、公司文件、基本面信息、挂牌列表、特征面板和纸交易宇宙。数据来源包括Yahoo Finance、Twelve Data、EODHD、Tiingo、Alpha Vantage、Marketstack、StockData、NASDAQ ITCH、FRED、ECB、Fama-French等。数据集以分类文件夹组织(如ohlcv、features、macro、microstructure、filings、fundamentals、listings、processed等),并提供训练/验证/回测拆分(日/小时数据以2025-12-10为截止,2026年回测;低频数据以最后10天为验证)。打包快照显示日OHLCV约4335万行,小时约4537万行,15分钟约1052万行,5分钟约1330万行,1分钟约1675万行。该数据集适用于时间序列预测、表格回归与分类任务,以及金融建模和交易策略研究。

PulseEdge Trading AI v5 (categorized lake) is a proprietary dataset for financial research, containing multi-frequency OHLCV data (daily, hourly, 15-minute, 5-minute, 1-minute) for stocks and ETFs, along with rich auxiliary data including macro indicators, microstructure, company filings, fundamentals, listings, feature panels, and paper trading universe. Data sources include Yahoo Finance, Twelve Data, EODHD, Tiingo, Alpha Vantage, Marketstack, StockData, NASDAQ ITCH, FRED, ECB, Fama-French, etc. The dataset is organized into categorized folders (e.g., ohlcv, features, macro, microstructure, filings, fundamentals, listings, processed) and provides train/validation/backtest splits (daily/hourly data cutoff on 2025-12-10 with 2026 backtest; low-frequency data uses last 10 days for validation). The packaged snapshot shows approximately 43.35 million rows for daily OHLCV, 45.37 million for hourly, 10.52 million for 15-minute, 13.30 million for 5-minute, and 16.75 million for 1-minute. This dataset is suitable for time series forecasting, tabular regression and classification tasks, as well as financial modeling and trading strategy research.

创建时间:
2026-09-11
原始信息汇总

PulseEdge Trading AI v5 (categorized lake)

基本信息

  • 数据集地址: https://huggingface.co/datasets/NickTheCoolst/pulseedge-trading-ai-v5
  • 许可证: apache-2.0
  • 数据规模: 100M < n < 1B
  • 用途: 仅限研究使用,不构成投资建议
  • 资产范围: 仅限股票/ETF,无加密货币

任务类别

  • 时间序列预测(time-series-forecasting)
  • 表格回归(tabular-regression)
  • 表格分类(tabular-classification)

标签

finance、trading、paper-trading、equities、etf、ohlcv、macro、microstructure

数据集概述

Hetzner 存储盒的私有快照,按数据类型拆分。v4 将打包表格放在仓库根目录,其余内容放在扁平的 archives/ 目录下;v5 保留相同的研究数据湖,但文件存放于分类文件夹中。

目录分类

文件夹 内容
ohlcv/packed/ 合并的 Yahoo 行情(1d/1h/15m/5m/1m)以及训练/留出集划分
ohlcv/yahoo/ 按 ticker 组织的 Yahoo 树形结构,按间隔打包的 tar.zst(兼容 CIFS)
ohlcv/hf_1m/ mito0o852/OHLCV-1m 美国 1 分钟月度文件,1992–2026
ohlcv/hf_streams/ Elliott-wave、Twelve Data 世界模型、HF stocks-daily、sebdg/trading_data
ohlcv/vendor/ Twelve Data、EODHD、Tiingo、Alpha Vantage、Marketstack、StockData
features/ 日/周排名面板(fwd_21fwd_5、infer-liquid)及划分
paper/ 模拟交易全集,仅含 Trading212 工具/交易所,清单文件
macro/ FRED、ECB FX、Fama-French / Dartmouth 因子、CBOE、财政部/CFTC 数据包、世界银行
microstructure/ NASDAQ ITCH 存档及解析事件、NOII、FINRA 做空量
filings/ SEC EDGAR、扩展摘录、公告存档及披露
fundamentals/ 财报、内部人交易、期权、报表、新闻
listings/ NASDAQ 目录、Wikipedia 成分股、SEC tickers、T212 工具主表
processed/ 日内训练面板、质量数据包、市场广度

数据划分

  • 日线和小时线: 训练集截至 2025-12-10,含禁运期,2026 留出集从 2026-01-01 开始。
  • 15m / 5m / 1m: Yahoo 历史数据较短,留出集为最后 10 个自然日,而非空的 2026 划分。
  • 不要使用 *_backtest_2026.parquet*_holdout_last10d.parquet 进行训练。
  • 标签列 fwd_* 在构造上会泄露未来信息,需使用净化走步验证(purged walk-forward)。

打包快照统计

  • 1d: 43,351,020 行,1037.1 MB,16577 个标的
  • 1h: 45,372,436 行,1090.4 MB
  • 15m: 10,524,461
  • 5m: 13,304,173
  • 1m: 16,754,134
  • 日线 OHLCV 训练集: 40732299
  • 日线 OHLCV 2026 回测集: 2438411
  • 特征日线 fwd21 训练集: 25393366
  • 构建时间: 2026-09-11T03:42:48.440764+00:00
搜集汇总
数据集介绍
pulseedge-trading-ai-v5 数据集图片
构建方式
PulseEdge Trading AI v5 立足于量化金融研究对多源异构市场数据的整合需求,以分类数据湖的形式重构了原有的研究型数据集。构建过程将股票与ETF的OHLCV行情、宏观经济指标、微观市场结构记录、监管文件及基本面数据按类型归入独立目录,并通过统一的时间戳对齐与符号映射实现跨源数据的可关联性。日频与小时频数据以2025年12月10日为训练截止点,设置禁运期后以2026年全年作为留出集;分钟级数据因Yahoo历史长度有限,改取最后十个自然日作为留出集,避免留出区间为空。所有数据均经过打包与分割处理,并附带训练、回测与留出划分标识,以支持可复现的时序建模流程。
特点
该数据集的核心特征在于其分类存储架构与多粒度时序覆盖。数据湖按ohlcv、features、macro、microstructure、filings、fundamentals及listings等类别组织,涵盖从1分钟至日频的OHLCV行情、FRED与ECB等宏观序列、NASDAQ ITCH微观结构档案以及SEC EDGAR披露文件。打包快照显示日频与小时频分别拥有逾四千万行记录,覆盖超过一万六千个交易符号,分钟级数据亦达千万行量级。特征面板包含前向5日与21日收益标签及流动性推断列,并明确标注前向标签的构造性泄漏风险。数据规模介于一亿至十亿行之间,适用于时间序列预测、表格回归与表格分类等任务。
使用方法
使用该数据集时,研究者应依据任务粒度选择对应目录下的打包文件,并严格遵循预设的数据划分方案。日频与小时频建模须以2025年12月10日前的数据为训练集,跳过禁运期后使用2026年留出集评估;分钟级建模则应以各标的最后十个自然日作为留出区间。训练过程中不得使用文件名包含backtest_2026或holdout_last10d的Parquet文件,亦不可直接以fwd_*列作为输入特征,因其在构造上已引入未来信息。推荐采用净化步行前向验证框架,结合类别目录中的宏观、微观结构及基本面数据构建多模态特征,以提升模型在股票与ETF择时及排序任务中的泛化能力。
背景与挑战
背景概述
金融时间序列预测长期受制于高质量、多模态数据的稀缺,传统研究多依赖单一来源的价格序列,难以复现真实交易环境中的信息复杂度。PulseEdge Trading AI v5 于2026年9月构建完成,作为前版v4的分类化升级,由私人研究团队维护,面向股票与ETF的模拟交易研究。该数据集整合了Yahoo、Twelve Data、EODHD、FRED、SEC EDGAR及NASDAQ ITCH等多元异构数据源,涵盖OHLCV、宏观因子、微观结构与基本面 filings,旨在为量化交易模型提供统一的研究湖泊。其核心研究问题在于如何利用跨源、跨频率的时序面板提升预测稳健性,对金融机器学习社区的数据标准化与可复现性实践具有参考价值。
当前挑战
该数据集所面对的领域问题在于金融时序预测本身的高噪声、非平稳与低信噪比特性,模型极易过拟合历史规律而失效。构建过程中亦面临多重挑战:多源异构数据的时区对齐、频率聚合与符号映射需精细协调;Yahoo高频历史较短,迫使15分钟至1分钟级别采用最后10个自然日作为留出集,而非完整年度切分;标签列 fwd_* 天然泄露未来信息,必须借助净化步进式验证规避;此外,数据规模逾亿行,存储与访问效率对CIFS兼容性提出约束。这些因素共同提升了数据使用与模型评估的复杂度。
常用场景
经典使用场景
在量化交易与金融时间序列预测领域,PulseEdge Trading AI v5数据集凭借其多频率OHLCV数据与丰富的宏观、微观结构特征,成为构建价格方向预测、波动率建模及交易信号生成模型的经典资源。研究者常利用其日频与分钟频的分层存储结构,结合前向收益率标签(如fwd_5、fwd_21),在严格隔离的样本外区间上进行模型训练与回测,以评估选股与择时策略的泛化能力。该数据集对训练集与持有期(holdout)的显式划分,以及分组归档设计,为重复性实验提供了可复现的基础。
解决学术问题
该数据集有效缓解了金融机器学习研究中长期存在的数据泄露与样本外评估偏差问题。通过预设训练截至2025年12月10日、2026年起为持有期的切分方式,并明确标注前向收益率标签的构造性泄露风险,研究者能够在更为严谨的框架下检验预测模型。同时,其涵盖多源供应商数据与微观结构档案(如NASDAQ ITCH、FINRA做空量),使得市场微观结构假说、信息不对称及订单流影响的实证检验获得更充分的观测支撑,推动了金融计量与深度学习交叉领域的可复现研究。
衍生相关工作
围绕PulseEdge Trading AI v5,衍生出一系列经典工作,包括基于其分层存储结构开发的自动化特征工程管道、针对前向收益率标签的净化交叉验证(purged walk-forward)实现,以及结合Elliott波浪与Twelve Data世界模型的多模态预测框架。该数据集还促成了若干基准评测任务,如日频选股排序与分钟级波动率预测,并启发了对样本外回测陷阱的方法论讨论。这些工作共同丰富了金融时间序列预测的实践工具链,并为后续版本的数据治理提供了参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务