TroveLedger
收藏资源简介:
TroveLedger是一个公共金融时间序列数据集,专注于长期积累高质量的日内交易数据。该数据集提供多种时间分辨率(日、小时、分钟)的OHLC(开盘价、最高价、最低价、收盘价)和成交量数据,主要用于机器学习、量化研究和系统交易实验。与许多免费数据源不同,TroveLedger强调数据的连续性,尤其是分钟级数据的积累。数据集结构按类别、符号和时间间隔组织,数据来源于Yahoo Finance,并通过yfinance Python库获取。数据集适用于金融时间序列的机器学习、日内交易研究、OHLC数据的特征工程、需要密集日内历史数据的策略回测等。数据集目前包含来自全球多个主要指数(如S&P 500、EURO STOXX 50等)的成分股数据,并持续扩展中。
TroveLedger is a public financial time series dataset dedicated to long-term accumulation of high-quality intraday trading data. It provides OHLC (Open, High, Low, Close) and volume data across multiple time resolutions including daily, hourly and minute-level, and is primarily intended for machine learning, quantitative research and systematic trading experiments. Unlike most free data sources, TroveLedger prioritizes data continuity, particularly the accumulation of minute-level datasets. The dataset is structured by category, ticker symbol and time interval, and is sourced from Yahoo Finance, acquired via the yfinance Python library. It is applicable to machine learning applications for financial time series, intraday trading research, feature engineering of OHLC data, strategy backtesting requiring dense intraday historical data, and other relevant scenarios. Currently, the dataset includes constituent stock data from multiple major global indices such as the S&P 500, EURO STOXX 50 and others, and is continuously expanding.
TroveLedger 金融时间序列数据集概述
数据集基本信息
- 数据集名称: TroveLedger Financial Time Series Dataset
- 发布者: Traders-Lab
- 语言: 英语
- 许可证: 其他(非商业研究及教育用途)
- 任务类别: 时间序列预测、表格回归
- 标签: 金融、财务、雅虎财经、股票市场、股票、OHLC、时间序列、交易、股票、指数、历史数据、股票数据、市场数据、金融数据、yfinance
数据集内容与结构
- 数据特征:
symbol: 股票代码(字符串)time: 时间戳(Unix 时间,int64)open: 开盘价(float64)high: 最高价(float64)low: 最低价(float64)close: 收盘价(float64)volume: 成交量(int64)
- 数据切分:
daily: 日线数据hourly: 小时线数据minute: 分钟线数据
- 数据规模: 所有代码和分辨率总计超过 4000 万行,规模类别涵盖从小于 1K 到 100M 以下。
- 文件结构:
/data/{category}/{symbol}/{symbol}.{interval}.valid.parquet{category}: 类别(例如equities/us,indices/sp500,indices/eurostoxx50){interval}: 时间间隔(days,hours,minutes).valid后缀表示文件已通过质量检查。
数据集特点与理念
- 核心目标: 专注于长期积累高质量日内数据,强调连续性而非频率。
- 数据差异: 通过持续积累分钟级数据,形成无间断的长历史序列,解决了免费数据源通常只能提供最近 7 天分钟数据的局限性。
- 更新理念: 优先保证累积分钟数据的连续性,不保证每日更新。分钟数据更新最频繁,小时和日线数据保证不早于一周。
数据来源与处理
- 数据来源: 通过
yfinancePython 库从雅虎财经获取。 - 指数成分股: 通过自定义的基于 API 的流程从维基百科页面自动提取。
- 数据处理: 获取日线、小时线和 1 分钟分辨率数据,验证完整性,以 Parquet 格式存储。质量检查会剔除缺口或异常值,仅包含
.valid文件。
覆盖范围与增长
- 初始范围: 从早期初步数据集中继承了约 500 只股票。
- 增长方式: 逐步添加整个指数,覆盖范围将持续增长。
- 近期新增指数:
- 2025-12-24: SMI(瑞士市场指数,20 个成分股)
- 2025-12-23: NIFTY 50(印度 Nifty 50 指数,50 个成分股)
- 2025-12-22: FTSE 100(英国富时 100 指数,100 个成分股)
- 2025-12-19: S&P 500(美国标普 500 指数,503 个成分股)
- 2025-12-18: Hang Seng Index(香港恒生指数,82 个成分股)
- 2025-12-17: EURO STOXX 50(欧洲斯托克 50 指数,50 个成分股)
预期用途
- 主要用途: 训练和评估用于交易策略和自主 AI 机器人的机器学习模型。
- 其他用途: 时间序列分析、金融研究、教育项目、社区驱动的扩展。
- 适用场景: 金融时间序列的机器学习、日内和波段交易研究、OHLC 数据的特征工程、需要密集日内历史的策略回测、探索性量化分析。
限制与注意事项
- 数据新鲜度: 数据通常有几天延迟,非实时。
- 覆盖范围: 并非所有代码都有完整的历史数据,尤其是分钟分辨率或新添加的指数。
- 发展阶段: 数据集正在积极扩展中。
- 非财务建议: 该数据集仅用于研究和教育目的。
- 数据保证: 数据集按“原样”提供,不保证完整性或正确性。
许可与使用
- 许可: 仅限非商业研究和教育用途。
- 再分发: 未经原始数据提供者明确许可,不允许再分发此数据集。
- 完整条款: 参见
LICENSE文件。
引用
如果使用 TroveLedger,请按如下格式引用:
@dataset{Traders-Lab_TroveLedger_2025, author = {Traders-Lab}, title = {TroveLedger Financial Time Series Dataset}, year = {2025}, url = {https://huggingface.co/datasets/Traders-Lab/TroveLedger} }




