遇见数据集

indian-market-historical-ohlcv

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

该数据集是一个针对印度金融市场(包括国家证券交易所NSE和孟买证券交易所BSE)的生产级历史OHLCV(开盘价、最高价、最低价、收盘价、成交量)数据集,通过GitHub Actions每日(工作日)自动更新。数据来源于Yahoo Finance(通过yfinance工具获取)。数据集包含多种资产类型:股票(2383个符号,270.5 MB)、指数(17个,3.0 MB)、交易所交易基金(ETF,17个,2.0 MB)、大宗商品(8个,1.7 MB)和外汇(8个,1.8 MB),总计2433个文件,大小约279.0 MB。每个Parquet文件包含以下字段:交易日期(date)、开盘价(open)、当日最高价(high)、当日最低价(low)、收盘价(close)、调整后收盘价(adj_close,考虑股票分割和股息)、成交量(volume)、股息金额(dividends)、股票分割比率(stock_splits)和股票代码(symbol)。数据集适用于时间序列预测等金融分析任务,每次同步运行会进行数据质量验证,包括检查重复日期、OHLC一致性(如最高价≥最低价)、缺失值、成交量异常和交易日间隙。文件结构按资产类型组织,包含stocks、indices、etfs、commodities、forex等子目录。数据集采用MIT许可证。

This dataset is a production-level historical OHLCV (Open, High, Low, Close, Volume) dataset for the Indian financial markets (National Stock Exchange NSE and Bombay Stock Exchange BSE), automatically updated daily (on business days) via GitHub Actions. The data is sourced from Yahoo Finance (obtained through the yfinance tool). The dataset includes various asset types: stocks (2383 symbols, 270.5 MB), indices (17, 3.0 MB), exchange-traded funds (ETFs, 17, 2.0 MB), commodities (8, 1.7 MB), and forex (8, 1.8 MB), totaling 2433 files with an approximate size of 279.0 MB. Each Parquet file contains the following fields: trading date (date), open price (open), daily high price (high), daily low price (low), close price (close), adjusted close price (adj_close, accounting for stock splits and dividends), volume (volume), dividend amount (dividends), stock split ratio (stock_splits), and stock symbol (symbol). The dataset is suitable for financial analysis tasks such as time series forecasting. Each synchronization run includes data quality validation, checking for duplicate dates, OHLC consistency (e.g., high ≥ low), missing values, volume anomalies, and trading day gaps. The file structure is organized by asset type, with subdirectories including stocks, indices, etfs, commodities, and forex. The dataset is licensed under MIT.

创建时间:
2026-07-04
原始信息汇总

数据集概述

数据集名称:Indian Market Data (NSE/BSE)
地址:https://huggingface.co/datasets/vishnun0027/indian-market-historical-ohlcv
语言:英文
许可证:MIT
标签:金融、股票市场、印度、NSE、BSE、时间序列、OHLCV
任务类别:时间序列预测
大小类别:1M < n < 10M


数据集摘要

  • 总文件数:2,434
  • 总大小:279.1 MB
  • 最后更新:2026-07-07 17:10 UTC
  • 更新频率:每个工作日(每日)
  • 数据来源:Yahoo Finance(通过 yfinance 获取)

资产覆盖

资产类型 数量 大小
股票 2,384 270.6 MB
指数 17 3.0 MB
ETF 17 2.0 MB
大宗商品 8 1.7 MB
外汇 8 1.8 MB

数据模式(Schema)

每个 Parquet 文件包含以下列,记录每日 OHLCV 数据:

列名 类型 描述
date date32 交易日期
open float64 开盘价
high float64 当日最高价
low float64 当日最低价
close float64 收盘价
adj_close float64 复权收盘价(考虑拆分和股息)
volume int64 交易量
dividends float64 股息金额
stock_splits float64 股票拆分比率
symbol string 股票代码

文件结构

├── stocks/ # NSE/BSE 股票数据(.parquet) ├── indices/ # 市场指数数据(.parquet) ├── etfs/ # 交易所交易基金数据(.parquet) ├── commodities/ # 大宗商品期货数据(.parquet) ├── forex/ # 货币对数据(*.parquet) ├── metadata/ # 资产列表与目录 └── sync_status.json # 上次同步时间戳与统计信息


数据质量

每次同步运行时会验证以下方面:

  • 重复日期
  • OHLC 一致性(最高价 ≥ 最低价,边界检查)
  • 缺失值
  • 交易量异常
  • 交易日缺口

使用示例(Python)

python import pandas as pd

加载单个股票

df = pd.read_parquet("hf://datasets/vishnun0027/indian-market-historical-ohlcv/stocks/RELIANCE.parquet")

加载所有股票

from datasets import load_dataset ds = load_dataset("vishnun0027/indian-market-historical-ohlcv", data_dir="stocks")

搜集汇总
数据集介绍
indian-market-historical-ohlcv 数据集图片
构建方式
该数据集基于Yahoo Finance的yfinance库构建,通过GitHub Actions实现每日自动同步,覆盖印度国家证券交易所(NSE)与孟买证券交易所(BSE)的金融数据。数据以Parquet格式存储,包含2384只个股、17个指数、17只ETF、8种大宗商品及8个外汇品种,总大小约279.1 MB。每个文件记录日频OHLCV数据,涵盖开盘价、最高价、最低价、收盘价、调整收盘价、成交量、股息及拆股比率等字段,并经过重复日期、高低价一致性及缺失值等多维度质量校验。
使用方法
用户可通过Pandas直接读取单个股票文件,例如加载RELIANCE公司数据;亦可利用Hugging Face datasets库批量加载整个类别,如所有股票数据。Parquet格式的列式存储特性提升了读取效率,适用于金融时间序列建模与回测场景。数据集以MIT许可证发布,可自由用于学术或商业研究,无需额外授权。
背景与挑战
背景概述
印度金融市场作为新兴经济体的重要组成部分,其股票、指数及衍生品市场的波动性与复杂性吸引了大量量化研究者与投资者的关注。该数据集由研究者Vishnun0027于2024年创建,依托GitHub Actions实现每日自动更新,聚焦于印度国家证券交易所(NSE)与孟买证券交易所(BSE)的金融资产历史行情数据。核心研究问题在于为时间序列预测、风险管理及算法交易等任务提供标准化、高质量的开源数据集。凭借覆盖2434个资产标的、长达近十年的历史OHLCV数据,该数据集在金融时间序列领域填补了印度市场细颗粒度数据的空白,并已成为众多学术研究与工业实践的基础资源,推动了印度市场量化分析的可复现性。
当前挑战
该数据集所解决的领域问题在于金融时间序列预测中高质量历史数据的稀缺性,尤其是印度市场存在数据格式不统一、数据碎片化以及获取成本高昂等痛点。构建过程中面临多重挑战:首先,需从Yahoo Finance等公开源采集数据,但接口限制与数据完整性问题要求严格的数据校验流程;其次,需应对股票拆分、股息调整等复杂事件对价格一致性的影响,确保adj_close字段的可靠性;此外,每日自动更新机制需克服交易日期识别、节假日缺失值填充以及跨资产类型(股票、指数、ETF等)的异构数据处理难题。数据质量验证环节还需兼顾OHLC逻辑校验、异常交易量检测与时间序列连续性维护,从而保证生产级数据的可用性。
常用场景
经典使用场景
在金融时间序列分析领域,indian-market-historical-ohlcv数据集以其全面的印度证券市场覆盖和高质量的OHLCV(开盘、最高、最低、收盘及成交量)数据,成为构建和验证量化交易策略的经典基石。研究者常利用该数据集开展股票价格预测、趋势识别与波动率建模等任务,通过加载个股如RELIANCE的日频数据,训练LSTM、Transformer或XGBoost等模型,以捕捉市场微观结构中的动态模式。其每日自动更新且涵盖2384只股票、17个指数及多种资产类别的特性,为跨资产联动分析和多因子模型提供了实时且标准化的数据源。此外,数据集中包含的调整收盘价、股息和拆股信息,确保了回测历史策略时的无偏性与准确性,使得该数据集在金融学术社区中成为研究印度新兴市场行为不可或缺的基准资源。
解决学术问题
该数据集着力于解决印度金融市场研究中长期存在的数据碎片化与访问壁垒难题。过往学者在开展印度股市实证分析时,常受困于数据获取成本高、清洗流程繁琐以及不同资产类型数据口径不一致等问题,导致研究可复现性低下。indian-market-historical-ohlcv通过提供统一Schema的Parquet格式数据,囊括日线OHLCV、除权调整、股息及拆股等关键字段,显著降低了预处理门槛,使研究者能聚焦于交易信号发现、风险因子剥离与市场效率检验等核心学术问题。其数据质量验证机制(如检测OHLC逻辑一致性、缺失值与成交量异常)进一步保障了结论的稳健性,推动了关于印度市场日历异常、投资者情绪传导及高频微观结构假设等议题的严谨探讨,对深化理解半强式有效市场假说在新兴经济体的适用性具有重要学术意义。
实际应用
在实际金融业务场景中,indian-market-historical-ohlcv数据集为印度本土及全球量化投资者提供了生产级的投研基础设施。资产管理公司可依托该数据集开发自动化交易系统,利用实时追加的日频数据训练股指期货对冲模型或跨市场套利算法,尤其适用于跟踪Nifty 50和BSE Sensex等核心指数的ETF组合管理。金融科技企业则借助其覆盖商品、外汇等多元资产的特性,构建风险预警仪表盘——例如监测黄金与卢比兑美元汇率间的避险联动关系。该数据集每日通过GitHub Actions自动同步的机制,使中小型对冲基金无需自建数据管线即可获得透明、可审计的回溯数据,从而降低运营成本并加速策略迭代。此外,个人投资者也能借助其Parquet格式的高压缩特性,在本地环境中执行高效的历史回测,验证个人投资假设。
数据集最近研究
最新研究方向
该数据集为印度金融市场的时序预测研究提供了高质量、自动更新的OHLCV数据基础,当前前沿方向聚焦于利用深度学习模型(如Transformer、LSTM)与图神经网络捕捉印度NSE/BSE市场中股票、指数、ETF等多资产类别的价格动态与跨市场关联性。结合全球新兴的‘另类数据’与事件驱动交易策略,研究者正尝试融合宏观经济指标与社交媒体情绪,以提升对印度这一高波动新兴市场的收益率预测与风险管理能力。此数据集的持续维护与开源特性,有力推动了量化金融在印度本土的实证分析,并促使全球对比研究关注印度市场与发达市场在微观结构上的差异。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务