遇见数据集

india-index-options-1m

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

该数据集提供印度国家证券交易所(NSE)和孟买证券交易所(BSE)主要指数现货及期权链的1分钟OHLCV(含未平仓合约)柱状数据。数据涵盖NIFTY、BANKNIFTY和SENSEX三个核心指数,时间范围约为2021年至2026年。数据集主要用于支持开源TradeMarkk回测器的开发与运行,强调仅限教育用途,不提供任何担保,建议在使用前与官方交易所数据进行核对。数据结构分为两部分:指数现货数据存储在index/{SYMBOL}.parquet文件中,包含各指数的1分钟OHLC数据;期权数据存储在options/{SYMBOL}/{EXPIRY}.parquet文件中,包含各期权合约的1分钟OHLC数据,并额外包含行权价、期权类型和到期日等字段。数据字段包括时间戳(印度标准时间,带时区信息)、开盘价、最高价、最低价、收盘价、交易量、未平仓合约数、交易日和标的符号,期权数据还包含行权价、期权类型和到期日。需要注意的是,期权数据覆盖范围有限,流动性较差或远月行权价的合约数据可能稀疏或缺失。

This dataset provides 1-minute OHLCV (including open interest) bar data for the spot and option chains of major indices from the National Stock Exchange (NSE) and Bombay Stock Exchange (BSE) in India. It covers three core indices: NIFTY, BANKNIFTY, and SENSEX, with a time range approximately from 2021 to 2026. The dataset is primarily intended to support the development and operation of the open-source TradeMarkk backtesting tool, emphasizing educational use only, without any warranty, and it is recommended to verify against official exchange data before use. The data structure is divided into two parts: index spot data is stored in index/{SYMBOL}.parquet files, containing 1-minute OHLC data for each index; option data is stored in options/{SYMBOL}/{EXPIRY}.parquet files, containing 1-minute OHLC data for each option contract, with additional fields such as strike price, option type, and expiry date. Data fields include timestamp (Indian Standard Time, with timezone information), open, high, low, close, volume, open interest, trading day, and underlying symbol, with option data also including strike price, option type, and expiry date. It should be noted that option data coverage is limited, and data for contracts with poor liquidity or distant strike prices may be sparse or missing.

创建时间:
2026-06-14
原始信息汇总

数据集概述:India Index & Options - 1-minute OHLC

  • 数据集名称: India Index & Options - 1-minute OHLC
  • 许可证: CC-BY-NC-4.0(仅限非商业用途)
  • 语言: 英语
  • 标签: 金融、期权、印度、NIFTY、BANKNIFTY、SENSEX
  • 时间范围: 约2021年至2026年
  • 数据用途: 教育目的,不提供任何担保,使用前需与官方交易所数据核对

数据内容

  • 指数现货数据:

    • 文件路径: index/{SYMBOL}.parquet
    • 覆盖指数: NIFTY、BANKNIFTY、SENSEX
    • 频率: 1分钟OHLC(开盘价、最高价、最低价、收盘价)
  • 期权合约数据:

    • 文件路径: options/{SYMBOL}/{EXPIRY}.parquet
    • 覆盖品种: NIFTY、BANKNIFTY、SENSEX的期权链
    • 频率: 1分钟OHLC
    • 额外字段: 行权价(strike)、期权类型(option_type)、到期日(expiry)
    • 注意: 流动性较差的远期合约数据可能稀疏或缺失

数据结构(Schema)

所有数据文件均包含以下字段(期权数据额外包含行权价、期权类型、到期日):

字段 说明
timestamp 时间戳(IST时区,带时区信息)
open 开盘价
high 最高价
low 最低价
close 收盘价
volume 成交量
open_interest 未平仓合约量
trading_day 交易日
symbol 交易品种代码

其他说明

  • 数据集用于支持开源回测工具 TradeMarkk(访问地址:https://thetrademarkk.com)
  • 期权数据覆盖不完整,非活跃或远月合约的条带可能稀疏或缺失
搜集汇总
数据集介绍
india-index-options-1m 数据集图片
构建方式
本数据集以印度国家证券交易所与孟买证券交易所的核心指数为标的,系统收录了NIFTY、BANKNIFTY及SENSEX三大指数现货及相应期权链的1分钟频率OHLCV+OI数据。构建过程中,数据覆盖自2021年至2026年的历史区间,采用高精度时间戳(印度标准时间带时区信息)对齐每一分钟的开盘价、最高价、最低价、收盘价、成交量及未平仓合约量。期权数据进一步依据合约的行权价、期权类型与到期日进行细致划分,并存储为独立的Parquet文件,以提升数据读取与检索效率。数据集整体服务于开源回测平台TradeMarkk,旨在为量化交易研究提供结构化、标准化的分钟级市场快照。
特点
该数据集的首要特色在于其对印度三大主流指数及其期权链的分钟级细粒度刻画,兼顾了现货与衍生品市场的同步性。每条记录均包含完整的OHLC四价、成交量与未平仓合约量,其中期权合约还额外标注行权价、看涨/看跌类型及到期日,为进行波动率曲面分析、套利策略回测及期权定价模型验证提供了丰富维度。需要指出的是,数据集对流动性较差的远期或虚值期权覆盖有所局限,部分合约可能因交易稀疏而缺失,这反映了真实市场中数据可得性的固有特征。数据集采用CC-BY-NC-4.0许可协议发布,仅限教育用途,用户在使用前应自行与交易所官方数据核对。
使用方法
研究者可通过Python或R等数据分析工具直接读取Parquet格式文件,利用`pandas`或`polars`等库高效加载指数现货数据(`index/{SYMBOL}.parquet`)与期权合约数据(`options/{SYMBOL}/{EXPIRY}.parquet`)。进行回测时,建议按照时间戳索引对齐多品种数据,利用期权字段筛选特定行权价与到期月合约。由于部分非活跃期权数据稀疏,预处理阶段需对缺失值进行填充或剔除。本数据集已内置于TradeMarkk开源回测框架中,用户亦可使用该框架直接调用数据进行策略模拟。务必注意,此数据仅供学术研究,不可作为实际交易决策的绝对依据。
背景与挑战
背景概述
在金融衍生品市场研究中,高频数据是量化分析、策略回测与风险管理的重要基础。India Index & Options 1-minute OHLC数据集由TradeMarkk开源回测平台于2021年至2026年间构建,聚焦于印度国家证券交易所(NSE)和孟买证券交易所(BSE)的核心指数现货及期权链,涵盖NIFTY、BANKNIFTY、SENSEX等关键标的。该数据集以分钟级OHLCV+OI(开盘价、最高价、最低价、收盘价、成交量、未平仓合约)形式呈现,填补了印度指数期权领域高质量、标准化高频公开数据的空白,为金融工程与市场微观结构研究提供了可复现的基准资源,尤其推动了对新兴市场期权定价、波动率曲面及流动性模式的实证探索。
当前挑战
该数据集所解决的领域问题在于,印度期权市场长期缺乏统一、易获取的高频结构化数据,使得量化研究者难以在可控环境下进行策略回测与风险分析。构建过程中面临多重挑战:首先,原始行情数据来自非标准化的交易所接口,需进行复杂的清洗与对齐,例如处理合约到期时的滚动及异常交易记录;其次,期权链覆盖存在显著稀疏性,非流动性或深度价外合约的分钟级数据大量缺失,导致样本偏差;最后,数据验证成本高昂,研究者须依赖官方交易所数据双重校验,否则噪音可能扭曲回测结论,这进一步限制了数据集的即插即用性。
常用场景
经典使用场景
在金融时间序列分析与量化交易研究领域,高频数据是洞察市场微观结构与价格发现机制的宝贵资源。该数据集包含了印度国家证券交易所(NSE)与孟买证券交易所(BSE)旗下三大核心指数——NIFTY、BANKNIFTY与SENSEX——的现货及期权链的1分钟OHLCV(含未平仓合约量)数据,时间跨度覆盖2021年至2026年。其最经典的使用场景在于为期权定价模型、波动率曲面建模以及高频交易策略的回测提供细粒度、高保真的市场数据基础。研究者可借助该数据精确考察股指期权市场在不同到期日与执行价格下的量价动态,从而深入探究市场流动性、套利机会与价格效率等核心议题。
解决学术问题
该数据集精准回应了新兴市场金融研究中长期存在的数据壁垒问题。由于印度衍生品市场在交易量上已跻身全球前列,其独特的市场微观结构——如订单簿深度、期权隐含波动率形态及日内价格行为——为验证和完善经典金融理论提供了绝佳的实验场。借助此数据,学者得以有效解决以下学术难题:1)检验期权的无套利定价边界在真实日内交易中的有效性;2)量化分析股指期权市场中的投资者情绪与交易行为对价格发现的影响;3)构建更为精确的日内波动率预测模型。其意义在于,通过提供高度颗粒化的时刻数据,填补了新兴市场高频金融研究的数据空白,为理论模型的实证检验提供了强有力的支撑。
衍生相关工作
依托该数据集,金融科技领域已孕育出一系列值得关注的衍生工作。最引人注目的是其直接驱动的开源回测引擎TradeMarkk,该平台通过集成此数据,为全球研究人员提供了一个标准化、可复现的回测环境,降低了进入印度衍生品量化研究的门槛。受此启发,已有研究团队基于该数据集开发了基于深度学习的期权隐含波动率曲面预测模型,用以捕捉跨到期日的动态模式。同时,一些工作聚焦于数据清洗与插值算法的改进,旨在处理该数据集中流动性较差合约的稀疏问题,从而生成了更为平滑且可用于高精度定价的修正数据集。这些衍生工作不仅丰富了金融时间序列分析的方法论工具箱,更推动了印度金融科技生态系统的开放与协作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务