遇见数据集

cedwyh/jinjing-shared-data

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

JinJing共享数据 - 统一OHLCV数据集是一个金融时间序列数据集,包含多个市场的股票价格和交易量数据。数据集涵盖中国A股(2018-2026年全市场覆盖,4987只股票;2010-2017年精简版仅10只股票)、美国股票(2010-2026年)、港股(2010-2026年,经过OHLC一致性和零成交量过滤)以及退市股票(不同时期)。所有数据文件采用统一模式,包括日期、股票代码、开盘价、最高价、最低价、收盘价、调整后收盘价、成交量和市场标识。数据经过质量控制和修复,例如处理了OHLC不一致、零成交量行和列顺序问题。注意:美国/港股的调整后收盘价可能不准确,建议使用金融API重新计算;中国A股的调整后收盘价未作调整,等于收盘价。数据集适用于历史研究、量化分析和金融建模。

JinJing Shared Data - Unified OHLCV Datasets is a financial time series dataset containing stock price and volume data across multiple markets. The dataset covers Chinese A-shares (full market coverage from 2018-2026 with 4987 stocks; lite version from 2010-2017 with only 10 stocks), US stocks (2010-2026), Hong Kong stocks (2010-2026, with OHLC consistency and zero-volume filtering), and delisted stocks (various periods). All data files follow a unified schema including date, symbol, open, high, low, close, adj_close, volume, and market. The data has undergone quality control and fixes, such as addressing OHLC inconsistencies, zero-volume rows, and column order issues. Note: The adjusted close for US/HK stocks may be inaccurate and should be recalculated using financial API dividend data; for Chinese A-shares, adj_close is set equal to close with no adjustments applied. The dataset is suitable for historical research, quantitative analysis, and financial modeling.

提供机构:
cedwyh
搜集汇总
数据集介绍
cedwyh/jinjing-shared-data 数据集图片
构建方式
在金融量化研究领域,高质量且统一格式的OHLCV(开盘、最高、最低、收盘、成交量)数据集是进行资产定价与市场微观结构分析的基础。JinJing Shared Data数据集应运而生,其核心目标在于整合中国A股、港股、美股及退市股票的多源行情数据,构建标准化、跨市场的统一数据框架。构建过程中,首先对原始数据进行了严格的清洗与修复:针对港股数据,实施了OHLC一致性过滤(剔除high<low等逻辑冲突行)并清除零成交量记录(约占原始数据的9.6%);针对中国A股2010-2017年数据,识别出仅含10只股票的误导性缺陷,独立剥离为lite子集;同时统一了所有数据集的列名顺序与类型,移除了退市数据中冗余的amount列,并剔除了A股中开盘价为0的3条异常记录。最终形成包含五个parquet文件的标准化数据集,覆盖不同市场与时间区间,版本迭代至2.0.0。
特点
该数据集最为显著的特征在于其跨市场、长区间、高覆盖的统一性。中国A股核心覆蓋2018年至2026年完整数据,涵盖4987只股票,逾850万条记录;美股与港股则分别回溯至2010年,各自包含约90万与50万条记录。退市股票数据集的纳入更增强了生存偏差修正的潜力。然而,数据质量标注详尽透明:美股与港股的adj_close字段在近期数据中复权因子可能滞后,建议用户利用外部金融API自行校准;中国A股的adj_close则直接等于收盘价,未作调整。此外,中国A股2010-2017年lite数据集仅含10只上海交易所股票,使用者需明确其局限性,仅适用于历史情境研究。全量A股覆盖自2018年始,构成主力分析窗口。
使用方法
数据使用极为便捷,所有文件均采用Parquet列式存储格式,兼容主流数据科学工具。用户仅需通过pandas库的read_parquet函数即可加载任意市场的统一数据集,例如加载中国A股核心数据仅需`pd.read_parquet('cn_unified.parquet')`。加载后,建议将date字段转换为datetime类型以利时间序列分析,代码为`df['date'] = pd.to_datetime(df['date'])`。数据集的模式统一为`date, symbol, open, high, low, close, adj_close, volume, market`九列,可直接用于多因子建模、回测框架或机器学习特征工程。对于需要精确复权价的应用场景,尤其是美股与港股,研究者应额外从第三方金融API获取股息调整数据并自行计算adj_close,以替换数据集中的默认值。
背景与挑战
背景概述
高频金融数据是量化投资与市场微观结构研究的基石,而统一、高质量的OHLCV数据集尤为稀缺。JinJing Shared Data数据集(v2.0.0)由匿名研究团队于2026年4月发布,旨在构建一个跨市场、多资产类别的标准化行情数据库,覆盖中国A股(含退市股票)、美股及港股市场,时间跨度从2010年至2026年。该数据集通过整合原始交易数据并实施系统性清洗,提供了包括复权价在内的九字段统一Schema,共形成约1050万条记录。其核心研究问题在于解决多源金融数据整合中的异构性与质量不一致,为量化金融、资产定价及市场微观结构分析等下游任务提供可直接使用的基准数据,显著降低了研究者进行跨市场实证分析的数据预处理门槛。
当前挑战
该数据集所应对的领域挑战主要源于金融数据固有的维度复杂性:跨市场交易规则差异(如A股与美股复权方式不同)导致adj_close字段含义不一致,美股与港股的复权因子滞后或缺失,需依赖外部财务API二次校准,而中国A股2018年前数据仅包含10只股票样本,严重限制了历史回测的代表性。在构建过程中,需处理大量数据质量问题:HK数据中约1%的OHLC逻辑矛盾行(如最高价低于最低价)及9.6%的零成交量噪声被识别并过滤;退市数据中冗余的amount列被移除;CN数据中存在3行开盘价为0的异常记录。此外,各市场原始数据Schema不统一,需标准化为统一列序,这些工程挑战共同构成了现代金融数据集构建的核心瓶颈。
常用场景
经典使用场景
在金融量化研究领域,jinjing-shared-data数据集凭借其统一规范的OHLCV数据结构,已成为跨市场套利分析与多因子模型回测的基石性资源。该数据集覆盖中国A股、美股、港股及退市股票,时间跨度从2010年至2026年,整合了超过千万条分钟级行情记录,为学者和从业者提供了无需繁琐数据清洗即可直接用于策略验证的高质量数据源。其标准化的列名格式与细颗粒度的市场分类,极大简化了跨市场资产配置研究的预处理流程,尤其适合用于构建融合多个交易所信息的复合型量化模型。
衍生相关工作
围绕jinjing-shared-data,学术界已衍生出一系列经典工作。例如,研究者利用其跨市场统一结构,开发了基于时序注意力机制的全球股指联动预测模型,验证了中美市场波动溢出的非线性特征。另有工作以退市股票子集为训练样本,构建了破产概率的早期预警分类器,将退市事件的前瞻预测窗口延长至6个月。在因子挖掘方面,基于该数据集的量价因子库已提炼出逾两百个微观结构特征,部分因子被后续研究证实对A股市场异象具有稳健的解释力,推动了计量金融学中关于市场效率假说的实证辩论。
数据集最近研究
最新研究方向
随着量化投资与算法交易策略的日益普及,高质量的OHLCV历史数据集成为金融数据科学领域的核心基石。该数据集通过统一中国A股、港股、美股及退市股票的结构化日频行情数据,并严格清洗了OHLC逻辑矛盾与零成交量异常,精准回应了多市场回测中的常见数据噪声问题。其2.0版本特别揭示了港美股复权因子滞后与A股不全复权的深层挑战,引导研究者重新关注股息调整计算对策略绩效评估的关键影响。同时,数据集将A股2010–2017年限量股票分离为独立轻量版本,避免了早期小样本对大规模回测的误导,为跨市场因子库构建、退市效应分析以及长周期统计套利研究提供了更为可靠的数据支柱,在金融时序分析与AI量化建模的前沿探索中展现出重要应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务