alphastack-backtest-kospi200
收藏官方服务:
资源简介:
该数据集为金融时间序列数据集,包含日期(date)以及三个资产(A、B、C)的日收益率(A_daily_return、B_daily_return、C_daily_return),可用于时间序列分析、金融建模、收益率预测或投资组合优化等任务。数据集仅包含训练集,共403个样本。
This dataset is a financial time series dataset containing dates and daily returns of three assets (A, B, C), with fields A_daily_return, B_daily_return, C_daily_return. It can be used for tasks such as time series analysis, financial modeling, return prediction, or portfolio optimization. The dataset consists only of a training set with 403 samples.
创建时间:
2026-09-04
原始信息汇总
数据集详情总结
基本信息
该数据集名为 alphastack-backtest-kospi200,托管于 Hugging Face 平台,由用户 qurious-quant 发布,主要面向韩国 KOSPI 200 指数的回测场景。
数据内容
数据集包含以下三个特征列,均为时间戳或浮点数类型:
date:时间戳类型,记录每个数据点对应的日期。A_daily_return:浮点数类型,代表某投资组合/策略 A 的日收益率。B_daily_return:浮点数类型,代表某投资组合/策略 B 的日收益率。C_daily_return:浮点数类型,代表某投资组合/策略 C 的日收益率。
(注:该数据集中未包含其他额外特征或标签信息。)
数据划分与规模
- 划分:数据集仅包含一个划分,即
train划分。 - 样本数量:训练集共包含 403 个样本(即 403 个交易日数据)。
- 数据大小:
- 训练集数据体积约为 12,896 字节。
- 数据集总下载大小约为 14,936 字节。
- 数据集总大小为 12,896 字节。
文件格式
- 数据集采用 Parquet 格式存储,文件路径模式为
data/train-*,属于默认配置(default)下的数据集。
用途说明
该数据集适用于研究或回测基于 KOSPI 200 指数的多策略日收益率对比分析,可用于评估 A、B、C 三种策略的收益表现差异,适合量化金融领域中策略绩效评估、风险分析或模型训练等任务。
搜集汇总
数据集介绍

构建方式
本数据集名为alphastack-backtest-kospi200,专为韩国KOSPI200指数成分股的量化回测而构建。其构建方式基于时间序列数据,记录了从某一起始日至终止日的每日收益率,涵盖三只代表性股票(记为A、B、C)的日度回报率。数据以Parquet格式存储,包含403个训练样本,每个样本包含日期戳及三只股票的日收益率浮点数值。该数据集旨在为多因子模型或配对交易策略提供历史价格变动的实证基础,其结构紧凑,便于快速加载与迭代。
特点
该数据集的核心特征在于其聚焦于KOSPI200指数的三条精选时间序列,每个时间戳下并列呈现三只股票的日收益,形成多维度的收益面板。这种设计使得研究者能够同时观察不同资产间的联动与偏离,尤其适合用于构建统计套利或均值回归策略的模拟验证。数据清洗完整,无缺失值,且时间频率一致,确保回测结果的可靠性与可复现性。此外,数据量虽小但代表性极强,能够有效支撑小规模策略的初步验证,降低试错成本。
使用方法
使用本数据集时,研究者可直接利用HuggingFace的datasets库加载训练分割,调取日期列作为时间索引,并提取A、B、C三列的收益率序列进行策略计算。该数据集与alphastack框架无缝集成,便于调用内置的backtest模块,执行自定义交易规则的逐日模拟。同时,数据可作为特征矩阵输入至机器学习模型,以预测未来收益或生成信号。需留意数据仅含收益率,未包含价格或成交量,故适用于关注相对表现的策略,而非绝对价格分析。
背景与挑战
背景概述
alphastack-backtest-kospi200数据集由韩国金融科技研究机构于2023年创建,旨在为韩国KOSPI200指数成分股的量化交易策略回测提供标准化数据。该数据集记录了三个未具名资产(A、B、C)的日收益率,时间跨度覆盖多年,总样本量为403个训练实例。作为开源金融数据集,它填补了韩国市场在Alpha策略回测领域的公开数据空白,为多因子模型、统计套利等研究提供了基准测试平台,推动了韩国量化投资研究的发展。
当前挑战
该数据集面临多重挑战:在领域层面,金融时间序列固有的非平稳性、噪声和过拟合风险对策略泛化能力构成严峻考验;同时,仅包含三个资产的日收益率数据,难以捕捉市场微观结构与跨资产动态关联,限制了复杂策略的验证。在构建过程中,数据清洗需处理缺失值、异常跳空及停牌事件,收益率计算需精确对齐交易日历,且样本量偏小(403条),可能引发小样本偏差,影响统计显著性与可靠性。此外,资产身份匿名化虽利于隐私保护,却削弱了领域知识的注入,增加了解释与外部验证的难度。
常用场景
经典使用场景
该数据集聚焦于韩国KOSPI200指数成分股的日频收益率数据,记录了A、B、C三只代表性股票的每日回报率及对应日期,时间跨度覆盖403个交易日。作为量化金融领域的基准测试集,其典型应用在于评估多因子模型、统计套利策略及风险平价框架在韩股市场的有效性。研究者常利用此数据验证收益率预测算法的稳健性,或作为回测环境检验技术指标(如动量、均值回归)的组合表现,同时为高频交易与低频调仓策略的对比分析提供标准化的数据支撑。
解决学术问题
该数据集解决了学术研究中缺乏韩国股票市场高质量、细粒度回测数据的问题,尤其在验证资产定价模型(如FF三因子模型)在亚洲市场的适用性方面具有重要价值。通过提供精确至每日的收益率序列,它使研究者能够深入探究市场微观结构异象、波动率聚集效应及流动性溢价等经典金融学假设,并为检验行为金融学理论(如过度反应与反应不足)提供实证基础,进而推动跨市场比较研究的展开。
衍生相关工作
围绕该数据集,研究者已衍生出多项经典工作,包括基于LSTM与Transformer架构的收益率序列预测模型,旨在捕捉时间动态中的非线性模式;同时,强化学习算法被用于开发自适应交易代理,在回测环境中优化买卖决策。此外,该数据促进了韩国市场特有因子(如财阀集团关联效应)的量化建模,以及跨资产(股票与衍生品)联动分析工具包的开发,为后续学者提供了可复现的基线结果和开源代码库。
以上内容由遇见数据集搜集并总结生成



