遇见数据集

JrVillabona/resonance-data

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

每日标准化的宏观、经济、市场、加密货币、链上、DeFi、衍生品和ETF时间序列数据,用于研究和模型训练。

Daily-normalized macro, economic, market, crypto, on-chain, DeFi, derivatives, and ETF time series for research and model training.

提供机构:
JrVillabona
搜集汇总
数据集介绍
JrVillabona/resonance-data 数据集图片
构建方式
Resonance Macro and Market Data 数据集源自 Resonance 数据采集系统,经过系统化的清洗与归一化处理,构建为长格式 Parquet 文件。数据以日频为单位,涵盖宏观经济学、金融市场、加密货币、链上指标、去中心化金融、衍生品及交易所交易基金等多个维度的时序数据。主表文件为 data/train.parquet,内含 813,510 行记录,时间跨度从 1854 年 12 月至 2026 年 6 月,共配置 1,542 个指标符号,实际物化 1,347 个。每条记录包含 symbol、date、OHLCV 值及 source、ticker、category 等元数据字段,对于单值宏观或经济序列,开盘、最高、最低、收盘价相等且成交量为零,确保了数据结构的统一性与兼容性。
特点
该数据集最显著的特点在于其多源异构数据的聚合性与标准化处理能力。它将来自第三方公开数据源的各类时间序列整合为统一格式,便于跨资产类别的研究与建模。数据覆盖范围极为广泛,从传统的宏观经济指标到新兴的链上与 DeFi 数据,均以日频对齐,降低了研究者数据清洗与对齐的负担。此外,数据集提供了丰富的元数据文档,包括 DATA_DICTIONARY.md 与 DATA_CATALOG.md,详细描述了每项指标的来源、单位、物化状态与质量说明,提升了使用的透明度和可复现性。数据以高效的 Parquet 格式存储,支持快速读取与过滤操作,尤其适合大规模时序分析与机器学习模型训练。
使用方法
研究者可通过 Hugging Face Datasets 库便捷加载数据:使用 load_dataset('JrVillabona/resonance-data', split='train') 即可获取训练集,并利用 filter 方法按 symbol 列(如 'BTC')提取特定序列。同时,支持通过 Pandas 直接读取 Parquet 文件,URL 为 hf://datasets/JrVillabona/resonance-data/data/train.parquet,便于纳入自定义分析流程。数据集中每行代表一个符号在某个日期的观测值,用户可根据 date 字段进行时间序列对齐,或依据 category、source 等字段筛选所需子集。此外,USAGE_GUIDE.md 文档提供了详细的加载与对齐指南,帮助用户高效利用数据。需要注意的是,数据集来源于第三方公开数据,商业分发或受监管用途前应核查各上游数据源的使用条款。
背景与挑战
背景概述
Resonance宏观与市场数据集由研究人员JrVillabona开发,生成于2026年6月,旨在为宏观经济与金融时间序列研究提供标准化、高质量的数据资源。该数据集涵盖了宏观经济学、金融市场、加密货币、链上数据、去中心化金融、衍生品及ETF等多个领域,整合了1542个配置符号中的1347个实测序列,时间跨度从1854年12月至今,包含超过81万条记录。其核心研究问题在于解决多源异构金融数据难以统一对齐与建模的困境,通过规范的OHLCV格式与丰富的元数据标签,为量化分析、机器学习模型训练及经济预测提供了重要的基准数据,对计算经济学与金融科技领域具有显著推动作用。
当前挑战
该数据集面临的首要领域挑战是金融时间序列固有的非平稳性与多源数据异构性:宏观经济指标与市场数据频率不一、定义各异,难以在统一时间轴上进行可靠对齐与建模,同时需处理历史数据缺失与异常值的干扰。在构建过程中,挑战集中于数据清洗与标准化:从第三方公开源采集的原始数据存在格式不一致、单位不统一及质量参差不齐的问题,需通过复杂的映射与验证流程确保长期序列的连贯性;此外,涵盖1854年至2026年的超长跨度要求有效应对统计口径变迁与数据回溯性修正的技术难题,而商业使用合规性审查也增加了集成的复杂度。
常用场景
经典使用场景
Resonance宏观与市场数据集为跨资产类别的时间序列研究提供了标准化的数据基石。在宏观经济分析、金融计量、加密货币市场动态以及衍生品定价等学术领域,研究者常利用其每日标准化的OHLCV格式序列,进行多市场联动效应、波动率聚集特征以及风险溢出效应的实证检验。通过简洁的长格式Parquet存储结构与丰富的元数据标注,学者能够高效地索引并对齐自1854年以来涵盖股票、债券、大宗商品、加密货币及链上指标的1347个时间序列,从而在统一的框架下开展跨周期、多频率的量化建模。
衍生相关工作
基于Resonance数据集已衍生出一系列前沿学术与工程工作。在学术界,研究者利用该数据集构建了用于宏观经济预测的Transformer模型,以及融合链上指标与价格序列的加密货币异常检测框架。在工程领域,数据集的标准化格式催生了自动化的多资产因子计算库与可视化仪表盘,降低了金融数据预处理的门槛。此外,数据包中附带的DATA_DICTIONARY与USAGE_GUIDE文档,推动了开放式金融数据基准的建立,为后续同类数据产品的规范化提供了参考范式。
数据集最近研究
最新研究方向
在宏观经济与金融市场交叉领域,resonance-data数据集凭借其涵盖宏观指标、市场行情、加密货币、链上数据、DeFi、衍生品及ETF的长时序标准化数据,正成为量化研究与机器学习模型训练的重要基石。该数据集跨越近两个世纪(1854年至2026年),整合逾1300个符号的日频OHLCV兼容数据,为探究经济周期与资产定价之间的动态关联提供了前所未有的粒度与广度。前沿方向聚焦于利用该多源异构时序数据,构建融合传统金融与数字资产的统一分析框架,以应对金融市场碎片化与加密货币波动性加剧的挑战,推动风险定价、资产配置及宏观预测模型的范式革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务