遇见数据集

recursive-tsfm-data

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

本数据集是用于Recursive TSFM模型训练的数据,旨在为`ecntu/tiny-recursive-tsfm`项目提供可复现、明确且可审计的采样数据源。数据来源于四个池:gifteval(50万行,来自Salesforce/GiftEvalPretrain)、tsmixup(300万行,来自Chronos的training_corpus_tsmixup_10m)、kernel(60万行,来自Chronos的training_corpus_kernel_synth_1m)和gifteval_trainval(115,639行,来自Salesforce/GiftEval的无泄露历史序列),总规模约421.5万行。所有历史序列均在最早评估区域之前截断,不保留预测标签,多变量目标以独立的单变量历史序列表示,与模型训练约定一致。数据集提供两种标准采样配方:zero_shot配方(混合gifteval、tsmixup、kernel,权重分别为0.60、0.25、0.15)和aligned_20配方(混合上述四个来源,权重分别为0.48、0.20、0.12、0.20)。每个数据源包含一个`series`列,存储变长的float32观测序列。数据集适用于时间序列预测任务,特别是递归时间序列预测模型的训练。数据许可为混合许可,组件来源包括Apache-2.0许可的Salesforce数据和其他许可的Chronos衍生数据,使用前需查阅上游许可声明。

This dataset is designed for training the Recursive TSFM model, aiming to provide a reproducible, clear, and auditable sampling data source for the `ecntu/tiny-recursive-tsfm` project. The data consists of four source pools: gifteval (500,000 rows, from Salesforce/GiftEvalPretrain), tsmixup (3 million rows, from Chronoss training_corpus_tsmixup_10m), kernel (600,000 rows, from Chronoss training_corpus_kernel_synth_1m), and gifteval_trainval (115,639 rows, from Salesforce/GiftEvals non-leakage historical sequences), with a total size of approximately 4.215 million rows. All historical sequences are truncated before the earliest evaluation region, without retaining prediction labels, and multivariate targets are represented as independent univariate historical sequences, consistent with model training conventions. The dataset offers two standard sampling recipes: the zero_shot recipe (mixing gifteval, tsmixup, and kernel with weights of 0.60, 0.25, and 0.15, respectively) and the aligned_20 recipe (mixing the four sources with weights of 0.48, 0.20, 0.12, and 0.20). Each data source includes a `series` column storing variable-length float32 observation sequences. The dataset is suitable for time series forecasting tasks, particularly for training recursive time series forecasting models. The data license is mixed (license: other), with component sources including Apache-2.0 licensed Salesforce data and other licensed Chronos-derived data; users should consult upstream license statements before use.

创建时间:
2026-07-10
原始信息汇总

数据集概述

数据集名称:Recursive TSFM Training Data
数据集地址:https://huggingface.co/datasets/emiliocantuc/recursive-tsfm-data
许可证:其他(组件许可复杂:Salesforce 来源声明 Apache-2.0,Chronos 来源声明 license: other,TSMixup 衍生自真实世界序列,不保证所有组件均为纯合成数据或受 Chronos 代码仓库 Apache-2.0 许可覆盖)
任务类别:时间序列预测
标签:时间序列、预测、合成数据
大小写名称:Recursive TSFM Training Data

数据集组成

该数据集包含四个独立的源池,以 Hugging Face datasets 工件形式冻结,确保采样过程显式且可审计。每个源具有一个 series 列,包含变长 float32 观测序列。多元目标已表示为独立的单变量历史序列,与模型的训练约定一致。

源名称 行数 来源
gifteval 500,000 Salesforce/GiftEvalPretrain
tsmixup 3,000,000 Chronos training_corpus_tsmixup_10m
kernel 600,000 Chronos training_corpus_kernel_synth_1m
gifteval_trainval 115,639 来自 Salesforce/GiftEval 的无泄漏历史序列(截断至所有 GIFT-Eval 项的最早评估区域之前,不保留预测标签)

训练配方

物理行未预混合,由 manifest.json 定义两个规范配方:

配方名称 代码顺序中的源 混合权重
zero_shot gifteval, tsmixup, kernel 0.60, 0.25, 0.15
aligned_20 gifteval, tsmixup, kernel, gifteval_trainval 0.48, 0.20, 0.12, 0.20
  • zero_shot 配方不使用 GIFT-Eval 评估序列的任何历史数据用于训练,但仍包含单独发布的 GiftEvalPretrain 语料库。
  • aligned_20 配方额外引入了无泄漏的历史序列,权重为 0.20。

加载方式

使用 Hugging Face datasetshuggingface_hub 加载。示例代码如下:

python from datasets import load_from_disk from huggingface_hub import snapshot_download

root = snapshot_download( "emiliocantuc/recursive-tsfm-data", repo_type="dataset", ) aligned_histories = load_from_disk(f"{root}/gifteval_trainval")

复现

确切的制备程序包含在 scripts/ 目录下,使用固定内联 uv 环境。运行命令:

bash uv run --script scripts/prep_eval_data.py --context_len 8192 uv run --script scripts/prep_train_data.py

清单文件记录了固定的上游修订版本、行数、数据集指纹、过滤参数以及两个采样配方。报告代码快照为 f1525b35fc70f675c01f3da959d8122739dcdd1c

搜集汇总
数据集介绍
recursive-tsfm-data 数据集图片
构建方式
该数据集专为递归时间序列基础模型(Recursive TSFM)的训练而构建,汇集了四个来源池:包含50万条记录的GiftEval预训练数据、300万条记录的TSMixup数据、60万条记录的Kernel合成数据,以及11.5万条来自GiftEval的无泄漏历史数据。多元目标被转换为独立的单变量序列,以匹配模型训练范式。数据集以Hugging Face Datasets制品形式冻结,确保采样配方的显式性和可审计性。
使用方法
可通过Hugging Face Hub的snapshot_download函数下载完整数据集,并使用load_from_disk加载指定子集,例如gifteval_trainval。每个来源的series列直接提供序列数据。精确的预处理程序位于scripts目录下,基于固定的uv环境运行,并依赖manifest.json记录的分支版本、行数、数据集指纹、过滤参数及采样配方,便于复现实验。
背景与挑战
背景概述
递归时间序列基础模型(Recursive TSFM)训练数据集的诞生,根植于时间序列预测领域对大规模、可控且可复现的训练数据资源的迫切需求。该数据集由Emilio Cantu-C等研究人员创建,作为ecntu/tiny-recursive-tsfm项目的核心实验数据源,旨在解决现有真实世界时间序列数据在版权、混合协议和可审计采样流程上的不足。通过整合来自Salesforce的GiftEval预训练语料、Chronos时序混合库以及核合成数据,该数据集于近期以Hugging Face制品形式冻结发布,为递归预测架构的预训练与微调提供了明确可追溯的采样配方,显著提升了该领域实验的透明性与可复现性,对推动时间序列基础模型的标准化训练流程具有奠基意义。
当前挑战
该数据集面临的核心挑战源于多源异构数据的整合与合规性。领域层面,时间序列预测模型需要从海量、多变的真实及合成数据中学习泛化表征,而现有数据往往存在泄漏风险——如该数据集特别剔除GIFT-Eval评估区域的历史序列以避免训练-测试污染,同时需将多元目标拆解为独立单变量序列以匹配模型训练惯例,这增加了数据预处理与模型对齐的复杂度。构建过程中,数据源的许可协议异构问题尤为棘手:Salesforce语料采用Apache-2.0,而Chronos数据集及TSMixup衍生自真实序列,其许可证标注模糊,导致最终聚合数据需标记为'other',用户在再分发时必须自行核查上游许可,显著提升了合规性管理的门槛与潜在法律风险。
常用场景
经典使用场景
在时间序列预测领域,递归式时间序列基础模型(Recursive TSFM)的训练与评估常常受限于数据多样性不足和泄漏风险。该数据集精心整合了源自GiftEval、TSMixup和Kernel Synth的四个原始数据池,共计超过420万条序列,专为递归式预测架构的预训练而设计。其经典用法在于,研究者可依据预设的零样本(zero_shot)和对齐微调(aligned_20)两种混合配方,灵活抽取合成与真实世界时序数据,从而构建具备强大泛化能力的递归预测器。这种结构化的数据供给方式,不仅确保了训练历史的纯净性,还通过明确的溯源机制,为可复现的时序模型研究奠定了坚实的数据基石。
解决学术问题
该数据集的诞生直指时间序列预测研究中的两大核心困境:一是大规模预训练数据集的匮乏,二是训练与评估数据之间潜在的泄漏风险。通过精心设计的数据池划分和泄漏安全的历史截断策略,它有效解决了模型在真实世界零样本场景下性能评估失真的问题。学术研究可借此深入探索递归式时间序列基础模型在多元异质数据上的预训练效果,明晰合成数据与真实历史对模型泛化能力的贡献边界。这一资源推动了时序预测领域从依赖单一小样本数据集向大规模、可复用、标准化的预训练范式转变,极大促进了零样本与少样本预测理论的实证研究,对构建更稳健、更通用的时间序列智能系统具有深远意义。
实际应用
在实际应用中,该数据集支持的递归式时间序列预测模型可直接服务于金融趋势预测、能源需求规划、物联网传感器监测以及供应链动态调度等关键领域。例如,基于对齐微调配方训练的模型,能够利用目标场景的历史上下文进行快速适配,从而在电力负荷峰谷预测中实现高精度短期预报;而零样本配方则赋予模型在没有任何历史训练样本的新兴场景(如新型传感器部署)中立即提供合理预测的能力。通过混合合成与真实数据,该数据集降低了行业用户对海量高质量历史数据的依赖,使得中小型企业也能借助预训练基础模型快速部署时序分析服务,极大地拓展了时间序列预测技术的落地边界。
数据集最近研究
最新研究方向
递归时间序列基础模型(Recursive TSFM)的训练数据构造与评估方法论正成为时序预测领域的前沿热点。该数据集整合了GiftEval、TSMixup和Kernel Synth三大来源,通过显式记录混合配比和泄漏防护策略,为训练具备零样本泛化能力的递归预测模型提供了可复现的数据基石。其核心创新在于将多元时序解构为独立单变量序列,并通过对齐历史窗口截断技术避免评估泄露,这一设计理念与当前LLM驱动的时序基础模型研究热潮高度契合。随着Chronos等大规模时序预训练模型的兴起,如何构建高质量、无泄漏且具备领域多样性的训练语料库已成为制约模型性能的关键瓶颈。recursive-tsfm-data通过开放四种源池和两种标准化配方(zero_shot与aligned_20),为社区提供了首个可审计的递归时序预测实验基准,有望推动该领域从经验性调参向规范化评估范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务