遇见数据集

CPT World-Knowledge Datasets

收藏
github2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

用于无指令持续预训练的数据集包,包含自然文本与单个<ts></ts>占位符对齐的时间序列数据。每个数据集都经过对齐验证,确保文本真实描述配对序列,并涵盖多个领域如制造业、服务业、气候、体育、金融和干旱监测。

A dataset package for instruction-free continuous pre-training, which contains time-series data aligned with natural text paired with a single <ts></ts> placeholder. Each dataset has undergone alignment verification to ensure the text accurately describes the paired sequence, and covers multiple domains including manufacturing, service industry, climate, sports, finance, and drought monitoring.

创建时间:
2026-06-24
原始信息汇总

数据集总览

该仓库名为 CPT World-Knowledge Datasets,是一个面向持续预训练(instruction-free continued pre-training)的数据集集合,每个数据集包含自然语言文本与对齐的时间序列,文本中带有单个 <ts></ts> 占位符。

当前已完成 19 个数据包的构建,每个数据包文件夹内包含 output/ 目录存放开发集样本(通常为 50 条记录,本地有数量上限)。完整的全量运行结果待共享存储就绪后提供。

数据集构成

1. 待审查数据集(非 Defu-30 规范集)

以下 8 个数据包 不属于 Defu 规范 30 个数据集(编号 01–30 的包已通过审查),是独立来源,需要对齐(Alignment)验证,即确认文本是否真正描述了对应的时间序列。

编号 数据集 文本与时间序列配对 对齐等级(已验证) 许可证 审查者标记
49 Richmond Fed Manufacturing 发布叙述 ⇔ 7 个扩散指数 强——数值引用(92% 记录引用了确切系列值) 公共领域 图表密集型 PDF(尽力而为);与 FRED 重叠;文本约 2018 年起
50 Richmond Fed Service Sector 发布叙述 ⇔ 6 个扩散指数 强——数值引用(90%) 公共领域 与 FRED 重叠;文本约 2018 年起
48 Dallas Fed TMOS 发布叙述 ⇔ 7 个扩散指数 数值引用(引用了产量和关键指数的确切数值) 公共领域 2021–23 年空白;与 FRED 重叠;轻微数据波动
45 Cricket Report + Per-Over ESPN 比赛报告 ⇔ 每轮系列数据 强——描述(100% 记录了局分 = cumulative_runs ⚠️ ESPN 版权所有 重新分发需待签署(输出已 git-ignore)
35 Copernicus Climate Bulletin 月度公报 ⇔ 温度异常系列 数值引用——中等(55% 陈述了异常值;其余表述为排名,如“第 2 暖”) Copernicus(免费重用 + 署名) 确认排名类表述是否可接受
47 Philadelphia Fed MBOS 发布叙述 ⇔ 7 个扩散指数 ⚠️ 混合——近期月份引用了确切数值;46/50 条旧记录停留在方向性引导上(符号正确,但无数字) 公共领域 提取缺陷——未捕获旧月份详细段落(确切数值);正在调查;与 FRED 重叠
42 Earnings Calls + SEC XBRL 财报电话会议记录 ⇔ 收入/净收入/EPS ⚠️ 语义性;确切数值部分匹配(34% 确切;口语数字经四舍五入/非 GAAP 与确切 XBRL 不匹配) ⚠️ 电话会议记录来自第三方 数值对应部分匹配;和 SEC EDGAR 重叠;电话会议记录许可问题
31 US Drought Monitor 国家干旱总结叙述 ⇔ D0–D4 区域百分比 ⚠️ 定性“描述”——叙述描述了本周情况,但未引用百分比数值(最弱等级) 公共领域 确认当周共置叙述是否可接受

验证方法:所有 8 个数据集的结构性不变量已通过(每个记录恰好一个 <ts></ts>、非空文本、所有通道都有数据)。对齐性检查针对已提交的输出:对于数值引用型数据集,计算文本引用确切系列值的记录占比;对于板球数据集,检查报告是否引用局分;对于干旱数据集,检查当周叙述的主题对应性。

需要决策的两项

  1. MBOS(47):接受旧月的方向性层级,还是等待提取修复以恢复确切数值段落?
  2. 干旱(31):接受定性当周配对,还是因过于模糊而放弃?

其余六项已通过对齐检查(许可证/重叠问题除外)。

2. 开发集(供审查)

面向格式检查和冻结的小规模样本,每个文件夹内包含 README 和 output/*.jsonl 文件。

编号 数据集 开发样本数 通道数 频率 备注
01 NOAA Storm Events 50 3 1d 州-月为单位 → 28–31 天每日步长
02 NHC HURDAT2 50 5 6h 每场风暴路径,8–70 步
04 TelecomTS 50 5 100ms 128 步窗口 · ⚠️ 异常文本由 GPT 生成,待签署
05 FNSPID 75 6 1d 30 天 OHLCV 窗口 · 包含原始 + 相关性过滤文件(参见文件夹 README)
06 StockNet 50 5 1d 每周 OHLCV(约 5 步)· 推文是第三方文本("real")— 确认标签
07 CDC FluView 358 15 1w 当前流感季窗口(1–52 周,中位约 22)
08 BLS CPI Releases 50 5 1M CPI 发布引用的指数 = 该序列(全项 SA/NSA、核心、食品、能源)
11 EIA Weekly Petroleum 50 6 1W WPSR“亮点”引用原油/汽油/馏分库存、炼厂加工量/利用率、进口量 = 该序列 · 52 周窗口 · 公共领域
24 NOAA SWPC Space Weather 364 18 1d/3h 地磁警报/预报文本 + Kp / A 指数 / 粒子通量通道
25 NOAA NWPS + USGS Flood 50 1 1h 每事件每小时河道水位过程线 + NWS 洪水类别定义及洪峰阶段影响陈述 · ⚠️ 通过阈值语义“描述” · 公共领域
26 ICS-209-PLUS Wildfire 50 3 1d 火灾态势报告叙述 + 每日过火面积/控制率/人员弧线 · CC BY 4.0
31 US Drought Monitor 50 5 1w 12 周窗口 · D0–D4 CONUS 区域百分比 · 叙述 PDF + 统计 API
35 Copernicus Climate Bulletin 117 2 / 2 1m / 1y 2 种记录类型:温度(全球+欧洲,12 月)+ 海冰(北极+南极,跨年本月)
42 Earnings Calls + SEC XBRL 50 3 1q 电话会议记录引用收入/净收入/EPS = XBRL 系列(12 季度窗口)
45 Cricket Report + Per-Over 50 4 1over ESPNcricinfo 比赛报告 + 每轮得分/出局/累计/得分率 · ⚠️ 报告文本版权,重新分发待签署
47 Philadelphia Fed MBOS 50 7 1M MBOS 发布叙述引用扩散指数(24 月窗口)· 公共领域 · 兄弟联储调查 = 单独数据包
48 Dallas Fed TMOS 50 7 1M 德州制造业展望发布引用扩散指数(24 月窗口)· PDF 2007–20 + HTML 2024→(⚠ 2021–23 年空白)· 公共领域
49 Richmond Fed Manufacturing 50 7 1M 第五区制造业发布引用综合指数及子指数(24 月窗口)· 图表密集型 PDF,文本约 2018 年起 · 公共领域
50 Richmond Fed Service Sector 50 6 1M 第五区服务业(非制造业)发布引用收入/需求/就业/薪资(24 月窗口)· #49 的服务业孪生数据包

数据记录格式

开发集使用的 output/*_cpt.jsonl 文件中,每行为一个 JSON 对象,包含以下必填字段:

字段 规则
text 自然语言文本;恰好包含一个 <ts></ts> 占位符
timeseries 通道列表,每个通道包含 {values, unit, freq}
task_type 固定为 "world_knowledge"
text_quality "real"(第一方/官方文本)或 "generated"(标记的合成文本)

freq 约定(紧凑格式) :间隔 + 单位,如 100ms3h6h1d1w/1W1M1q1y1over(必要时包间大小写不同以区分,如 1M 月份与 100ms)。在必填字段后允许添加数据集特定的额外字段(如 geographyseasonreport_url等)。

全量数据规模估算

以下为各数据包在 output.max_records=null(无上限)条件下的全量 CPT 记录估算数据规模,开发集样本已按上述计数设置了上限。两大驱动者为 NOAA Storm Events 和 FNSPID。

编号 数据集 状态 估算数据点(全量)
01 NOAA Storm Events 完成 ~150k(约 10k/年,2010 年起)
02 NHC HURDAT2 完成 ~320 场风暴(2000–23,附带文本)
04 TelecomTS 仅开发集 ~1.3k(小数据集)
05 FNSPID 已构建(完整 HF 管线) ~146k 候选(5k 原始 / 2.7k 过滤采样;可扩展至百万级)
06 StockNet 仅开发集 ~29k(87 只股票 × 约 2 年)
07 CDC FluView 完成(358/558 周) ~558 份周报
08 BLS CPI Releases 已构建(开发集 50) ~389 份月度报告(1994 年起,PDF+HTML)
11 EIA Weekly Petroleum 已构建(开发集 50) ~779 份周报(2011 年起);序列可追溯至 1982 年;公共领域
24 NOAA SWPC Space Weather 仅开发集 ~12.3k(约 10.8k 每日 1996 年起 / 约 1.5k 每周 1997 年起)
25 NOAA NWPS + USGS Flood 已构建(开发集 50) ~10k–40k 次洪水事件(约 2,760 个高影响测站,共 12,756 个;每个测站在约 15 年间多次洪水);公共领域;⚠️ 对齐 = 通过阈值语义“描述”(Charon 签署)
26 ICS-209-PLUS Wildfire 已构建(开发集 50) ~7–10k 次野火事件(1999–2020);CC BY 4.0;每事件一条记录(按态势报告计约 80k)
31 US Drought Monitor 已构建(开发集 50) ~269 份周报(2021 年 5 月起)
35 Copernicus Climate Bulletin 已构建(117) ~120(月度,2021 年起;持续增长)
42 Earnings Calls + SEC XBRL 已构建(开发集 50) ~25k+(电话会议记录 × 12 季度基本面数据);⚠️ 规模化前需确认与 SEC EDGAR 的重叠
45 Cricket Report + Per-Over 已构建(开发集 50) ~1.9k 个 IPT 局次(含报告,所有赛制约 30k+);⚠️ ESPN 文本重新分发待签署
47 Philadelphia Fed MBOS 已构建(开发集 50) ~190 份月度报告(2010 年起);公共领域;⚠️ 需与 FRED 重叠签署。首个联储区域调查(兄弟调查为单独数据包,合计约 2–4k)
48 Dallas Fed TMOS 已构建(开发集 50) ~195 份月度报告(2007–20 PDF + 2024 年起 HTML;⚠️ 2021–23 年空白);公共领域;⚠️ 需与 FRED 重叠签署
49 Richmond Fed Manufacturing 已构建(开发集 50) ~100 份月度报告(文本约 2018 年起;序列可追溯至 1993 年);公共领域;⚠️ 图表密集型 PDF 提取 + 需与 FRED 重叠签署
50 Richmond Fed Service Sector 已构建(开发集 50) ~100 份月度报告(文本约 2018 年起;序列可追溯至 1993 年);公共领域;#49 的服务业孪生数据包(共享管线);⚠️ 需与 FRED 重叠签署

全量合计约为 400k+ 数据点(不含许可证受限的板球数据集),主要由 NOAA Storm Events(~150k)、FNSPID(~146k)和 NWPS 洪水数据(~10–40k)构成,其余数据包合计贡献约 80k。

备注

  • 每个数据包的 README 遵循相同结构:定义 → 规模 → 记录形状 → 关键问题 → 如何运行。
  • 含有 NOTION_PAGE.md 文件的数据包(如 11, 45)附带审查文档。
  • 有关添加新数据集的指引,参见 AGENT_BRIEF.md
搜集汇总
数据集介绍
构建方式
CPT World-Knowledge Datasets 以无指令的持续预训练为范式,构建了19个将自然语言文本与对齐时间序列融合的数据包。每个数据记录包含恰好一个 <ts></ts> 占位符嵌入的文本片段,以及由若干个通道组成的时间序列,每个通道均携带数值、单位和频率信息。数据集来源涵盖官方发布的叙述性报告(如美联储地区制造业调查、NOAA风暴事件报告)、历史记录(如飓风路径、洪水水文图)以及第三方文本(如财报电话会议记录、板球比赛报道)。所有数据均经过结构一致性检验,确保每条记录满足单一时间序列占位符、非空文本和全通道填充的要求。部分非标准数据集进一步通过脚本验证了文本与序列的对齐质量,例如计算文本中精确复述序列值的记录比例,并依据此将对齐分为强数值复述、中度复述或定性描述等层级。
使用方法
使用该数据集时,可直接从各数据包目录下的output/*_cpt.jsonl文件中读取已冻結構化的记录。每条记录为一个JSON对象,包含自然语言文本及对应的时间序列通道列表。文本中必须包含唯一的 <ts></ts>占位符,用于在预训练过程中插入时间序列表示。时间序列按通道组织,每个通道明确标注单位(如百分比、美元、摄氏度)和频率(如1d、1M、1q)。数据集已按频率、数据类型和文本来源分类,用户可根据任务需求选择特定子集,例如经济指标预测可选用美联储调查数据包,自然灾害建模可选用NOAA风暴或洪水事件数据包。对于开发评估,各目录已提供约50至358条不等的样本记录,可直接用于模型冻结测试。全量数据生成需设置output.max_records=null参数以解除记录上限。
背景与挑战
背景概述
CPT World-Knowledge Datasets是由研究团队于近年创建的大规模多模态持续预训练语料库,旨在弥合自然语言文本与对齐时间序列之间的语义鸿沟。该数据集的核心研究问题聚焦于如何在不依赖显式指令微调的情况下,通过蕴含世界知识的自然文本与同步时间序列的联合建模,提升模型对动态现实世界的理解能力。项目囊括了涵盖气象、经济、能源、公共卫生、自然灾害等领域的19个子数据集,其中代表性数据集如NOAA Storm Events(约15万条记录)和FNSPID(约14.6万条记录),为时间序列与文本对齐研究提供了标准化基准。其影响力在于推动了无指令持续预训练范式的可行性验证,并为跨模态知识融合奠定了数据基础。
当前挑战
该数据集面临的核心挑战包括:其一,文本与时间序列的对齐质量参差不齐,如费城联储MBOS数据集中较早期记录仅保留方向性描述而缺失精确数值,导致对齐置信度下降;其二,数据源分布存在时间断点,如达拉斯联储TMOS在2021至2023年间出现文本空白期,破坏了序列连续性;其三,部分数据集受版权限制(如ESPN板球报道)或需第三方授权(如财报电话会议转录文本),限制了数据的开放分发与规模化扩展;其四,不同子集间的对齐验证标准尚未统一,干旱监测数据仅能达到弱语义关联层级,而零售联合会数据则实现了90%以上的精确数值复述,这种异质性为构建统一的跨域对齐评估体系带来了技术挑战。
常用场景
经典使用场景
在自然语言处理与时间序列分析的交叉领域,CPT World-Knowledge Datasets提供了一种创新的多模态预训练范式,其经典用途在于构建能够同时理解文本叙述与对应数值序列演变的通用语言模型。该数据集将真实的新闻报道、官方公报与同步的时序数据(如风暴轨迹、经济指标、疫情统计)以精确对齐的方式封装,每个样本包含唯一的时间戳占位符与多维通道数据。这为训练具备时序推理能力的文本生成模型、零样本时间序列预测模型以及跨模态检索系统提供了标准化基准,尤其适用于处理那些需要从自然语言中抽取定量趋势或进行情境化数值解读的知识密集型任务。
解决学术问题
该数据集系统性地解决了学术界长期面临的多模态时序数据与自然语言耦合不足的困境。在传统研究中,时间序列分析往往孤立于文本语义,而财经公告解读、灾害报告生成等任务又缺乏可用的配准数据。CPT数据集通过严格的对齐验证机制(包括数值重复率检测与语义相关性判定),提供了覆盖气象、金融、能源、公共卫生等领域的20余个高质量子集,使研究者能够首次在统一框架下探索文本-序列联合表征学习。其最重要的学术贡献在于打破了预训练语言模型与结构化时序数据之间的壁垒,为构建具有世界知识感知能力的通用智能体开辟了新路径。
实际应用
在实际产业应用中,该数据集的精妙架构使其天然适配于金融市场的自动化分析流水线。例如,基于费城联储、里士满联储等发布的区域制造业调查报告,模型可同步解析文本叙述中的景气判断与扩散指数的数值变化,实现从公告发布到投资决策的端到端信息抽取。在能源领域,EIA周度石油报告数据则支持原油库存变动的定量解读与供需关系的趋势推演。此外,NOAA的风暴事件与洪水监测时序数据为保险精算、应急响应系统的智能预警提供了从自然语言到物理量值的完整映射通路,直接赋能灾害损失评估与资源调度优化。
数据集最近研究
最新研究方向
当前,CPT World-Knowledge Datasets正引领着无指令持续预训练的前沿探索,通过将自然语言文本与对齐的时间序列数据深度融合,开创性地构建了世界知识图谱与数值流之间的映射桥梁。该数据集尤为关注经济金融、气象气候及灾害应急等领域的实时文本-序列配对任务,例如从地区联储制造业报告或欧元区气候公告中精准抽取扩散指数与温度异常值。与之相呼应的热点事件包括美联储区域调查数据的文本化时序对齐挑战,以及极端天气监测中定性叙事与定量指标的对应问题,这些均彰显了数据集在训练经济预测模型与气候风险评估系统时的关键价值。其提出的价值复述对齐验证机制及跨源许可评估框架,为多模态时序知识注入奠定了新的方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务