mrtan/NLQTSBench-train
收藏资源简介:
NLQTSBench-train 是一个用于自然语言查询和时间序列任务的训练数据集,包含220个任务,这些任务从与NLQTSBench测试集相同的候选池中采样,但通过唯一的id字段与测试集互斥,确保没有重叠。数据集旨在支持Sonar-TS框架的冷启动训练,用于提升方法技能,但不可用于基准测试,因为其任务模板可能与测试集重叠。每个任务包括一个自然语言查询、对应的答案(以字符串和原生Python类型表示)、时间序列数据(CSV格式)以及元数据(如推理级别、子任务类别、评估指标等)。子任务分布涵盖滑动窗口、区间发现、时序定位、全局聚合、因果异常、子序列匹配、上下文异常、洞察合成、周期性检测和形状识别,但复合趋势子任务因候选池已完全用于测试集而缺失。数据集文件包括tasks.json(任务记录列表)和ts_data目录(每个任务对应的时间序列CSV文件)。加载时可通过Hugging Face Hub下载或使用Sonar-TS框架工具。许可证为Apache-2.0。
--- 许可证:Apache-2.0 语言: - 英语 任务类别: - 问答 - 表格问答 标签: - 时间序列(time-series) - 自然语言查询(natural-language queries) - 基准测试 - 训练集 规模分类: - 样本数少于1000 展示名称:NLQTSBench-train --- # NLQTSBench-train 本数据集是 [`mrtan/NLQTSBench`](https://huggingface.co/datasets/mrtan/NLQTSBench) 的训练拆分配套数据集。共包含220条自然语言查询/时间序列任务,其采样自与NLQTSBench测试集相同的候选任务池,随后通过任务`id`进行筛选,确保与测试拆分无交集。 本数据集的设计用途为:针对[Sonar-TS](https://github.com/...)框架开展方法学技能的冷启动训练。**请勿**将该拆分用于基准测试——尽管两个拆分的单个任务`id`无重叠,但该拆分与测试集共享任务模板。 ## 文件结构 NLQTSBench-train/ ├── tasks.json 包含220条任务记录的JSON列表文件 └── ts_data/ └── <id>.csv 对应220项任务的原始时间序列CSV文件(每项任务对应一个文件) ## 字段说明 `tasks.json`中的每条任务记录包含以下字段: | 字段名 | 数据类型 | 字段说明 | |----------------|----------------|-----------------------------------------------------------------------------| | `id` | 字符串 | 唯一任务标识符,例如 `L1_T1_Global_Aggregation_00014`。 | | `level` | 整数(1–4) | 推理层级(对应论文表2)。 | | `level_name` | 字符串 | 可读的层级名称(如`基础操作`等)。 | | `category` | 字符串 | 高阶任务类别(如`原子检索`、`模式识别`等)。 | | `subtask` | 字符串 | 10个子任务标签之一(详见下方统计——无复合趋势任务)。 | | `question` | 字符串 | 自然语言查询,包含预期的答案格式。 | | `answer` | 字符串 | 以字符串形式呈现的标准答案(展示格式)。 | | `ground_truth` | 可变类型 | 原生Python类型的真值(数值/列表/字典)。 | | `eval_metric` | 字符串 | 支持的评估指标之一,包括`rel_acc`、`hit`、`iou`、`set_f1`、`report`。 | | `channel` | 字符串/列表 | 查询所引用的时间序列通道名称。 | | `ts_data_path` | 字符串 | 对应CSV文件在`ts_data/`目录下的相对路径。 | | `meta` | 字典 | 生成元数据(包含模板参数、源数据集信息)。 | 每个`ts_data/<id>.csv`均为宽表,首列为`timestamp`(时间戳),其余列为数值型通道数据。 ## 子任务分布 | 子任务类型 | 数量 | |-------------------------|-----| | 滑动窗口 | 38 | | 区间发现 | 33 | | 时序定位 | 31 | | 全局聚合 | 28 | | 因果异常 | 18 | | 子序列匹配 | 16 | | 上下文异常 | 14 | | 洞察合成 | 14 | | 周期性检测 | 14 | | 形状识别 | 14 | | **复合趋势** | **0** | | **总计** | **220** | **复合趋势子任务未被纳入本数据集**:其候选任务池已被测试拆分全部占用,无可用的无交集任务留存。 ## 与测试拆分的无交集说明 本数据集的任务通过独立随机种子采样得到,随后移除了所有在[`mrtan/NLQTSBench`](https://huggingface.co/datasets/mrtan/NLQTSBench)中出现过的任务`id`。剩余的220个任务`id`与测试集无任何重叠。 ## 加载方法 python from huggingface_hub import snapshot_download # 下载数据集到本地目录 snapshot_download(repo_id="mrtan/NLQTSBench-train", repo_type="dataset", local_dir="NLQTSBench-train") import json, pandas as pd # 加载任务列表 tasks = json.load(open("NLQTSBench-train/tasks.json")) # 加载第一项任务对应的时间序列数据 df = pd.read_csv(f"NLQTSBench-train/{tasks[0]['ts_data_path']}") 若使用Sonar-TS框架,仅需执行以下命令: bash python -m cold_start.download_train_data 该命令会自动拉取本数据集,并在本地`cold_start/train_data/`目录下为每项任务构建SQLite数据库与SAX特征表。 ## 许可证 Apache-2.0,与测试拆分的许可证保持一致。



