遇见数据集

Melady/TSAIA

收藏
Hugging Face2025-09-09 更新2025-05-31 收录
官方服务:

资源简介:

TSAIA是一个专门为时间序列分析和多项选择题任务设计的教学评估数据集,包含两个子集:analysis_questions和multiple_choice。analysis_questions子集包含904个样本,每个样本包含问题ID、问题类型、任务的自然语言描述、嵌入式时间序列数据、执行变量定义、参考答案或目标输出、任务上下文以及输出格式或变量命名的约束等字段。multiple_choice子集包含150个样本,字段信息与analysis_questions类似,但多了选项和正确答案。

TSAIA is an instructional assessment dataset specifically designed for time series analysis and multiple choice tasks, containing two subsets: analysis_questions and multiple_choice. The analysis_questions subset includes 904 samples, with fields such as question ID, question type, natural language description of the task, embedded time series data, definition of executor variables, reference answer or target output, context of the task, and constraints on output format or variable naming. The multiple_choice subset contains 150 samples, with similar fields to analysis_questions but also including options and correct answers.

提供机构:
Melady
搜集汇总
数据集介绍
Melady/TSAIA 数据集图片
构建方式
TSAIA数据集的构建源于对大型语言模型在时间序列分析中复杂推理能力的系统性评估需求。研究团队在调研了20余篇学术文献后,提炼出33种真实世界任务范式,涵盖从约束感知预测到阈值校准异常检测等多元场景。数据集通过动态可扩展的问题生成器构建,支持随新数据集或任务类型的引入而持续扩充,确保了基准的科学严谨性与实践相关性。最终形成包含904个分析问题样本与150个多项选择样本的两个子集,每个样本均包含问题标识、自然语言任务描述、嵌入的时间序列数据、执行变量定义及参考答案等结构化字段。
特点
该数据集的核心特色在于其任务异构性与评估的精细化设计。它首次将大型语言模型定位为时间序列AI助手进行系统性评测,任务类型覆盖从简单预测到需要组合推理与多步分析的工作流,如带有约束条件的预测和阈值校准异常检测。针对不同任务,数据集采用定制化的成功判定标准与推理质量指标,而非统一的评估尺度,从而实现对模型能力的精准刻画。此外,数据集结构清晰,分析问题与多项选择两种格式并行,为模型提供了从开放式生成到封闭式选择的多元评估维度。
使用方法
使用TSAIA数据集需遵循一套完整的实验流程。首先,从GitHub克隆配套代码仓库并基于提供的YAML文件创建Conda环境。随后,在安全配置文件中设置所需大语言模型的API密钥。数据获取通过克隆HuggingFace仓库完成,并运行脚本将原始CSV数据转换为Pickle格式以加速加载。实验执行时,针对分析问题与多项选择子集分别调用不同的Python脚本,通过指定模型ID(如GPT-4o)和问题数据路径启动评估。该流程确保了从数据准备到模型推理的端到端可复现性。
背景与挑战
背景概述
TSAIA(Time Series AI Assistant)数据集由美国南加州大学Melady实验室的叶文、刘金波等研究团队于2025年创建,旨在评估大语言模型(LLMs)在时间序列分析中的复杂推理能力。随着LLMs在自然语言处理领域取得突破性进展,将其应用于时间序列这一结构化时序数据的分析任务成为新兴研究方向。该数据集通过系统梳理20余篇学术文献,提炼出33种真实世界的任务范式,涵盖约束感知预测、基于阈值校准的异常检测等需要组合推理与多步骤分析的挑战。TSAIA的问世填补了LLMs在时间序列领域缺乏综合性评估基准的空白,为衡量模型在金融、工业等实际场景中的时序分析效能提供了严谨标准,对推动领域特异性适应方法的发展具有里程碑意义。
当前挑战
TSAIA所解决的领域核心挑战在于LLMs对时间序列数据进行复杂推理的局限性,传统模型难以理解时序数据的动态依赖关系与上下文约束,导致在组合式多步骤分析任务中表现不佳。构建过程中面临多重困难:首先,需要从海量学术文献中系统提取多样化的真实世界任务,确保科学严谨性与实践相关性;其次,任务异构性要求设计针对性的成功准则与推理质量指标,避免单一评估标准失真;此外,动态可扩展的问题生成器需兼容持续新增的数据集与任务类型,这对架构的灵活性与鲁棒性构成考验;最后,统一评估协议下多模型对比揭示的流程组装能力不足,凸显了领域适应方法论缺失的瓶颈。
常用场景
经典使用场景
TSAIA数据集的核心应用场景在于评估大语言模型作为时间序列智能助手的复杂推理能力。该基准精心设计了904道分析题与150道选择题,涵盖从约束感知预测到阈值校准异常检测等33项真实世界任务。研究者通过向模型提供嵌入时间序列数据的自然语言提示、执行变量定义及输出约束,系统性地考察LLM在多步时间序列分析工作流中的表现。这一设计使得TSAIA成为首个严格评估LLM在时间序列领域进行组合推理与多步分析的标准化测试平台。
解决学术问题
该数据集直面当前学术界对LLM在时间序列分析中复杂推理能力认知匮乏的困境。通过系统梳理20余篇学术文献并提炼33项真实任务,TSAIA填补了领域内缺乏严谨评估基准的空白。其核心贡献在于揭示了现有顶尖LLM在组装多步时间序列分析工作流时存在的显著局限性,为学界指明了当前模型在领域特异性适应方面的根本不足,从而推动了针对时间序列推理的专用方法论研究。
衍生相关工作
TSAIA数据集的发布催生了一系列围绕LLM时间序列推理能力的研究工作。其论文《When LLM Meets Time Series》作为奠基之作,系统评估了八种主流LLM在该基准上的表现,揭示了模型在多步推理中的关键缺陷。后续工作可沿两条路径展开:一是开发专门针对时间序列任务的推理增强框架,二是基于其动态可扩展的题目生成器构建更丰富的任务变体。此外,该基准为对比不同LLM在时序分析中的领域适应能力提供了标准化参照,促进了模型架构优化的相关探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务