遇见数据集

TimeSage-MT

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

TimeSage-MT是由多个研究机构联合创建的多轮对话基准数据集,旨在评估智能体在时间序列分析中的推理能力。该数据集包含240个任务和2,680个对话轮次,覆盖8个现实领域,数据来源于65个白名单真实世界时间序列源,通过可复现的生成流程构建。其创建过程涉及数据选择、分析路径规划、对话生成及多层质量控制,确保任务的可验证性和严谨性。该数据集主要应用于评估时间序列智能体系统,旨在解决现有基准在模拟实际分析工作流、多轮交互、跨能力诊断等方面的不足,推动可靠的时间序列决策支持系统发展。

TimeSage-MT is a multi-turn dialogue benchmark dataset jointly created by multiple research institutions, designed to evaluate the reasoning capabilities of AI Agents in time series analysis. This dataset contains 240 tasks and 2,680 dialogue turns, covering 8 real-world domains, with data sourced from 65 whitelisted real-world time series sources and constructed via a reproducible generation pipeline. Its creation process involves data selection, analysis path planning, dialogue generation and multi-layer quality control, ensuring the verifiability and rigor of the tasks. This dataset is mainly used to evaluate time series AI Agent systems, aiming to address the shortcomings of existing benchmarks in simulating actual analysis workflows, multi-turn interactions and cross-capability diagnosis, so as to promote the development of reliable time series decision support systems.

创建时间:
2026-06-01
原始信息汇总
  • 数据集名称:TimeSage-MT
  • 许可协议:Apache-2.0
  • 状态说明:该数据集标注为“即将到来”(Upcoming),暂未提供详细的数据内容、样本或使用说明。
搜集汇总
数据集介绍
TimeSage-MT 数据集图片
构建方式
TimeSage-MT的构建依托于一个端到端、可复现的流水线,将真实世界的时间序列数据转化为多轮对话形式的分析任务。该流水线首先从65个经过许可验证的真实数据源中筛选序列,对其进行80/20的可见/保留数据划分并计算11维特征画像。随后,依据画像约束为每个任务分配复杂度等级、对话长度、用户风格和领域,并构建带有依赖关系的推理图。在对话生成阶段,Claude Opus 4.6基于画像、推理图与技能注册表生成多轮对话,而可验证的答案目标则由确定性提取器通过运行参考代码计算得出,与LLM输出解耦。每个任务均包含分析轨迹、参考代码、数值真值及等级特定的输出要求,并经过46项确定性检查、跨家族LLM审计及人工评审的多阶段质量控制,最终形成240个任务与2,680轮对话的基准数据集。
特点
TimeSage-MT的核心特色在于其对智能体时间序列推理能力的全流程、细粒度诊断。该数据集横跨医疗、能源、金融等8个真实领域,包含4个难度等级——从开放式探索到完整决策路径,覆盖了从简单数据探查到复杂决策推理的分析纵深。每个任务均配备一个包含9项能力的分类体系(如数据读取、方法选择、跨轮记忆、链式依赖、不确定性校准及领域归因),使得评估不仅追踪最终答案的正确性,更能精准定位失败环节。此外,数据集采用了统一的评估协议,能够对数值准确性、事实验证、代码正确性、分析质量及决策质量进行确定性或多维度评分,并支持可复现的公共排行榜,从而暴露当前前沿LLM在记忆保持、不确定性推理和领域决策等环节的持久性缺陷。
使用方法
TimeSage-MT的使用围绕一套统一的评估协议展开,旨在对时间序列智能体进行可复现、可诊断的评测。研究者可将自己的智能体系统接入该基准,使其接收与参考系统相同的多轮用户查询和可见数据切片。评估分为结果追踪和能力追踪两条并行的轨道:前者通过确定性规则(如数值精度、代码正确性)和LLM评判(如分析质量、决策合理性)对最终输出进行打分;后者则通过28项子检查(其中26项为确定性规则)将智能体的推理行为映射至9项能力维度,从而揭示其在不同分析环节的强弱。所有评分均按轮次记录,并支持通过配套的面板进行层级、领域和能力维度的钻取分析。该基准还提供了包含226项分析技能的Skill Library及完整的TimeSage流水线实现,方便研究人员对比不同设置(如直接回答、代码驱动、技能引导与结构化流水线)带来的边际收益。
背景与挑战
背景概述
时间序列分析在金融风控、医疗诊断与能源调度等高阶领域扮演着不可替代的角色,然而现有基准评测多聚焦于单步预测或孤立任务,难以刻画真实分析场景中多轮交互、目标演化及证据累积的复杂流程。为弥合这一裂隙,2026年由牛津大学、埃因霍温理工大学与格里菲斯大学等机构联合发布了TimeSage-MT数据集。该基准围绕智能体时序推理能力,构建了涵盖8个真实世界领域、240项任务及2680轮对话的评测体系,并首创9维度能力图谱,从数据读取、方法选择到领域决策逐层诊断智能体的推理质量。自问世以来,TimeSage-MT已成为评估大语言模型智能体多轮时序分析能力的重要标杆,推动了该领域从碎片化评测向全链路可审计范式的转型。
当前挑战
TimeSage-MT面临的挑战首先源自时序推理本身的多维特性:智能体需在单次会话中同时驾驭数据探查、方法选择、跨轮记忆、依赖链式推理及领域知识落地等多种能力,而现有模型在记忆保持、不确定性校准与领域决策环节表现急剧衰退。其次,构建过程中亦遭遇严峻瓶颈:如何将真实世界时间序列转化为带有可验证答案的多轮对话,既要避免数据泄露,又要确保推理路径的完整性与可复现性,还需过滤幻觉与作弊风险。此外,任务深度从开放探索到完整决策路径逐级跃迁,使得数据选取、推理图构造、自动对话生成及人工质量审核环环相扣,任何环节的偏差都将削弱基准的信度与诊断效率。
常用场景
经典使用场景
在时序数据分析的广阔领域中,TimeSage-MT 最经典的使用场景是作为多轮对话式智能体推理能力的综合评估平台。不同于传统基准仅聚焦于单一的预测、异常检测或分类任务,该数据集通过模拟真实分析师的工作流,构建了从数据初步探索、多技能协同分析、跨证据综合归纳到最终决策制定的完整对话链条。研究者可借助其精心设计的 240 个任务与 2,680 轮对话,系统性地考察智能体在 8 个真实世界领域(涵盖金融、医疗、能源、气候等)中,面对从开放式探索到全决策路径的 4 级复杂度考验时的表现。它不仅是衡量模型时序推理深度的标尺,更是剖析智能体在复杂分析流程中优缺点的显微镜。
衍生相关工作
基于 TimeSage-MT 所揭示的评估框架与实践需求,一系列衍生工作已铺展开来。该基准所定义的 226 项时序分析技能库可被复用与扩展,催生出一类以技能驱动为核心的新型智能体架构,显著提升了分析质量与决策合理性。其所提出的可控对话生成管线与确定性评估协议,为后续构建更具挑战性的多领域、多粒度时序基准提供了可复现的工程范式。更深远地,该数据集暴露出的核心弱点——即智能体在多轮推理中普遍存在的数值精度不足与领域推理薄弱——已直接推动了对自适应编排机制、不确定性校准算法与混合式决策系统等方向的研究浪潮,从根本上重塑了学术界对可靠时序分析智能体的理解与构建方式。
数据集最近研究
最新研究方向
在时间序列分析领域,前沿研究正从单步预测任务转向对智能体在多轮对话中执行复杂推理能力的评估。TimeSage-MT作为首个面向代理式时间序列推理的多轮基准,包含240个任务与2680轮对话,横跨金融、医疗等8个真实领域,覆盖从基础探索到完整决策路径的四个复杂度层级。该基准揭示了当前前沿大模型在决策导向任务上的显著性能滑坡,问题根源集中于跨轮记忆缺失、不确定性量化薄弱与领域决策根基不稳。这一工作为构建可信、可审计的时间序列分析智能体奠定了评测基础,其公开排行榜与可复现评估协议正推动该领域从静态指标竞赛迈向能力导向的系统性诊断。
相关研究论文
  • 1
    TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning牛津大学; 爱因霍芬理工大学; 格里菲斯大学; Squirrel Ai Learning; 华东师范大学; VulpiVox Intelligence · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务