遇见数据集

MMTT-Bench

收藏
arXiv2026-09-10 更新2026-09-14 收录
官方服务:

资源简介:

MMTT-Bench是新加坡国立大学构建的合成多模态时间序列与文本注释基准数据集,旨在为信息论指标评估提供真值可控的测试平台。该数据集以正弦波信号为基础,随机插入恒定值平直段(约占30%时间轴),并为每个时间点生成正确、错误和无关三类文本注释。通过完全可控的生成过程,数据集确保了注释与未来信号的真实信息含量已知。它主要用于多模态时间序列预测领域,解决现有实际数据无法验证互信息估计器准确性的关键瓶颈,助力研究者筛选有益文本、评估融合策略,从而提升预测模型的鲁棒性与可解释性。

MMTT-Bench is a synthetic multimodal time series and text annotation benchmark dataset developed by the National University of Singapore, designed to provide a ground-truth-controllable testbed for evaluating information-theoretic metrics. Built upon sinusoidal signals, the dataset incorporates randomly inserted constant-value flat segments that occupy approximately 30% of the total timeline, while generating three categories of text annotations including correct, incorrect and irrelevant for each time point. Through a fully controllable generation process, the dataset ensures that the true information content of both the annotations and future signals is fully known. Primarily used in the field of multimodal time series forecasting, MTTT-Bench addresses the critical bottleneck where existing real-world data cannot verify the accuracy of mutual information estimators, helping researchers screen beneficial text, evaluate fusion strategies and thereby improve the robustness and interpretability of forecasting models.

提供机构:
新加坡国立大学
创建时间:
2026-09-10
原始信息汇总

MMTT-Bench 数据集概述

基本信息

  • 数据集名称:MMTT-Bench
  • 许可证:CC-BY-4.0
  • 语言:英语(en)
  • 数据集规模:1K<n<10K

标签

  • 多模态(multimodal)
  • 融合(fusion)
  • 文本(text)
  • 时间序列(time-series)

数据配置与划分

  • 配置名称:default
  • 数据文件划分
    • 训练集(train):train.json
    • 验证集(validation):val.json
    • 测试集(test):test.json
搜集汇总
数据集介绍
MMTT-Bench 数据集图片
构建方式
在文本与时间序列多模态预测领域,文本标注是否真正贡献预测信息长期缺乏可验证的基准。MMTT-Bench的构建以正弦波为基础信号,随机嵌入约占总时长30%的恒定值片段,形成信号自身无法提供预测信息的过渡区域。每个时间点依据底层信号的已知未来状态生成正确、错误与无关三类文本标注,其中错误标注在70%的点位描述相反方向,并随机混入与正确语料等量的过渡模板,使其与正确文本在词汇层面不可区分。信号按时间顺序划分为训练、验证与测试三段,标注点以四分之一周期为间隔稀疏采样,整个生成过程完全可控,因而每条标注的真实信息含量精确可知。
特点
该数据集的核心特征在于其提供了现成的信息论真值。由于数据生成过程完全受控,研究者可精确知晓每条标注对未来信号的信息贡献,从而首次在文本-时间序列多模态设定下对互信息估计器进行有原则的评估。三类标注构成语义上可排序的质量谱系,配合信号中平线过渡区与振荡区的交替结构,使文本成为过渡点的主导预测来源。标注模板在正确与错误语料间保持相同的句法多样性,无关文本仅描述周期、有界性等全局属性,避免了词汇线索被估计器利用。数据集规模适中,训练集含1279个标注点,兼顾了估计器样本需求与稀疏采样的现实性。
使用方法
MMTT-Bench的使用围绕预训练诊断与标注审计展开。研究者可在训练下游模型之前,对每个标注类别计算条件互信息及各类信息论量,包括边际互信息、联合互信息与文本的独特贡献,以此判断文本融合是否值得投入。该基准支持对KSG、MINE、InfoNCE、CCA、PID与V-information六种互补估计器的系统比较,并可用于选择文本编码器、主成分维度与回看步数等表示管线参数。在混合语料审计任务中,条件互信息估计值可作为语料质量评分,筛选出使下游预测误差最优的标注组合。配套代码与数据集已在GitHub与HuggingFace发布,生成脚本支持信号噪声注入与时间抖动等扰动实验的复现。
背景与挑战
背景概述
多模态时间序列预测通过融合数值信号与自然语言标注,被寄望于借助文本语境提升预测精度,然而文本是否真正携带预测价值长期缺乏原理性检验手段。新加坡国立大学的Emma Andrews与Gianmarco Mengaldo于2025年前后创建MMTT-Bench,这是首个面向文本—时间序列多模态预测的信息论度量评估基准。该数据集以受控正弦波信号搭配正确、错误与无关三类标注,使信息含量先验已知,从而突破真实数据无法提供真值的根本障碍。其核心问题在于互信息估计器能否可靠识别标注质量并预测下游性能,为多模态预测的标注审计与融合选择奠定方法论基础。
当前挑战
该基准所应对的领域挑战在于,现有多模态时间序列数据集均无法提供互信息真值,估计器评估只能依赖人工判断,形成循环依赖,且文本经嵌入降维后引入表征瓶颈,使估计偏差与方差难以分离。构建过程中的挑战则体现为须设计语义正确、错误与无关三类标注,并令错误文本在词汇层面与正确文本不可区分,仅靠与时序的配对关系携带反向信息,同时需在维度约简、回看步长与标注点规模间取得平衡,以规避KSG等估计器在弱信号与高维条件下的失效,并确保结论在真实数据上具有可迁移性。
常用场景
经典使用场景
在多模态时间序列预测领域,文本标注常被默认视作预测增益的来源,然而其真实信息含量往往无从验证。MMTT-Bench 以受控合成的方式构建了正弦波信号与三类文本标注(语义正确、语义错误、语义无关)的配对数据,使每一处标注所承载的关于未来信号值的信息量在生成阶段即被精确知晓。凭借这一先验真值,研究者得以在无需依赖人类主观判断的前提下,系统地评估 KSG、MINE、InfoNCE、CCA、PID 与 V-information 六类互信息估计器能否正确识别并排序不同质量的文本标注。该基准因而成为文本-时间序列多模态场景下开展信息论度量实证研究的经典试验台。
实际应用
在真实的预测工程实践中,从业者往往在未经验证文本标注质量的情况下贸然开展昂贵的模型训练,导致无关甚至误导性文本被融合进模型而侵蚀预测性能。MMTT-Bench 所验证的条件互信息估计流程可作为训练前的标注审计工具,在不训练任何预测模型的前提下筛选出最具预测价值的文本语料,并判别某一领域的文本究竟是与时间戳紧密关联,还是仅提供宽泛的主题性信息。这一能力对公共卫生、能源需求预测、金融风险评估与环境监测等高风险多模态预测场景具有直接的应用价值。
衍生相关工作
MMTT-Bench 的提出推动了多模态时间序列预测中信息论度量的后续研究。其评估结论直接为使用条件互信息作为训练信号的 Multimodal Competition Regularizer 指明了估计器的选择依据与可信条件,也为将互信息用作强化学习中提示与推理链对齐诊断的工作提供了可校准的参照。与此相关,该基准回应了近期关于朴素多模态融合常劣于单模态基线的实证发现,并促使 Time-MMD、FinTexTS 等真实数据集的构建者重新审视文本配对策略与标注质量验证流程,衍生出一系列以对齐对比替代绝对度量值的审计方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务