遇见数据集

TIC-Bench

收藏
arXiv2026-09-02 更新2026-09-04 收录
官方服务:

资源简介:

TIC-Bench是由哈尔滨工业大学与华为诺亚方舟实验室联合构建的深度交织文本-图像上下文基准,旨在评估多模态大语言模型在复杂交织场景中的跨模态推理能力。该基准包含2,280个精心设计的问题,涵盖逻辑关联、时间关联与空间关联三大维度,并进一步细分为八种推理结构,共计45,776张图像与85,145条文本引用,上下文平均长度达309.3个单词。数据集通过构建密集的跨模态引用链,迫使模型在连续交织的文本与图像线索中进行证据整合与多步推理,而非依赖静态感知或语言先验。TIC-Bench专注于解决真实世界应用中文本与图像深度交互的需求,如多模态文档理解、文本-图像协同创作及多视角事件追踪,揭示了当前先进模型与人类专家之间的显著差距,为提升多模态模型的动态推理能力提供了关键分析工具。

TIC-Bench is a deeply interleaved text-image context benchmark jointly developed by Harbin Institute of Technology and Huawei Noah's Ark Lab, which aims to evaluate the cross-modal reasoning capabilities of multimodal large language models (LLMs) in complex interleaved scenarios. This benchmark includes 2,280 meticulously designed questions, covering three core dimensions: logical association, temporal association, and spatial association, which are further subdivided into eight reasoning structures. In total, it encompasses 45,776 images and 85,145 text citations, with an average context length of 309.3 words. The dataset constructs dense cross-modal citation chains, forcing models to conduct evidence integration and multi-step reasoning across continuously interleaved text and image clues, rather than relying on static perception or linguistic priors. TIC-Bench focuses on addressing the demands of deep text-image interaction in real-world applications, such as multimodal document understanding, text-image collaborative creation, and multi-view event tracking. It reveals the significant gap between current state-of-the-art models and human experts, serving as a critical analytical tool for enhancing the dynamic reasoning capabilities of multimodal models.

创建时间:
2026-09-02
原始信息汇总

TIC-Bench 数据集详情

数据集概述

TIC-Bench 是一个用于评估多模态大语言模型(LLMs)在深度交错文本-图像上下文中表现的中等规模基准数据集。其核心目标是测试模型能否在长序列、深度交错的图像与文本之间进行证据的绑定、整合与传播。数据集包含 2,280 道唯一问题,覆盖空间、逻辑和时间三类关联推理。

规模与构成

  • 问题总数:2,280 道
  • 图像实例总数:45,776张,平均每个问题包含 20.08 张图像,每张图像平均被引用 1.86 次
  • 领域分布
    • 逻辑关联(784题):分为线性(260题)、循环(249题)、汇聚(275题)
    • 时间关联(726题):分为顺序(270题)、回溯(226题)、并行(230题)
    • 空间关联(770题):分为地图(385题)、照片(385题)

任务类型说明

  • 空间关联:结合重叠局部裁剪和替换文本线索推断相对方向,涵盖航拍地图与自然照片
  • 逻辑关联:通过线性、循环或汇聚的视觉结构追踪共享对象与文本关系
  • 时间关联:通过顺序、回溯或并行叙事结构追踪身份与事件

发布格式与下载

数据集以 15 个未压缩的 tar 分片形式发布(而非超过 23,000 个独立文件),整体约 19 GiB。每个领域的分片可独立下载,目录结构为 Spatial AssociationLogical Association(10个分片)、Temporal Association(4个分片)。数据包同时提供:

  • manifest.jsonl:每个 QA 记录的元数据(QID、领域、任务类型、问题文件夹、QA 文件名等)
  • dataset_index.json:记录统计、重复 QID 诊断、分片大小与 SHA-256 哈希
  • SHA256SUMS:完整性校验文件

QA 格式说明

  • 空间dataset_caption.jsonl,每行为包含交错序列的 QA 记录
  • 逻辑qa_pairs_*.json,含问题、答案、推理深度、图类型等
  • 时间qa_pairs*.json,含问题、参考答案、推理步骤、故事描述等

数据完整性与一致性

发布集中含 2,280 个唯一 QID。当前时间源中 4 个 QID 各关联两条不同 QA 记录,因此时间领域的物理记录数为 730 而非 726。manifest 保留全部 730 条记录并标记 qid_occurrences,不会静默丢弃任一记录。

评测与责任说明

基准评测覆盖十种多模态 LLM、十五种推理设置:五种开源模型在思考与非思考模式下测试,五种闭源模型使用默认设置。答案由三位独立评估者评判并辅以人工仲裁。数据来源包括 COCO 照片、CVOGL 航拍图、公开影视动画片段及生成场景,使用者需遵守原始素材的版权限制,仅用于研究与评估,禁止基于人物身份推断、监控或个人决策等用途。

搜集汇总
数据集介绍
TIC-Bench 数据集图片
构建方式
TIC-Bench的构建围绕三大关联域展开,旨在模拟真实世界中文本与图像深度交织的上下文。逻辑关联子集通过生成包含5-10个对象的场景序列,利用共享对象和关系构建链式推理;时间关联子集则从影视和动画中提取关键帧,编排为连环画式故事板,对角色身份进行遮蔽以强制跨模态整合;空间关联子集将原始图像切分为重叠的局部视图,并将部分视图替换为基于内容的文字描述,以构建需要空间推断的交错上下文。每个样本包括上下文序列、问题及预先确定的参考答案,并经过严格的人工审核以确保质量和唯一性。
使用方法
使用TIC-Bench时,模型需处理完整的交错文本-图像序列,回答基于上下文的选择题或开放性问题。其支持多种评估设置,包括思考和非思考模式,并采用多裁判自动评估机制以确保评分可靠性。通过模态消融实验,可以检验模型对单模态信息的依赖程度;错误类型分析则帮助定位感知、抽象、推理等环节的具体不足。该基准适用于评测大规模多模态模型在深层交错条件下的推理能力,并为模型开发提供精细化诊断依据。
背景与挑战
背景概述
TIC-Bench由哈尔滨工业大学与华为诺亚方舟实验室的研究人员于2026年提出,旨在填补多模态大语言模型在深度交织图文场景中评估的空白。现有基准多聚焦于单图或多图并行任务,文本往往仅作为指令,缺乏与图像的深层语义互动。TIC-Bench首创性地从逻辑、时间与空间三个核心维度系统构建评估框架,涵盖八种推理结构,包含2280道题目,每样本平均含37.34次图像引用与20.08张图像,远超既有基准。其发布为多模态推理研究提供了高密度交织上下文的评测工具,对推动模型跨模态证据整合能力的发展具有里程碑意义。
当前挑战
TIC-Bench面临的挑战首先体现在领域问题层面:现有模型在处理词图交织序列时,需持续绑定、整合并传播碎片化的视觉与文本线索,而主流预训练语料多为孤立词图对,导致模型易退化为浅层模式匹配或依赖语言先验。构建过程中,需精确设计逻辑、时间与空间关联任务,确保问题无法依赖参数化知识解答。此外,交织上下文的密度与长度(平均文本309.3词)远超传统基准,对模型的长上下文管理与多分支推理能力构成严峻考验,且当前最强模型GPT-5.5准确率仅59.9%,较人类专家的91.7%差距显著,凸显出该领域的深层次挑战。
常用场景
经典使用场景
TIC-Bench作为一项专为深度交织图文情境设计的评估基准,其核心用途在于系统性地衡量多模态大语言模型在逻辑、时间与空间三个维度的关联推理能力。该基准通过构建高度交织的文本与图像序列,要求模型在长达数十个图文片段的上下文中,持续绑定、整合并传播分散的跨模态线索,从而实现对模型深层语义理解与动态推理能力的精准评估。其经典应用场景包括对模型在复杂多模态文档理解、图文协同创作以及多视角事件追踪等真实世界任务中的表现进行标准化测试,填补了现有基准在多图像并行处理与浅层模式匹配方面的评估空白。
解决学术问题
TIC-Bench直面当前多模态评估领域的核心缺失,即现有基准多聚焦于单图像问答或图像平行排列的多图理解,未能深入考察文本与图像在真实场景中高度交织时的联合推理能力。该数据集通过引入每样本平均20.08张图像、37.34次图像引用及309.3词文本上下文的密集交织设计,有效遏制了模型依赖语言先验或参数化知识作答的捷径,迫使模型必须整合视觉与文本证据。其系统化的八类任务结构,覆盖线性、循环、汇聚逻辑,顺序、回溯、并行时间场景,以及地图与照片空间推理,为多模态模型在多分支证据整合、跨模态实体绑定及长程依赖建模方面的能力缺陷提供了量化诊断工具,揭示了当前最先进模型与人类专家间超过30个百分点的显著差距。
实际应用
在工业界与学术界的实际应用中,TIC-Bench可作为多模态模型研发与迭代的“压力测试”工具,帮助工程师精准识别模型在图文交织情境下的薄弱环节,如对汇聚逻辑与并行时间事件的处理能力不足。其评估结果可直接指导模型在智能文档分析、交互式故事生成、视觉问答系统及增强现实辅助等产品中的部署优化。此外,该基准的人机对比模式为产品设定合理的性能目标提供了参照,支持开发者在追求高精度跨模态理解的同时,平衡推理效率与上下文管理能力。其公开可用的数据与评估流程亦为第三方提供了一致化的性能比较平台,推动多模态技术从实验室走向复杂现实应用场景的平稳迁移。
数据集最近研究
最新研究方向
当前,多模态大语言模型在理解与推理层面已取得显著进展,但面临的核心挑战悄然转移至深度交织文本-图像上下文中的跨模态关联推理。TIC-Bench基准的应运而生,精准定位了这一交叉前沿,其研究焦点从静态单图像或多图像并行感知,转向对逻辑、时间与空间三类关联的深度解析。该基准通过引入高密度图文交叉引用与长程上下文,系统评估模型在分散线索中维持实体一致性、开展多步推理与汇聚多源证据的能力,尤其聚焦于汇聚逻辑与并行时间场景中多证据流的协同瓶颈。实验结果不仅揭示了当前模型与人脑之间的显著鸿沟,更凸显了多模态上下文管理能力的核心地位,为破解真实世界应用中图文深度交互的难题提供了至关重要的度量基准与演进方向。
相关研究论文
  • 1
    Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment哈尔滨工业大学; 华为诺亚方舟实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务