TIC-Bench
收藏资源简介:
TIC-Bench是由哈尔滨工业大学与华为诺亚方舟实验室联合构建的深度交织文本-图像上下文基准,旨在评估多模态大语言模型在复杂交织场景中的跨模态推理能力。该基准包含2,280个精心设计的问题,涵盖逻辑关联、时间关联与空间关联三大维度,并进一步细分为八种推理结构,共计45,776张图像与85,145条文本引用,上下文平均长度达309.3个单词。数据集通过构建密集的跨模态引用链,迫使模型在连续交织的文本与图像线索中进行证据整合与多步推理,而非依赖静态感知或语言先验。TIC-Bench专注于解决真实世界应用中文本与图像深度交互的需求,如多模态文档理解、文本-图像协同创作及多视角事件追踪,揭示了当前先进模型与人类专家之间的显著差距,为提升多模态模型的动态推理能力提供了关键分析工具。
TIC-Bench is a deeply interleaved text-image context benchmark jointly developed by Harbin Institute of Technology and Huawei Noah's Ark Lab, which aims to evaluate the cross-modal reasoning capabilities of multimodal large language models (LLMs) in complex interleaved scenarios. This benchmark includes 2,280 meticulously designed questions, covering three core dimensions: logical association, temporal association, and spatial association, which are further subdivided into eight reasoning structures. In total, it encompasses 45,776 images and 85,145 text citations, with an average context length of 309.3 words. The dataset constructs dense cross-modal citation chains, forcing models to conduct evidence integration and multi-step reasoning across continuously interleaved text and image clues, rather than relying on static perception or linguistic priors. TIC-Bench focuses on addressing the demands of deep text-image interaction in real-world applications, such as multimodal document understanding, text-image collaborative creation, and multi-view event tracking. It reveals the significant gap between current state-of-the-art models and human experts, serving as a critical analytical tool for enhancing the dynamic reasoning capabilities of multimodal models.
TIC-Bench 数据集详情
数据集概述
TIC-Bench 是一个用于评估多模态大语言模型(LLMs)在深度交错文本-图像上下文中表现的中等规模基准数据集。其核心目标是测试模型能否在长序列、深度交错的图像与文本之间进行证据的绑定、整合与传播。数据集包含 2,280 道唯一问题,覆盖空间、逻辑和时间三类关联推理。
规模与构成
- 问题总数:2,280 道
- 图像实例总数:45,776张,平均每个问题包含 20.08 张图像,每张图像平均被引用 1.86 次
- 领域分布:
- 逻辑关联(784题):分为线性(260题)、循环(249题)、汇聚(275题)
- 时间关联(726题):分为顺序(270题)、回溯(226题)、并行(230题)
- 空间关联(770题):分为地图(385题)、照片(385题)
任务类型说明
- 空间关联:结合重叠局部裁剪和替换文本线索推断相对方向,涵盖航拍地图与自然照片
- 逻辑关联:通过线性、循环或汇聚的视觉结构追踪共享对象与文本关系
- 时间关联:通过顺序、回溯或并行叙事结构追踪身份与事件
发布格式与下载
数据集以 15 个未压缩的 tar 分片形式发布(而非超过 23,000 个独立文件),整体约 19 GiB。每个领域的分片可独立下载,目录结构为 Spatial Association、Logical Association(10个分片)、Temporal Association(4个分片)。数据包同时提供:
manifest.jsonl:每个 QA 记录的元数据(QID、领域、任务类型、问题文件夹、QA 文件名等)dataset_index.json:记录统计、重复 QID 诊断、分片大小与 SHA-256 哈希SHA256SUMS:完整性校验文件
QA 格式说明
- 空间:
dataset_caption.jsonl,每行为包含交错序列的 QA 记录 - 逻辑:
qa_pairs_*.json,含问题、答案、推理深度、图类型等 - 时间:
qa_pairs*.json,含问题、参考答案、推理步骤、故事描述等
数据完整性与一致性
发布集中含 2,280 个唯一 QID。当前时间源中 4 个 QID 各关联两条不同 QA 记录,因此时间领域的物理记录数为 730 而非 726。manifest 保留全部 730 条记录并标记 qid_occurrences,不会静默丢弃任一记录。
评测与责任说明
基准评测覆盖十种多模态 LLM、十五种推理设置:五种开源模型在思考与非思考模式下测试,五种闭源模型使用默认设置。答案由三位独立评估者评判并辅以人工仲裁。数据来源包括 COCO 照片、CVOGL 航拍图、公开影视动画片段及生成场景,使用者需遵守原始素材的版权限制,仅用于研究与评估,禁止基于人物身份推断、监控或个人决策等用途。

- 1Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment哈尔滨工业大学; 华为诺亚方舟实验室 · 2026年



