遇见数据集

StructCoT

收藏
arXiv2026-07-09 更新2026-07-11 收录
数据链接:
官方服务:

资源简介:

StructCoT是由华中科技大学与小米公司联合构建的大规模交错式多模态推理数据集,旨在支持通用化的、以更新为中心的视觉状态建模。该数据集包含105万条样本,覆盖44个任务领域,通过组织多样化的推理结构和视觉更新模式,为模型提供了广泛的监督信号。其构建过程旨在涵盖复杂的推理流程和视觉状态演变,以解决现有数据集局限于特定场景(如迷宫、谜题)而无法支持通用多模态推理的问题,最终应用于训练如DeltaV等统一大模型,提升其在交错多模态推理任务中的泛化能力和性能。

StructCoT is a large-scale interleaved multi-modal reasoning dataset co-developed by Huazhong University of Science and Technology and Xiaomi Corporation, which aims to support generalizable, update-centric visual state modeling. This dataset includes 1.05 million samples spanning 44 task domains. By structuring diverse reasoning architectures and visual update patterns, it delivers extensive supervision signals for models. The construction of this dataset intends to cover complex reasoning workflows and visual state evolution, so as to address the limitation of existing datasets that are confined to specific scenarios such as mazes and puzzles and fail to support general multi-modal reasoning. Ultimately, it is applied to train unified large models like DeltaV, to improve their generalization capability and performance on interleaved multi-modal reasoning tasks.

创建时间:
2026-07-09
原始信息汇总

DeltaV 数据集详情

基本信息

  • 项目名称: DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models
  • 模型规模: DeltaV-2B(2B参数)
  • 发布日期: 2026年7月9日
  • 论文链接: arXiv
  • 模型下载:
  • StructCoT数据集: ModelScope
  • 项目官网: Website
  • 在线Demo: Demo

模型概述

DeltaV是一种统一的大规模多模态模型(ULMM),旨在通过视觉状态更新进行交错式多模态推理。其核心机制包括:

  • 视觉更新令牌:基于历史视觉状态,增量预测紧凑的视觉更新令牌,仅捕捉推理步骤中稀疏但关键的视觉变化
  • TSIM Router:根据时间视觉变化动态分配令牌预算
  • TSIM-Tok:视觉状态编码器/分词器

发布资源

本次发布包含:

  • DeltaV-2B ULMM模型权重
  • TSIM-Tok分词器模型
  • 推理脚本
  • 小规模样本数据

尚未发布(待后续更新)

  • StructCoT数据集:完整数据集及训练数据(当前仅包含推理用小样本 data/struct_infer_sample.json
  • DeltaV训练脚本:两阶段训练代码和配置
  • TSIM-Tok训练与测试代码:分词器训练和重建评估代码
  • Zebra-CoT / StructCoT评估工具:基于LLM API的评分器

仓库结构

  • deltav/:DeltaV模型代码(建模、处理、配置、骨干网络)
    • tsim_tok/:TSIM-Tok视觉分词器和TSIM Router
  • inference/:推理代码
  • scripts/:可直接运行的推理与数据工具脚本
  • configs/:模型与加速配置
  • data/:小样本数据
  • docs/:扩展教程和README媒体资源
  • tools/:数据处理和推理后处理工具

推理输入格式

每个推理样本包含: json { "config": "Visual Logic & Strategic Games - Tetris", "input_prompt": "问题描述文本", "input_image": ["/绝对路径/problem.jpg"], "output_image": ["/绝对路径/reasoning_01.jpg", "..."], "num_tokens": [144, 100, 81, ...] }

  • num_tokens:每个图像的增量令牌预算(首个图像使用基础预算,后续图像使用路由预算)
  • 令牌预算可通过预计算(默认)或TSIM Router(使用DINOv2 ViT-B/14)动态分配

性能基准

外部多模态推理与理解评估

基准 DeltaV-2B得分
VStar 75.9
EMMA 28.6
M3CoT 54.5
MathVista 69.3
VisuLogic 23.5
MMBench 82.3
MME-P 1555
MMVP 51.3

领域内多模态推理评估(Zebra-CoT / StructCoT)

基准 子项 DeltaV-2B得分
Zebra-CoT 2D 78.9
3D 20.0
Science 41.1
Strategy 38.3
Overall 44.6
StructCoT Strategy Planning 16.4
Spatial Planning 53.0
Logic 66.0
Math 30.1
Science 45.6
Visual Search 84.3
Jigsaw Restoration 62.6
Overall 51.1

使用限制

  • 本模型仅限学术研究和非商业用途
  • 如需更小或更强模型,请联系:ylliu@hust.edu.cn
搜集汇总
数据集介绍
StructCoT 数据集图片
构建方式
StructCoT数据集由华中科技大学与小米公司联合构建,旨在解决现有交错多模态推理数据集规模有限、领域覆盖窄的问题。该数据集通过三大策略构建:一是基于算法求解器生成策略游戏、逻辑推理等任务,利用可执行的符号求解器产生中间状态与最终答案,并剔除无效或矛盾样本;二是从现有数据集中筛选图像与标注,借助Gemini模型合成问答对;三是通过受控噪声扰动生成图像修复类样本。所有样本均经过Qwen2.5-VL-72B过滤,去除歧义、重复及推理冗余的样本,最终形成包含105万样本、覆盖44个任务领域的大规模数据集。
使用方法
StructCoT主要用于训练支持视觉状态更新的统一大语言模型,尤其是如DeltaV这类采用增量式视觉更新的框架。使用时,数据集中的每条样本包含初始视觉状态、多步文本推理链、以及每步对应的中间视觉状态序列。在训练过程中,模型通过TSIM Router为每一步视觉更新分配动态的Token预算,将视觉变化编码为紧凑的可变长更新Token序列,并附带<|vision_end|>标记作为停止信号。通过预分配的Token预算监督,模型学习在不同视觉变化幅度下自适应地生成视觉更新,从而在推理时无需完整生成中间图像,显著降低Token冗余并提升推理效率。
背景与挑战
背景概述
StructCoT数据集由华中科技大学与小米集团MiLM Plus实验室于2026年联合创建,旨在突破现有交错式多模态推理数据集在规模与领域多样性上的瓶颈。当前主流数据集如Zebra-CoT仅涵盖21个任务领域、约18万样本,且多集中于迷宫、拼图等特定场景,难以支撑通用多模态推理模型的学习需求。StructCoT以105万样本覆盖44个任务领域,横跨策略博弈、空间规划、逻辑抽象、数学算法、科学推理、视觉搜索及图像复原七大推理结构范畴,其规模约为Zebra-CoT的5.8倍。该数据集的构建深刻影响了统一大多模态模型(ULMMs)的研究方向,为模型学习普适性的视觉状态演化模式与推理轨迹提供了坚实的监督基础。
当前挑战
StructCoT所应对的核心领域挑战在于现有交错式多模态推理范式因全图像生成导致的视觉标记冗余与推理关键状态变迁的监督稀释。传统方法将每个中间推理状态生成为完整图像,反复建模大量不变内容,使优化偏向低层重建而非推理相关变迁。构建过程中,团队面临三大挑战:一是需设计涵盖多样化视觉状态演变(如网格、图表、轨迹、视角变换)的数据结构,以覆盖44个任务领域;二是需通过可执行符号求解器生成中间状态与答案并剔除无效样本,借助Qwen2.5-VL-72B过滤歧义问题与重复数据;三是需确保与Zebra-CoT的模板无重叠,避免评估泄露。最终,StructCoT通过推理结构驱动的分类法系统覆盖不同视觉演化模式,为学习可泛化的视觉更新提供了充足监督。
常用场景
经典使用场景
在统一多模态大模型的研究领域中,StructCoT被广泛用于训练和评估模型在交错推理任务上的表现。该数据集涵盖了44个任务领域,包含超过105万条样本,为模型提供了丰富的中间视觉状态演化轨迹,使其能够学习如何通过视觉状态更新而非完整图像生成来推进推理过程。典型的使用场景包括策略游戏中的棋局推演、几何证明中的辅助线绘制、逻辑谜题中的逐步状态变化,以及科学问题求解中的渐进式可视化过程,这些任务均要求模型在多步推理中维持视觉一致性与信息紧凑性。
解决学术问题
StructCoT解决了当前交错多模态推理数据集规模有限、任务覆盖狭窄的核心学术问题。此前如Zebra-CoT仅覆盖21个领域、约18万样本,且聚焦于迷宫、拼图等特定场景,限制了模型对通用推理行为的学习。StructCoT通过构建涵盖策略规划、空间推理、逻辑抽象、数学算法、科学推理、视觉搜索与图像复原七大类别的海量数据,填补了视觉状态更新模式多样化的空白,为研究如何从完整图像生成范式转向紧凑的视觉状态更新范式提供了关键的训练基础,显著推动了对视觉推理过程中信息冗余与监督信号稀释问题的深入探索。
实际应用
在实际应用中,StructCoT赋能的多模态模型可直接服务于需要逐步视觉推理的复杂场景。例如在智能教育领域,模型可辅助学生解析几何题的辅助线构造过程;在自动化博弈场景中,模型能通过观察棋盘布局的逐步变化制定最优策略;在机器人规划领域,模型可通过多视角环境图像的连续更新来生成行动指令。此外,在医学影像分析、自动驾驶环境感知、图形用户界面代理等任务中,模型均能利用StructCoT所强化的视觉状态更新能力,实现基于紧凑视觉证据的高效推理,提升系统的实时性与可解释性。
数据集最近研究
最新研究方向
当前,StructCoT数据集聚焦于推动统一多模态大模型在交错式推理中的范式革新,从传统的全图像生成转向基于视觉状态增量更新的高效推理路径。该数据集以百万级样本覆盖44个任务领域,通过精细化的视觉变化表征与动态令牌分配机制,显著降低冗余计算并提升推理关键信息的监督密度。其核心意义在于为多模态智能体提供了可泛化的视觉推理基座,通过捕捉稀疏但关键的视觉状态迁移,在棋盘博弈、几何证明、科学推理等复杂场景中实现了更紧凑且语义一致的多步推理,为迈向真正具身化的多模态理解与决策系统奠定了数据与方法论基础。
相关研究论文
  • 1
    DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models华中科技大学; 小米公司·MiLM Plus · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务