遇见数据集

TIC-VLA

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

TIC-VLA是一个大规模推理标注数据集,专为动态环境中的机器人导航而设计。该数据集整合了视觉观察、语言指令和时间上下文,用于训练和评估能够联合理解这些信息以预测导航动作的机器人导航模型。数据集来源于三个机器人导航数据源:SCAND、GND和DynaNav,其中SCAND和GND为现有公开数据集,DynaNav为本项目新收集的数据集。数据内容包括机器人轨迹、RGB图像序列、同步机器人动作、分割的20秒导航片段、自然语言导航指令以及链式思维(CoT)推理标注。数据集结构分为两部分:原始轨迹数据(*_data)包含连续轨迹的RGB图像和同步CSV文件(记录时间戳、机器人状态和控制动作);分割导航片段标注(*_json)包含帧级JSON文件(描述单个预测时间步,聚合当前观察、历史观察、未来监督及标注引用)、指令文件(提供20秒片段的自然语言导航指令,支持不同表达方式)和CoT文件(提供与预测时间步对应的帧级推理链)。数据集采用模块化设计,通过相对路径引用图像和标注文件,减少存储冗余。适用于机器人导航、视觉-语言-动作建模、时序推理等任务。

TIC-VLA is a large-scale reasoning annotation dataset designed for robot navigation in dynamic environments. It integrates visual observations, language instructions, and temporal context to train and evaluate robot navigation models that can jointly understand this information to predict navigation actions. The dataset is sourced from three robot navigation data sources: SCAND, GND, and DynaNav, where SCAND and GND are existing public datasets, and DynaNav is newly collected for this project. The data includes robot trajectories, RGB image sequences, synchronized robot actions, segmented 20-second navigation clips, natural language navigation instructions, and chain-of-thought (CoT) reasoning annotations. The dataset structure is divided into two parts: raw trajectory data (*_data) contains continuous trajectory RGB images and synchronized CSV files (recording timestamps, robot states, and control actions); segmented navigation clip annotations (*_json) include frame-level JSON files (describing a single prediction time step, aggregating current observations, historical observations, future supervision, and annotation references), instruction files (providing natural language navigation instructions for 20-second clips, supporting different expressions), and CoT files (providing frame-level reasoning chains corresponding to prediction time steps). The dataset uses a modular design, referencing images and annotation files via relative paths to reduce storage redundancy. It is suitable for tasks such as robot navigation, vision-language-action modeling, and temporal reasoning.

创建时间:
2026-07-06
原始信息汇总

数据集概述

TIC-VLA (Think-in-Control Vision-Language-Action) 是一个大规模、带推理标注的数据集,专为动态环境中的机器人导航任务设计,用于训练和评估能够结合视觉观察、语言指令与时间上下文来预测导航动作的推理型模型。

数据来源

数据集由以下三个机器人导航数据源构建而成:

  • SCAND
  • GND
  • DynaNav(由 TIC-VLA 项目新采集并标注的数据集)

数据内容

对于每个数据源,提供以下信息:

  • 机器人轨迹
  • RGB图像序列
  • 同步的机器人动作
  • 20秒分段导航片段
  • 自然语言导航指令
  • 链式推理(Chain-of-Thought, CoT)标注

数据结构

TIC-VLA/ ├── SCAND/ │ ├── SCAND_data/ │ └── SCAND_json/ ├── GND/ │ ├── GND_data/ │ └── GND_json/ └── DynaNav/ ├── DynaNav_data/ └── DynaNav_json/

每个基准数据集包含两个部分:

  • *_data:原始记录的机器人轨迹数据
  • *_json:20秒分段导航片段的标注,包括帧级 JSON 文件、语言指令和链式推理

原始轨迹数据 (*_data)

每条记录对应一个连续的机器人轨迹。目录结构示例:

SCAND_data/ A_Jackal_AHG_Library_Thu_Nov_4_16/ ├── rgb/ │ ├── img_1636060137.589061.jpg │ ├── img_1636060137.689793.jpg │ └── ... └── sync.csv

  • rgb/:包含导航轨迹中捕获的 RGB 图像
  • sync.csv:包含每帧图像对应的同步机器人信息(时间戳、状态、控制动作)

分段导航片段标注 (*_json)

每条连续轨迹被分割为重叠的 20秒导航片段。目录包含三类文件:

SCAND_json/ ├── img_1636060137.589061.json ├── img_1636060137.689793.json ├── ... ├── instruction_690875.txt ├── instruction_691210.txt ├── ... ├── cot_690875.txt ├── cot_691210.txt ├── ...

  • 帧 JSON 文件 (img_*.json):描述单个预测时间步
  • 指令文件 (instruction_*.txt):包含对应 20秒导航片段的自然语言导航指令,不同指令文件可能用不同措辞表达相似导航目标
  • CoT 文件 (cot_*.txt):包含对应预测时间步的帧级链式推理

这种设计避免了在每个 JSON 文件中重复存储长文本,同时允许标注被共享或独立更新。

示例 JSON 结构

json { "timestamp": 2.10, "original_timestamp": 1636060139.7, "instruction_file": "instruction_690875.txt", "current": { "img": "../../SCAND_data/A_Jackal_AHG_Library_Thu_Nov_4_16/rgb/img_1636060139.690875.jpg", "orientation": [...] }, "history": [...], "future": [...], "cot": "cot_690875.txt" }

  • history:包含从当前 20秒片段开始到当前时间步的所有历史观测,以 0.1秒间隔采样,每个历史条目包含相对于该历史时间步前 1秒的自车坐标系的局部轨迹
  • future:包含相对于当前时间步自车坐标系的未来轨迹监督,确保所有预测时间步(包括最后一帧)都有未来监督
  • 每个 JSON 文件代表 20秒导航片段内的一个预测时间步,汇总了训练所需的时序上下文(当前观测、历史观测、未来监督、指令和 CoT 标注引用)

数据集通过相对路径引用 RGB 图像、指令文件和 CoT 文件,避免图像和文本标注的重复存储,降低冗余并保持模块化。

许可协议

  • cc-by-4.0

引用

若在研究中使用了 TIC-VLA,请引用:

bibtex @inproceedings{huang2026ticvla, title = {TIC-VLA: Think-in-Control Vision-Language-Action for Robot Navigation in Dynamic Environments}, author = {Zhiyu Huang and Yun Zhang and Johnson Liu and Rui Song and Chen Tang and Jiaqi Ma}, booktitle = {Proceedings of the International Conference on Machine Learning (ICML)}, year = {2026} }

搜集汇总
数据集介绍
TIC-VLA 数据集图片
构建方式
TIC-VLA数据集源于三项机器人导航数据源:SCAND、GND与DynaNav。数据构建经历了从连续机器人轨迹采集到精细化标注的完整流程。原始轨迹数据包含同步的RGB图像序列与机器人状态控制信息。随后,每条连续轨迹被切分为20秒的导航片段,并针对每一预测时间步生成帧级JSON文件,聚合当前观测、历史观测、未来轨迹监督及对应的自然语言指令与链式推理标注。通过相对路径引用图像与文本文件的设计,有效避免了数据冗余,实现了视觉、语言与推理信息的模块化管理。
特点
该数据集的核心特点在于深度融合了视觉感知、语言指令与时序上下文,以支持具备推理能力的机器人导航模型训练。每一导航片段均配有多样化自然语言表述的指令,并提供了帧级的链式推理标注,揭示了决策背后的逻辑过程。历史与未来轨迹均以自车坐标系表示,确保时空一致性。未来监督甚至延伸至片段结束之后,为所有预测时间步保留了完整的训练信号。此外,数据集通过轻量化的标注结构,平衡了数据完整性与存储效率。
使用方法
数据集以基准子目录形式组织,每个子目录包含原始轨迹数据与JSON标注文件。用户可按需加载任一子集进行模型训练与评估。使用时,首先解析帧级JSON文件,从中获取当前图像路径、历史观测序列及未来轨迹标签;随后根据instruction_file与cot字段读取对应的自然语言指令与推理文本。这些多模态输入可直接用于构建视觉-语言-动作联合学习框架,支持端到端的导航策略学习,亦可独立评估模型在推理与决策环节的表现。
背景与挑战
背景概述
TIC-VLA(Think-in-Control Vision-Language-Action)数据集由加州大学洛杉矶分校(UCLA)研究团队于2026年创建,旨在推动动态环境下机器人导航的推理能力研究。该数据集融合了SCAND、GND及自采集的DynaNav三个数据源,提供了包含RGB图像序列、机器人轨迹、同步动作、语言导航指令及链式思维(Chain-of-Thought)推理注释的大规模多模态数据。通过将原始轨迹切割为20秒的导航片段,并引入层次化的推理标注,TIC-VLA为视觉-语言-动作联合模型提供了训练与评估基准,显著推动了具身智能体在复杂动态场景中理解上下文、执行语义指令的能力发展。
当前挑战
TIC-VLA面临的核心挑战在于解决动态环境下机器人导航中视觉观测、语言指令与时间上下文的高效融合问题。传统的导航模型常缺乏对环境变化(如行人、车辆)的实时推理能力,而TIC-VLA通过引入链式思维注释,试图弥合感知与决策之间的语义鸿沟。在数据集构建过程中,挑战包括:多源异构数据(SCAND、GND、DynaNav)的时空对齐与归一化、20秒导航片段中历史与未来轨迹的连续预测监督设计、以及避免冗余存储的同时保持图像、指令与推理注释的模块化耦合。此外,确保语言指令覆盖多样化的自然表达,以及推理标注在不同场景下的泛化性,也是构建该数据集的技术难点。
常用场景
经典使用场景
TIC-VLA数据集专为动态环境下的机器人导航任务而设计,其最经典的使用场景在于训练和评估具备推理能力的视觉-语言-动作(VLA)模型。通过整合丰富的RGB图像序列、同步的机器人运动轨迹、自然语言导航指令以及精细的链式思维(CoT)推理标注,该数据集为模型提供了从感知到决策的完整闭环。研究者可借助其20秒分段导航片段的时序结构,使模型在理解当前视觉观察与历史情境的基础上,结合语言指引进行前瞻性动作预测,从而在复杂、变化的场景中实现稳健的导航行为。
解决学术问题
该数据集系统性地解决了机器人导航领域中视觉理解、语言指令与运动控制三者之间语义对齐与推理融合的学术难题。传统方法多依赖静态规则或单模态学习,难以应对环境动态变化与指令歧义。TIC-VLA通过引入链式思维推理标注,为模型提供了可解释的中间思考过程,显著提升了模型在非结构化场景下的泛化能力与鲁棒性。其意义在于推动了从简单感知到语义理解的范式跃迁,为构建具备类人推理能力的自主导航系统奠定了数据基础,并启发了多模态学习在机器人学中的新研究方向。
衍生相关工作
TIC-VLA的推出催生了一系列衍生研究工作,包括但不限于基于链式推理的多模态导航框架改进、跨数据集迁移学习方法探索,以及针对动态障碍物的时空注意力机制设计。例如,后续研究常以TIC-VLA为基准,在SCAND、GND和DynaNav三个子集上评估模型在语义理解与实时规划结合方面的表现。此外,该数据集的CoT标注范式启发了将大型语言模型融入机器人控制管线的工作,促进了端到端推理与行动协同的新范式,如Think-in-Control系列方法的持续迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务