遇见数据集

LA4-33K

收藏
arXiv2026-06-26 更新2026-06-29 收录
数据链接:
官方服务:

资源简介:

LA4-33K 是一个由上海交通大学与阿里巴巴集团等机构联合构建的语言-动作对数据集,旨在为视觉-语言-动作模型提供去视觉化的语言-动作监督信号。该数据集包含 33,000 条语言-动作片段,其内容源于对现有专家演示轨迹的分解与重组,无需额外采集机器人数据,每个片段均将原子化的低层动作描述与对应的动作序列精确配对。数据集的创建过程是通过将完整的演示轨迹拆解为可重用的原子操作单元(如移动、抓取、旋转等),并自动生成相应的语言描述,从而显式地构建语言与动作间的映射关系。该数据集主要应用于机器人操作技能的预训练领域,其核心目标是解决传统视觉-语言-动作联合训练中语言监督信号稀疏、模型过度依赖视觉捷径的问题,通过强化语言对动作执行的条件化先验知识,提升策略的泛化能力和在视觉扰动下的鲁棒性。

LA4-33K is a language-action pair dataset jointly constructed by Shanghai Jiao Tong University, Alibaba Group and other institutions, aiming to provide vision-agnostic language-action supervision signals for vision-language-action models. This dataset contains 33,000 language-action segments, whose content is derived from the decomposition and recombination of existing expert demonstration trajectories, without requiring additional robot data collection. Each segment accurately pairs atomic low-level action descriptions with their corresponding action sequences. The dataset is created by decomposing complete demonstration trajectories into reusable atomic operation units such as moving, grasping, rotating, etc., and automatically generating corresponding language descriptions, thereby explicitly constructing the mapping relationship between language and actions. This dataset is mainly applied in the field of robotic manipulation skill pre-training. Its core goal is to address the issues of sparse language supervision signals and the model's over-reliance on visual shortcuts in traditional vision-language-action joint training. By strengthening the conditional prior knowledge of language for action execution, it enhances the generalization ability of the policy and its robustness under visual perturbations.

创建时间:
2026-06-26
原始信息汇总

LA4VLA 数据集

数据集概述

  • 名称:LA4VLA
  • 来源:MINT-SJTU 研究团队
  • 托管平台:GitHub

用途

该数据集用于视觉-语言-动作(VLA)相关研究,具体定义和用途需参考 GitHub 仓库详情。

访问地址

  • GitHub 仓库:https://github.com/MINT-SJTU/LA4VLA

注:该数据集详情页README内容仅为标题,未提供更详细的描述信息。

搜集汇总
数据集介绍
LA4-33K 数据集图片
构建方式
LA4-33K数据集完全源自现有的专家演示轨迹,无需额外收集机器人数据。其构建流程首先通过检测机器人状态中的静态关键帧与夹爪过渡关键帧,获取时序分割线索;随后结合预定义的原子动作词汇表与原始任务描述,构建结构化提示,引导视觉语言模型(VLM)对完整轨迹进行时间分割,生成候选的原子动作片段及其对应的低层级、无视觉依赖的语言指令。生成的候选片段经过人工验证与质量筛选,仅保留时序边界、动作标签与语言描述一致的高质量片段。最终,视觉观测被移除,仅保留原子指令、本体状态与动作轨迹,形成33K条语言-动作(LA)片段。
特点
LA4-33K的核心特点在于将稀疏的、任务级的高层语言监督转化为密集的、局部的原子语言-动作监督。每个片段仅包含短暂且物理意义明确的原子动作(如抓取、提升、运输、按压等),并配以描述动作类型与方向的视觉无关指令。这使得语言监督在时间上更加稠密,与动作执行的对应关系更为直接,有效避免了标准VLA训练中视觉-动作信号占主导、语言-动作关联被稀释的问题。数据集覆盖了物体操作、接触交互与自由空间运动等多种原子行为类别,为学习可跨任务与场景重用的语言条件化动作先验提供了基础。
使用方法
LA4-33K专为视觉无关的语言-动作预训练设计。在预训练阶段,模型仅接收语言指令与本体状态作为输入,预测对应的动作轨迹,视觉观测被完全屏蔽。该数据集可单独用于纯语言-动作预训练(LA),也可与保留视觉的VLA格式数据进行组合,构成顺序式LA-to-VLA预训练或混合LA-VLA预训练。预训练完成后,模型在下游任务数据上进行微调。实验表明,该预训练策略能显著提升下游策略的成功率与对视觉扰动的鲁棒性,且效果可跨模型架构迁移。
背景与挑战
背景概述
LA4-33K数据集由上海交通大学、阿里巴巴集团、南洋理工大学和KAUST的研究人员于2026年共同创建,旨在解决视觉-语言-动作(VLA)模型中语言与动作之间联结薄弱的问题。在标准VLA训练范式中,机器人策略通常从密集的视觉-动作监督中学习,而语言指令仅作为稀疏的高层目标,导致策略倾向于依赖视觉捷径而非真正理解语言指令对动作的约束。该数据集通过将完整的专家演示轨迹分解为原子化的动作片段,并为每个片段配以低层级的语言描述,构建了33,000条纯粹语言-动作对应的训练样本。这一创新性设计无需额外收集机器人数据,仅通过重组现有演示即可暴露被稀释的语言-动作信号,为提升VLA策略的语言条件化动作学习能力提供了关键资源,在仿真和真实世界的操作任务中展现了显著的性能提升。
当前挑战
该数据集解决的领域核心挑战在于:VLA模型中视觉与语言对动作学习贡献的不对称性导致策略未能真正学习语言如何约束动作执行。具体而言,单条机器人轨迹包含数百乃至数千对图像-动作数据,却仅对应一条高层任务指令,这种数据层面的稀疏性以及模型输入层面视觉token数量远超语言token的数量级差异,使得策略极易形成视觉捷径,忽视语言意图。在构建过程中面临的挑战则包括:如何从连续的演示轨迹中准确切分出具有物理意义的原子化动作片段,如何定义一套既通用又具区分度的原子动作分类体系以覆盖抓取、放置、推移、旋转等常见操作原语,以及如何为每个片段生成既能精确描述动作类型与方向又避免场景细节的视觉无关指令。研究者通过引入关键帧检测、基于大视觉语言模型的自动分割与人类验证相结合的策略,有效解决了这些难题,最终构建出具有高质量标注的LA4-33K数据集。
常用场景
经典使用场景
LA4-33K作为语言-动作预训练数据集,核心场景在于将机器人专家演示轨迹分解为原子动作片段,并为每个片段配以低层级、视觉无关的动作描述,从而构建出33,000条语言-动作对。这些数据对在预训练阶段完全屏蔽视觉观测,仅保留语言指令、本体感受状态与动作轨迹,使策略专注于学习语言对动作执行的条件化先验知识,而非依赖场景特定的视觉捷径。这一设计尤其适用于跨任务、跨场景的可复用操作技能获取,为后续视觉-语言-动作联合训练提供了坚实的语言动作基础。
衍生相关工作
LA4-33K的提出催生了一系列相关研究工作。基于相同的数据构建范式和预训练框架,研究者进一步探索了顺序式语言-动作到视觉-语言-动作(LA-VLA)双阶段预训练以及混合式语言-动作与视觉-语言-动作联合预训练(MixPT)等策略,结果均表明语言-动作预训练与标准VLA训练具有互补增益效应。此外,该数据集验证了语言-动作预训练在不同VLA架构(如StarVLA)间的可迁移性,促进了跨架构的普适性预训练方法发展。围绕原子动作类别划分、视觉无关指令生成及人工验证协议等数据构造细节,也衍生出了一系列关于动作基元解耦与语言动作对齐的后续探讨,为机器人学习领域提供了可复用的方法论基础。
数据集最近研究
最新研究方向
当前,视觉-语言-动作(VLA)模型在机器人操控领域虽取得显著进展,但其训练范式存在内在不对称性:视觉-动作监督时序密集、语义变化丰富,而语言-动作监督则相对稀疏且缺乏局部对齐,导致策略倾向于依赖视觉捷径而非真正的语言条件化动作执行。为破解这一瓶颈,最新研究提出了LA4VLA框架,通过将完整的专家演示轨迹分解为原子动作片段,并为每个片段配以低层级动作描述,构建了包含33K条语言-动作对的LA4-33K数据集。该数据集无需额外机器人数据采集,完全源于现有演示的重新组织。在此基础上,研究团队系统探索了纯语言-动作预训练、顺序语言-动作至VLA预训练以及混合语言-动作与VLA预训练三种范式。实验表明,语言-动作预训练能够使策略习得跨场景、跨任务的可复用操作先验,显著提升下游VLA策略的表现——在仿真和真实世界任务中,混合预训练相较于无预训练基线分别提升了17.8和45.0个百分点。这一工作不仅揭示了显式语言-动作监督在解耦视觉依赖中的关键作用,更为构建更鲁棒、更具泛化能力的通用机器人操控策略开辟了新路径。
相关研究论文
  • 1
    LA4VLA: Learning to Act without Seeing via Language-Action Pretraining上海交通大学·人工智能学院; 阿里巴巴集团; 南洋理工大学; 阿卜杜拉国王科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务