遇见数据集

Memoryvla

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集来自 Robokit 采集,包含机器人执行“用杯子盖住积木,然后拿起盖住积木的杯子”这一操作任务的示范数据。每个批次数据存放于一个目录中,包含:HDF5 格式的原始数据(hdf5/)、RLDS 格式的数据集(robokit_dataset/)以及采集配置与清洗报告(source_meta/)。数据集共有 157 个 episode(索引 0 至 156),适用于机器人模仿学习、操作技能迁移等任务。

This dataset is collected from Robokit, containing demonstration data of a robot performing the operation task: Cover the block with a cup, then pick up the cup covering the block. Each batch of data is stored in a directory, including: raw data in HDF5 format (hdf5/), dataset in RLDS format (robokit_dataset/), and collection configuration and cleaning report (source_meta/). The dataset consists of 157 episodes (index 0 to 156), suitable for tasks such as robot imitation learning and manipulation skill transfer.

创建时间:
2026-07-27
原始信息汇总

数据集概述

该数据集由 shaohuan1 发布在 Hugging Face 平台上,对应一个机器人操作任务:“用杯子盖住积木,然后提起盖住积木的杯子”。该任务的数据通过 RoboKit 采集。

数据集内容与结构

每个批次(batch)包含一个独立目录,内部结构如下:

  • hdf5/:存放原始数据(HDF5 格式)。
  • robokit_dataset/:存放 RLDS(Relay Learning Data Schema)格式的数据。
  • source_meta/:包含采集配置信息与数据清洗报告。

数据规模

批次名称 Episode 范围 总段数
Cover_the_building_block_with_a_cup,_then_lift_up_the_cup_covering_the_block._b0 0 至 156 157

注意事项

  • 数据集页面中的文件列表按字典序排列(例如 100.hdf5 会排在 66.hdf5 之前),翻页浏览时容易误判为缺少文件。
  • 如需核对数据完整性,可使用项目提供的脚本命令: ./scripts/publish_batch.sh --audit "Cover the building block with a cup, then lift up the cup covering the block.",该命令会逐文件比对本地与远端的大小。
搜集汇总
数据集介绍
Memoryvla 数据集图片
构建方式
MemoryVLA数据集由robokit平台采集,以批次为单位组织,每批包含原始HDF5数据、RLDS格式转换后的数据集以及采集配置与清洗报告。具体批次涵盖如“用杯子盖住积木,再拿起杯子”等复杂操作任务,每个任务细分为多个episode,并以分段形式存储,确保数据结构的完整性与可追溯性。
特点
该数据集具有鲜明的多模态与长时程特性,记录了精细操作的全过程,覆盖从指令理解到动作执行的完整链条。数据经RLDS标准格式化,便于与现有机器人学习框架无缝对接。其细粒度的分段存储与清洗报告,为后续数据筛选与质量评估提供了坚实依据。
使用方法
使用时需注意HuggingFace文件列表按字典序显示,可能导致翻页时误判缺失。建议基于远端逐文件的字节大小比对,而非依赖网页目测,以确保数据完整性。数据可直接用于视觉-语言-动作(VLA)模型的训练与评估,支持端到端策略学习及多任务泛化研究。
背景与挑战
背景概述
MemoryVLA数据集由robokit平台采集,旨在支撑视觉-语言-动作(VLA)模型的研究与发展。该数据集创建于近期,主要研究人员或机构为robokit团队,其核心研究问题在于如何通过大规模、多样化的操作数据,提升机器人对复杂任务的理解与执行能力。数据集涵盖覆盖积木、叠放杯子等精细操作任务,通过高精度传感器记录原始数据并转换为RLDS格式,为VLA模型的训练与评估提供了坚实基础。其影响力在于推动具身智能领域的数据标准化与模型泛化能力,为后续研究提供了宝贵资源。
当前挑战
领域挑战方面,MemoryVLA旨在解决VLA模型在真实世界操作中的泛化与鲁棒性问题,包括任务多样性、环境变化及动作精度等核心难题。构建过程中的挑战主要体现在数据采集的一致性维护、多模态数据同步(视觉、语言、动作)以及大规模数据的高效存储与清洗。此外,数据集的批次管理、文件完整性校验及字典序排列导致的误判问题,也要求开发者设计严谨的数据管理流程,确保数据质量与可复现性。
常用场景
经典使用场景
MemoryVLA数据集专为视觉-语言-动作(VLA)模型在机器人操作任务中的训练与评估而设计,其经典使用场景聚焦于长时程、多步骤的精细操控任务。数据集中涵盖了诸如“用杯子盖住积木并提起杯子”及“堆叠杯子”等复合动作序列,每个episode均包含完整的传感器记录与动作标签,为研究者提供了高保真的多模态学习样本。借助RLDS格式的标准化封装,该数据集可无缝对接主流深度学习框架,支持端到端的模仿学习、离线强化学习以及多任务泛化研究,尤其适用于验证模型在复杂空间关系理解与顺序决策能力上的表现。
衍生相关工作
围绕MemoryVLA数据集,学界已涌现出一系列衍生工作,其中最具代表性的是将RLDS数据流用于训练隐式动作生成模型,并延伸出具备记忆增强机制的VLA变体,用以处理部分可观测环境下的长期依赖。另一些研究则基于其分段元数据开发了跨任务数据增强策略,通过重采样与任务重组提升了模型的少样本学习能力。该数据集还被引入到多模态大模型的指令微调管道中,催生了将语言规划与视觉伺服融合的统一框架。此外,其开放的采集配置为模仿学习中数据效率的优化提供了实证素材,相关成果多见于机器人顶会,持续推动着具身智能体向更高层次的认知水平演进。
数据集最近研究
最新研究方向
MemoryVLA数据集聚焦于视觉-语言-动作(VLA)模型在机器人操作任务中的记忆增强与泛化能力,其最新研究方向涵盖多任务模仿学习、长时程操作序列的生成以及跨场景的零样本迁移。通过整合高维视觉观测、语言指令与精细动作控制,该数据集支撑了基于预训练大模型的端到端策略学习,并推动了具身智能体在动态环境中对复杂任务(如物体覆盖与堆叠)的自主决策优化。此外,其采用RLDS格式与分层数据管理,为多批次采集的规模化训练提供了标准化接口,促进了可复现研究与模型鲁棒性评估,在机器人学习社区中具有重要基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务