robo_video
收藏官方服务:
资源简介:
HIW-500-LeRobot数据集,包含来自头戴式摄像机录制的视频片段(Episodes),每个片段对应一个日常操作任务,例如洗衣服、捡垃圾扔进垃圾桶、补充冰箱存货和搭建儿童桌。实验中使用的是每个片段第一帧的左眼单目裁剪图像(640x480分辨率)和全局任务文本提示。
The HIW-500-LeRobot dataset consists of video episodes recorded by head-mounted cameras, each corresponding to a daily manipulation task such as doing laundry, picking up trash and throwing it into a bin, restocking the refrigerator, and setting up a childrens table. The experiment uses the first frame of each episode from the left-eye monocular cropped image (640x480 resolution) along with a global task text prompt.
创建时间:
2026-07-05
原始信息汇总
数据集概述:Robot I2V Zero-Shot Comparison
数据集名称
Robot I2V Zero-Shot Comparison
数据集来源
基于 HIW-500-LeRobot 数据集的头部摄像头片段
数据集内容
该数据集旨在比较 NVIDIA Cosmos3-Nano 和 Wan2.1-I2V-14B-480P 两个模型在零样本条件下的图像到视频(I2V)生成效果,包含四个机器人操作片段:
- Episode 4: 洗衣服(clothes washing)
- Episode 22: 捡垃圾到垃圾桶(picking trash to rubbish bin)
- Episode 25: 补货冰箱(restocking fridge)
- Episode 22983: 组装儿童桌子(building children table)
输入设置
- 输入图像: 每个片段的左眼单目画面(第一帧),原始头部视频分辨率为 1280x480 立体画面,仅使用左侧 640x480 裁剪区域
- 输入提示: 全局任务描述(无子任务、动作、腕部摄像头、字幕或水印)
数据文件
index.html: 展示条件图像、原始模型输出、真实片段和对比视频的页面- 原始模型输出 MP4 文件: 与对比视频(comparison.mp4)分开保存
技术细节
- NVIDIA Cosmos3-Nano: 通过 Diffusers 库运行,使用 BF16 精度,
device_map=balanced,无量化,无卸载 - Wan2.1-I2V-14B-480P: 通过官方 Wan
generate.pyI2V 路径运行,使用 BF16 精度、官方 CPU 模型卸载,无量化。曾尝试 8-GPU FSDP/USP 但因 DiT 分片加载卡住,最终采用官方单 GPU 卸载路径 - 注意力机制: 因环境缺少 nvcc/CUDA_HOME 无法安装 FlashAttention,Wan 使用 PyTorch 缩放点积注意力回退机制,并已修补到本地官方仓库
搜集汇总
数据集介绍

构建方式
该数据集基于HIW-500-LeRobot基准中的四个头戴相机片段构建,聚焦于机器人操作任务中的图像到视频生成评估。每个片段分别对应衣物清洗、拾捡垃圾至垃圾桶、冰箱补货以及儿童桌搭建等典型家务场景。数据构建严格限定输入条件:仅采用片段首帧的左单目裁剪画面(640×480分辨率)及全局任务提示,排除了子任务、动作序列、腕部相机、字幕或水印等辅助信息。同时保留了原始模型输出的MP4文件,并生成了对比视频以进行直观评估。
特点
数据集的核心特点在于其零样本对比评估的设计理念。通过限制输入为单帧图像与文本提示,旨在测试模型在未见过的机器人场景中生成连贯后续帧的能力。对比实验中采用了两种代表性模型:Nvidia Cosmos3-Nano与Wan2.1-I2V-14B-480P,两者均以BF16精度运行但采用了不同的推理策略——前者使用Diffusers库的均衡设备映射,后者则通过官方单GPU卸载路径进行处理。这种设置突出了不同架构在相同条件下的性能差异,为机器人领域视频生成研究提供了可控的评估基准。
使用方法
数据集的使用主要通过查看目录下的`index.html`文件进行可视化分析。该页面集中展示了条件图像、原始模型输出、真实片段以及对比视频,便于研究者进行定性与定量比较。研究团队可基于提供的片段及模型生成结果,评估视频生成模型在机器人操作任务中的时序一致性、动作合理性及与任务提示的语义对齐程度。对于需要深入分析的应用,可进一步提取原始MP4文件,并结合视频质量指标(如FVD、PSNR等)进行自动化评估,从而推动机器人视觉与生成式模型的协同发展。
背景与挑战
背景概述
在机器人学习领域,从第一视角视频数据中理解并模拟人类行为是具身智能研究的核心挑战之一。robo_video数据集由相关研究团队创建,聚焦于从机器人头部摄像头采集的立体视频中提取单目视觉线索,以评估图像到视频(I2V)生成模型在零样本情境下的泛化能力。该数据集涵盖了四种典型的日常操作任务,如衣物洗涤和垃圾捡拾,旨在探究高容量模型如NVIDIA Cosmos3-Nano和Wan2.1-I2V-14B-480P在缺乏子任务、动作信息或额外传感器输入时的表现。其对机器人模拟学习和策略迁移领域具有潜在影响,为衡量视频生成模型在现实机器人场景中的适用性提供了基准。
当前挑战
该数据集所面临的挑战主要体现在两方面。在领域问题层面,它试图解决机器人视觉模拟中从静态图像到动态视频生成的跨模态对齐难题,尤其是在缺乏动作标签和时序先验的情况下,模型需仅凭单帧图像和任务提示生成连贯、合理的行为视频,这对捕捉物理交互的因果性和时空一致性构成严峻考验。在构建过程中,数据集遭遇了实际技术瓶颈:一是高分辨率立体视频需裁剪为单目输入,可能损失深度信息;二是大模型部署时受限于计算资源,如FlashAttention因环境缺少nvcc而无法安装,导致注意力机制回退至PyTorch缩放点积注意力,影响生成效率;此外,多GPU并行方案因DiT分片加载停滞而被迫采用单GPU卸载路径,凸显了在有限硬件条件下复现先进模型的工程复杂性。
常用场景
经典使用场景
robo_video数据集专注于机器人领域中的图像到视频(Image-to-Video)生成任务,尤其侧重于头部摄像头视角下的零样本视频预测。该数据集为评估和比较不同视频生成模型(如NVIDIA Cosmos3-Nano与Wan2.1-I2V-14B-480P)在机器人操作场景中的表现提供了标准化基准。经典使用方式包括:给定单帧头部摄像头图像和全局任务提示,模型需生成连贯的未来视频片段,从而检验其理解物理世界动态与任务意图的能力。
衍生相关工作
基于robo_video数据集的研究衍生出了一系列重要工作。一方面,研究者将其用于对比Diffusers框架与原生生成管线在模型推理效率上的差异,催生了针对机器人视频生成的轻量化内存优化策略。另一方面,该数据集推动了多模态对齐技术的前进,促使学界提出任务提示与视觉条件深度融合的跨模态注意力模块。此外,围绕零样本泛化界定的讨论,衍生出专门衡量机器人视频生成中动作连贯性与物体交互真实性的新型评估指标,如动态空间一致性得分与长时序任务维持率。
数据集最近研究
最新研究方向
在机器人视觉与动作生成领域,robo_video数据集聚焦于从静态图像到动态视频的零样本转换研究,近期工作重点在于对比不同基础模型(如NVIDIA Cosmos3-Nano与Wan2.1-I2V-14B-480P)在真实机器人头部视角下的视频生成能力。该研究以HIW-500-LeRobot数据集中的家务操作片段为测试床,涵盖洗衣、垃圾捡拾、冰箱补货及儿童桌组装等典型场景,旨在评估模型在零样本条件下对复杂任务语义与时空连续性的捕捉精度。这一方向紧密关联具身智能与多模态学习的交叉前沿,通过剥离任务提示与视觉输入之外的干扰因素,揭示了现有视频生成模型在机器人领域实际部署时的性能瓶颈与调优潜力,对推动机器人从感知到动作的原型验证与泛化能力提升具有重要启示。
以上内容由遇见数据集搜集并总结生成



