遇见数据集

OpenDriveLab/SparseVideoNav

收藏
Hugging Face2026-07-10 更新2026-07-22 收录
官方服务:

资源简介:

SparseVideoNav数据集专注于现实世界中的视觉语言导航任务,并结合稀疏未来视频生成技术。该数据集包含语言指令、RGB帧序列以及低级导航动作,其中每个发布的episode中的动作数量与RGB帧数量相匹配。数据集包含两个子集:BVN(超越视野导航)和IFN(指令跟随导航)。完整数据集总时长约为140小时,但由于地区政策限制,当前开源部分约为121.74小时。具体统计如下:BVN子集包含5,433个episodes、825,786个RGB帧、时长57.35小时,用于超越视野导航任务;IFN子集包含6,260个episodes、927,268个RGB帧、时长64.39小时,用于指令跟随导航任务。数据集以压缩tar分片格式存储图像,以避免在Hugging Face存储库中产生大量小文件。

SparseVideoNav studies real-world vision-language navigation with sparse future video generation. The datasets contain language instructions, RGB frame sequences, and low-level navigation actions. The number of actions matches the number of RGB frames for every released episode. This repository version contains the processed IFN and BVN subsets used by SparseVideoNav. The complete dataset contains about 140 hours; due to regional policy restrictions, the currently open-sourced portion is approximately 121.74 hours. The BVN subset has 5,433 episodes, 825,786 RGB frames, 57.35 hours duration, and is for Beyond-the-View Navigation; the IFN subset has 6,260 episodes, 927,268 RGB frames, 64.39 hours duration, and is for Instruction-Following Navigation. Images are stored in compressed tar shards to avoid hundreds of thousands of small files in the Hugging Face repository.

提供机构:
OpenDriveLab
搜集汇总
数据集介绍
OpenDriveLab/SparseVideoNav 数据集图片
构建方式
SparseVideoNav数据集旨在推动具身智能体在稀疏未来视频生成条件下的视觉-语言导航研究。该数据集通过真实世界采集与多源数据融合构建,涵盖两大子集:BVN(超越视野导航)与IFN(指令跟随导航)。每个导航片段均配备自然语言指令、同步的RGB视频帧序列以及与之对应的底层动作序列(dx、dy、dyaw),动作数量与帧数严格对齐。数据经压缩分片存储于tar.zst归档中,并附带完整的注释文件与分片清单,便于高效检索与还原。目前开源部分共包含11,693个片段、超过175万帧图像,总时长约121.74小时。
使用方法
研究者可通过Hugging Face Datasets库便捷加载SparseVideoNav数据集,调用load_dataset('OpenDriveLab/SparseVideoNav', 'bvn')或load_dataset('OpenDriveLab/SparseVideoNav', 'ifn')分别获取两个子集。元数据以JSON Lines格式存储,每条记录包含片段标识符、语言指令、帧数与动作数组。图像数据需通过解压对应分片(如tar -I zstd -xf ifn/shards/ifn-00000.tar.zst)获取,解压后图像路径遵循images/<episode_dir>/rgb/000.jpg的层级结构。该数据集适用于视觉-语言导航、视频预测、指令跟随等任务的研究与模型评估。
背景与挑战
背景概述
SparseVideoNav数据集由OpenDriveLab团队于2026年发布,旨在推动现实世界中基于稀疏未来视频生成的视觉语言导航研究。该数据集由两个子集构成:Beyond-the-View Navigation(BVN)和Instruction-Following Navigation(IFN),分别对应超越视野的导航和指令跟随导航任务。数据集包含约121.74小时的真实世界导航数据,涵盖11,693个episode,每个episode均包含自然语言指令、RGB帧序列及对应的底层导航动作。其核心研究问题在于如何利用稀疏的视频信息生成来辅助机器人在复杂动态环境中完成语言引导的导航任务。SparseVideoNav的提出填补了现有视觉语言导航数据集在真实世界稀疏视频生成方面的空白,为具身智能体的导航能力评估提供了重要基准,对后续的视觉-语言导航、机器人自主导航等领域具有显著的影响力。
当前挑战
SparseVideoNav数据集所解决的领域问题挑战在于:现实世界中的视觉语言导航往往面临视野受限、环境动态变化以及指令歧义性等难题,传统依赖稠密视觉信息的方法难以推广至稀疏或非连续观测的场景。该数据集通过引入稀疏未来视频生成策略,促使模型学习从有限帧中推断出完整导航路径与动作序列。在数据集构建过程中,研究人员面临了多项挑战:首先,大规模真实世界导航数据的采集耗时且成本高昂,需在多种室内外场景中部署机器人并记录长达数十小时的交互过程;其次,指令与动作的精确对齐需要克服时间同步误差,确保每一帧图像对应的动作具有高度一致性;最后,数据存储与分发效率也是关键考量,采用压缩归档技术以管理超过17万张图像及元数据,同时兼顾跨区域政策限制下仅能开源部分数据的现实约束。
常用场景
经典使用场景
SparseVideoNav数据集专为真实世界中的视觉-语言导航任务而设计,其经典使用场景聚焦于两类核心挑战:超越视界导航(BVN)与指令跟随导航(IFN)。在BVN任务中,智能体需基于稀疏的观测帧,生成对未来未见区域的视频表征,进而规划出连贯的导航轨迹,这要求模型具备强大的空间推理与未来预测能力。IFN任务则强调智能体对自然语言指令的精准理解,通过解析诸如“沿着铁轨走直到靠近红色锥体”等复杂指令,在动态环境中执行低层级的位移与转向动作。该数据集以每帧对应一个动作的精细粒度,为研究和评估多模态感知、视频生成与决策控制的联合学习提供了标准化平台。
解决学术问题
该数据集针对真实场景下视觉-语言导航研究中长期存在的两大关键学术难题:如何利用稀疏的未来视频流实现超越当前视角的导航规划,以及如何弥合自然语言指令与低层级控制动作之间的语义鸿沟。SparseVideoNav通过构建包含逾11,000个导航片段、总计超过121小时的具身数据,显著缓解了现有数据集缺乏真实世界多样性与动作对齐精度的困境。其贡献在于为“稀疏视频生成驱动导航”这一新兴范式提供了坚实的评测基准,促进了在复杂室内外环境中,智能体从语言理解到空间推理再到运动控制的系统性研究,对推动认知机器人学与多模态学习的发展具有深远影响。
实际应用
在实践层面,SparseVideoNav数据集为智能机器人导航系统的开发与验证提供了高保真资源,其应用场景广泛覆盖服务机器人、自主巡检与辅助生活等领域。例如,通过训练模型理解“前往下一个走廊左转”等指令,机器人可在医院、仓库等结构化环境中自主运送物资;而超越视界导航能力则使机器人在视野受限的拐角或遮挡区域,能预先生成未来场景的表征,从而避免碰撞并优化路径。该数据集所强调的稀疏视频生成与动作对齐,为开发低延迟、高鲁棒性的实时导航控制器指明了方向,尤其适用于计算资源受限的边缘设备部署,显著提升了具身智能体在非结构化空间中的实用性与适应性。
数据集最近研究
最新研究方向
SparseVideoNav数据集聚焦于稀疏未来视频生成驱动的真实世界视觉语言导航研究,突破了传统导航系统依赖稠密连续观测的局限。在具身智能与机器人导航领域,该数据集通过BVN(超越视野导航)与IFN(指令跟随导航)两大子集,结合约122小时、超175万帧的RGB序列与精细的低层动作标注,为研究者在复杂动态环境中实现高效语义理解与路径规划提供了关键支撑。前沿方向包括利用稀疏视频预测提升长距离视野外目标寻径能力,以及将自然语言指令与稀疏观测融合以增强导航算法的泛化性与鲁棒性。该数据集的开源推动了具身智能体在非结构化场景下的实时决策能力,对自动驾驶、家庭服务机器人等热点应用具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务