遇见数据集

Voxel51/lingbot-depth-subset

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

这是一个名为lingbot-depth-subset的数据集,它是robbyant/mdm_depth(LingBot-Depth训练语料库)的一个代表性重采样子集,已重新格式化为FiftyOne的分组数据集结构,其中gt_depth和raw_depth字段作为fo.Heatmap。数据集包含13,149个样本(10,207个组),涵盖三个子集合:RobbyReal(真实世界室内RGB-D捕获)、RobbyVla(真实世界VLA机器人操作,使用Franka机械臂)和RobbySim(模拟渲染)。该子集主要用于验证FiftyOne导入管道,并支持对数据集结构、格式和已知问题的探索性分析,而无需下载完整的多TB原始数据集。它适用于深度估计和深度完成任务,但并非用于重现原始论文训练结果的均匀随机样本。数据集语言为英语(仅图像和深度传感器数据,无自然语言内容),许可证为apache-2.0,但需注意原始数据许可证可能存在不一致性。

This is a dataset named lingbot-depth-subset, which is a representative, recon-sampled subset of robbyant/mdm_depth (the LingBot-Depth training corpus), reformatted into FiftyOnes grouped-dataset structure with gt_depth and raw_depth as fo.Heatmap fields. The dataset contains 13,149 samples (10,207 groups) spanning three sub-collections: RobbyReal (real-world indoor RGB-D captures), RobbyVla (real-world VLA robot manipulation using a Franka arm), and RobbySim (simulated renders). This subset is primarily intended for validating FiftyOne import tooling and enabling exploratory analysis of the datasets structure, formats, and known quirks without downloading the full multi-terabyte source dataset. It is suitable for depth estimation and depth completion tasks but is not a uniformly random sample for reproducing the papers training results. The dataset language is English (image and depth-sensor data only, no natural language content), with an apache-2.0 license, though note potential inconsistencies in the original data license.

提供机构:
Voxel51
搜集汇总
数据集介绍
Voxel51/lingbot-depth-subset 数据集图片
构建方式
该数据集源于LingBot-Depth训练语料库,通过流式传输并提前中断源存档的提取过程构建而成。原始语料库包含超过302万样本,以多百GB的压缩档案形式存储。本子集仅捕获每个存档中首先出现的场景与序列,并非均匀随机采样。数据被重新格式化至FiftyOne的原生分组数据集结构中,并集成了包括RobbyReal、RobbyVla和RobbySim在内的三个子集合,总计13,149个样本(10,207组),以支持工具验证与探索性分析。
特点
该数据集的特点在于其高度异质性,涵盖了真实世界室内RGB-D捕获、机器人操控场景以及模拟渲染数据。每个样本均包含伪地面真实深度与原始传感器深度,并以FiftyOne的热力图字段存储。数据集还保留了源数据中不兼容的文件命名约定、缺失像素标记差异以及非同步的多视图流等已知问题,为研究人员提供了检验深度补全方法在现实噪声条件下的鲁棒性的独特资源。
使用方法
用户可通过FiftyOne库便捷加载该数据集,执行`load_from_hub("Voxel51/lingbot-depth-subset")`命令即可获取。数据集内建了按子集合和传感器标识符划分的保存视图,支持通过FiftyOne的群组数据结构进行多模态探索。此外,动态分组视频视图允许将连续传感器流作为视频播放,便于直观检查帧间运动。用户可借此分析深度图的有效像素分布,并利用百分位数范围进行可视化,无需下载完整的多TB级语料库。
背景与挑战
背景概述
深度估计与补全技术是计算机视觉与机器人感知领域的核心任务之一,旨在从RGB图像或稀疏深度测量中恢复稠密、度量的三维结构。2026年,蚂蚁集团Robbyant团队(Bin Tan、Changjiang Sun等)发布了LingBot-Depth数据集及其配套的掩码深度建模(MDM)方法,提出将传感器中缺失或无效的深度像素视为“自然掩码”,通过视觉变换器学习从RGB上下文与有效深度中重建完整深度图。该数据集包含超过302万个RGB-D样本,融合了真实世界多传感器捕获(RobbyReal)、机器人操作场景(RobbyVla)以及合成渲染数据(RobbySim),并额外整合了ClearGrasp、Hypersim等7个公开数据集,构成千万级训练语料,为空间感知研究提供了大规模、多模态的基础资源。本研究聚焦的lingbot-depth-subset是由Harpreet Sahota采用FiftyOne框架从原始语料中重构抽样的代表性子集,包含13,149个样本(10,207组),旨在支持工具链验证与探索性分析。
当前挑战
该数据集所解决的领域问题核心在于深度补全与估计任务中稀疏、噪声与缺失数据的挑战——真实场景下传感器在反射、透明表面及远距离处常产生无效深度或异常离群值,而传统方法难以有效利用部分有效信号。构建过程中遭遇的挑战包括:原始语料以数TB的.tar.zst压缩包形式发布,单次完整下载成本极高,因此本子集采用流式截取策略,导致采样并非均匀随机,场景与传感器覆盖存在偏差(如仅包含franka机器人);来源数据存在三种不兼容的文件命名约定及两种无效像素标记(0和65535),需分别设计解析规则;RobbyVla中左右IR立体相机的帧同步率极低(平均Jaccard指数仅0.14),多数分组为单传感器样本;此外,流式传输中检测到5个截断文件需排除,且热力图范围采用百分位数而非原始极值以避免离群值压缩色彩尺度,增加了预处理复杂性。
常用场景
经典使用场景
lingbot-depth-subset作为大规模RGB-D深度数据集LingBot-Depth的代表性子集,在深度估计与深度补全领域展现出独特的应用价值。该数据集通过FiftyOne框架的组化结构组织,涵盖真实室内场景(RobbyReal)、机器人操作场景(RobbyVla)以及合成渲染场景(RobbySim)三大子集,共计超过一万个样本组。研究者常利用其丰富的传感器配置(包括Orbbec、RealSense等多种RGB-D相机)和配套的相机内参,探索如何从稀疏且含有缺失像素的原始深度数据中恢复出完整的度量深度信息。数据集中精心保留了原始传感器深度与伪地面真值深度之间的差异,使其成为评估深度补全算法对透明、反射表面等挑战性场景处理能力的理想测试基准。
解决学术问题
该数据集解决的核心学术问题是深度传感器在实际应用中普遍存在的像素缺失与噪声干扰现象。受限于物理传感器原理,透明物体、远距离表面及强反射区域常导致深度值无效或异常,严重制约了机器人导航、三维重建等任务的可靠性。lingbot-depth-subset通过提供配对的有效深度与原始深度样本,使研究者得以系统性地研究掩蔽深度建模(Masked Depth Modeling)这一自监督学习范式。该范式将缺失像素视为天然掩蔽信号,训练模型从RGB图像上下文和剩余有效深度值中学习稠密深度重建,从而突破传统深度估计对完整输入数据的依赖。这一研究路径推动了三目视觉空间感知领域的发展,为构建更具鲁棒性的深度感知模型奠定了数据基础。
衍生相关工作
围绕该数据集衍生了一系列代表性的研究工作,其中最为核心的是其源数据集所支撑的Masked Depth Modeling(MDM)视觉Transformer架构。该工作在lingbot-depth-subset所代表的大规模深度语料上预训练,通过将深度传感器的缺失像素作为自然掩码信号,学习仅依靠RGB图像上下文和有限有效深度来重建稠密度量深度,开创性地将掩码建模思想引入空间感知任务。此外,完整语料库还融合了ClearGrasp、Hypersim、ScanNet++等七个外部开放数据集,形成了百万量级的联合训练资源。数据集的FiftyOne转换版本本身也催生了关于大规模异质RGB-D数据管道的设计探索,包括自动化解析多格式压缩包、处理时间戳不同步的多相机系统,以及基于百分位数的深度可视化策略等工程创新,这些工作共同推动了三维视觉数据处理基础设施的成熟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务