遇见数据集

Sidewalk3D

收藏
arXiv2026-06-17 更新2026-06-19 收录
数据链接:
官方服务:

资源简介:

Sidewalk3D是由加州大学洛杉矶分校与Coco Robotics等机构联合创建的大规模人行道感知数据集,专为移动机器人3D占用预测任务设计。该数据集包含多地点、多时段采集的激光雷达-相机配对序列,覆盖多样化城市场景与时间变化,提供精确的3D语义占用标注用于评估,数据量丰富且具有真实世界复杂性。数据集通过精细传感器校准与高质量标注流程构建,旨在解决人行道环境中机器人感知的泛化难题,支持自动驾驶之外的人行道机器人导航、障碍物识别与场景理解等应用领域。

Sidewalk3D is a large-scale sidewalk perception dataset jointly created by the University of California, Los Angeles (UCLA) and institutions including Coco Robotics. It is specifically designed for 3D occupancy prediction tasks of mobile robots. The dataset contains LiDAR-camera paired sequences collected across multiple locations and time periods, covering diverse urban scenarios and temporal variations, and provides accurate 3D semantic occupancy annotations for evaluation. With abundant data volume and real-world complexity, the dataset is constructed via precise sensor calibration and high-quality annotation workflows, aiming to address the generalization challenges of robot perception in sidewalk environments. It supports multiple application fields such as sidewalk robot navigation, obstacle recognition and scene understanding, in addition to autonomous driving.

创建时间:
2026-06-17
原始信息汇总

WalkOCC 数据集概述

WalkOCC 是一个用于人行道机器人单目3D语义占用感知的数据集,旨在提升机器人对环境几何和语义的理解能力。

核心特性

  • 混合2D-3D学习框架:通过混合射线步进(ray-marching)3D语义占用学习框架,结合有限的LiDAR-RGB配对序列与大规模无配对的单目图像,在不依赖昂贵3D标注的情况下,提升模型的鲁棒性和泛化能力。
  • 伪3D监督:利用有限的配对传感器数据,通过引导伪3D监督来学习可靠的人行道3D占用预测,训练过程比纯自监督管道更稳定。
  • 2D图像扩展:通过额外2D图像的混合训练,使模型能够适应多样化的真实世界外观,增强跨域泛化能力,超越配对数据的分布范围。

引入的 Sidewalk3D 数据集

数据集详情页介绍了与WalkOCC框架配套引入的Sidewalk3D数据集,这是一个大规模、跨域的人行道感知数据集。

  • 数据来源:包含LiDAR-相机配对序列,覆盖多个地点和时间段。
  • 标注:提供了3D语义占用标注,用于基准测试。
  • 难度:数据集捕获了跨区域和不同时间段(白天和夜晚)的多样化外观,为城市人行道占用预测提供了具有挑战性的基准。

技术架构

WalkOCC框架包含两个关键组件:

  1. 深度感知升维架构:将前视图像转换为3D语义占用网格。
  2. 混合训练策略:通过基于射线步进的2D-3D一致性损失,同时利用2D和3D监督。这种一致性约束使得模型能够从大规模2D数据中有效学习,同时保持几何精度,从而提高预测质量和跨域泛化能力。

相关资源

  • 代码:提供开源代码链接。
  • 论文:提供论文链接。
搜集汇总
数据集介绍
Sidewalk3D 数据集图片
构建方式
Sidewalk3D数据集的构建源于对城市人行道环境中移动机器人安全导航需求的深刻洞察。研究者利用配备前视相机、3D激光雷达、惯性测量单元及轮式里程计的移动机器人平台,在旅游区、住宅区和商业区三类典型城市区域进行了大规模数据采集,覆盖白天与夜晚不同光照条件,总计采集10小时数据,包含1089个序列,每个序列包含60帧同步的激光雷达-相机数据及位姿信息。数据经过滤波去除静态或无效片段后,采用扩展卡尔曼滤波融合IMU与轮式里程计恢复机器人位姿,进而将多帧点云聚合至统一坐标系。为生成高质量的3D语义占据标签,研究者微调了SAM3模型以适配人行道场景(如路缘、人行横道、排水沟等特殊类别),通过过完备提示集生成密集2D伪标签,再将激光雷达点云投影至图像平面获取语义,最后通过多帧投票抑制语义闪烁,并利用SurroundOcc管线将语义点云转换为占据网格真值。
特点
Sidewalk3D数据集具有鲜明的领域特色与实用价值。它聚焦于真实世界中拥挤、杂乱且缺乏结构化的人行道环境,与传统的道路自动驾驶数据集形成鲜明互补。数据集覆盖旅游区、住宅区和商业区三种区域类型,白天与夜晚场景各占约半数,充分体现了环境与光照的多样性。在语义标注上,数据集定义了14个3D占据类别,特别包含了人行道场景特有的路缘、排水沟、人行横道等精细结构,以及行人、自行车、轮椅等动态目标,对细粒度场景理解提出了更高要求。值得注意的是,数据集中骑行者与动物等类别占比偏低,反映了真实分布的长尾特性。此外,数据集提供了跨机器人平台(轮式、四足、人形)的测试数据,支持跨形态泛化能力评估,为人行道移动机器人的感知研究提供了独特而全面的基准。
使用方法
Sidewalk3D数据集主要用于训练和评估单目3D语义占据预测模型,尤其适用于人行道机器人的感知研究。用户可参照WalkOCC框架的使用范式:首先利用数据集中的激光雷达-相机配对序列生成伪占据标签,训练初始的单目预测器;随后结合额外的无配对单目图像进行混合训练,通过深度感知提升模块和光线行进一致性损失,在2D与3D监督间建立桥梁。数据集提供了标准化的训练/验证/测试划分(928/103/57个序列),其中测试序列经过了人工精修以保证评估可靠性。评价指标包括基于14类语义的mIoU和占据IoU,支持域内精度与跨域(夜间、不同区域、不同机器人形态)泛化能力的全面评估。数据以SurroundOcc格式提供,用户可直接套用现有占据预测框架进行模型开发与基准测试,代码与数据均将开源。
背景与挑战
背景概述
Sidewalk3D数据集由加州大学洛杉矶分校、浙江大学与Coco Robotics的研究团队于2026年联合创建,旨在解决移动机器人在人行道环境中的三维语义占据感知这一核心研究问题。相较于结构化的道路场景,真实世界的人行道充斥着行人、障碍物与各类非结构化元素,对快递机器人与电动轮椅等平台的自主导航构成了严峻挑战。现有占据感知方法多面向自动驾驶设计,依赖昂贵的大规模激光雷达-相机配对数据与多视角输入,难以直接迁移至资源受限且视角单一的移动机器人平台。Sidewalk3D的诞生填补了这一空白,它提供了首个大规模、跨区域的人行道RGB-激光雷达配对序列,覆盖旅游区、住宅区与商业区等多种城市场景,并包含昼夜光照变化,为评估模型在真实、复杂且以人为中心的道路环境中的泛化能力奠定了坚实基础。
当前挑战
Sidewalk3D所面临的核心挑战首先源于领域问题的特殊性:人行道环境杂乱无章、结构松散,要求模型能够精细分割路缘、排水沟等细微城市元素,并在动态行人密集的场景中保持鲁棒的感知能力。现有基于自监督学习的图像基线方法往往难以捕捉此类细腻的空间结构。其次,数据集的构建过程充满技术难点——获取同步的激光雷达-相机数据需要精密的多传感器标定与时间同步,采集成本高昂且难以大规模扩展。此外,不同机器人平台(双足、四足、轮式)的传感器布局与内在参数差异显著,导致模型在跨形态部署时面临严重的域偏移。为了应对这一挑战,研究团队引入了混合训练策略,利用伪标签从有限的配对数据中引导几何感知,并通过大规模无配对单目图像增强场景多样性,从而在无额外3D标注的前提下显著提升模型对环境与形态变化的泛化鲁棒性。
常用场景
经典使用场景
Sidewalk3D数据集专为服务机器人在人行道环境中的三维语义占据感知而设计,其经典使用场景涵盖单目摄像头条件下的语义占据预测任务。研究者可基于该数据集训练模型,对前方10米×5米×5米空间内的100×50×50体素网格进行细粒度语义分类,精准识别道路、人行道、路缘、排水沟、行人、车辆等14类关键语义元素。该数据集提供的LiDAR-相机同步序列与高质量伪标签,为评估模型在密集人流、复杂障碍物及非结构化人行道场景中的三维场景理解能力提供了标准化基准。
衍生相关工作
围绕Sidewalk3D数据集,已衍生出多项推动三维占据感知领域发展的经典工作。其中,WalkOCC框架提出混合光线行进策略,通过深度感知提升模块与2D-3D一致性损失函数,在仅使用单目图像的情况下实现数据高效的占据预测。此外,针对人行道场景微调的SAM3分割模型显著提升了路缘、排水沟等细粒度语义类别的识别精度。该数据集还催生了结合占据感知与轨迹规划的端到端导航方法,以及面向跨机器人平台泛化的零样本感知评估体系,为人行道机器人从实验室环境走向复杂真实世界部署奠定了关键技术基础。
数据集最近研究
最新研究方向
Sidewalk3D数据集的最新研究方向聚焦于面向人行道移动机器人的单目3D占用感知,尤其在弱监督与跨域泛化方面取得突破。当前热点在于通过混合2D-3D学习框架(如WalkOCC)解决传统自动驾驶占用预测方法在拥挤、杂乱的非结构化人行道环境中的局限性。该研究利用LiDAR-RGB配对数据生成伪标签,并引入大规模无配对单目图像进行联合训练,显著提升了对路缘、排水沟等细微城市结构的细粒度分割能力,以及在夜间、多地点、多种机器人本体(如轮式、四足、人形)等跨环境与跨形态场景下的鲁棒性。Sidewalk3D的提出填补了人行道专用感知基准的空白,为配送机器人和电动轮椅等微出行设备的安全导航提供了关键数据支撑与评估标准。
相关研究论文
  • 1
    Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning加州大学洛杉矶分校; Coco Robotics; 浙江大学; 麻省理工学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务