遇见数据集

cosmos-edge-av-trajectories

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Cosmos3-Edge AV Trajectories(场景基础)是一个用于图像到未来轨迹策略的合成自动驾驶数据集,特别适用于微调SmolVLA等模型。数据集采用LeRobot格式,每个情节包含一个仪表盘摄像头剪辑片段、对应的9D自我运动轨迹(每帧包含3维平移和6维旋转表示)以及一个简短的自然语言机动标签。数据通过cosmosmola管道在NVIDIA Cosmos3-Edge上生成:首先,边缘推理器分析起始帧并列出场景实际支持的车辆运动机动;然后,边缘图像到视频模型根据起始图像和可行的自然语言机动条件渲染合理的驾驶剪辑;接着,边缘逆向动力学从生成的剪辑中恢复9D自我轨迹,确保视频和轨迹自洽;最后,打包为原生LeRobot数据集。起始帧来自真实的前摄像头帧(已模糊处理人脸和车牌),但剪辑完全是模型生成的,不包含真实驾驶镜头重分发。数据集特征包括:832×480分辨率的前摄像头剪辑、每帧9D自我运动动作、作为占位符的9D零观察状态,以及每个情节的场景基础机动任务标签。机动分布反映真实场景承受能力,主要为直线驾驶,在场景支持时包含转弯、减速或停止。数据集规模小于10K,持续追加增长,适用于机器人学、自动驾驶和轨迹预测等任务,内容受NVIDIA开放模型许可证约束。

Cosmos3-Edge AV Trajectories (Scene-based) is a synthetic self-driving dataset for image→future trajectory policies, particularly suitable for fine-tuning models like SmolVLA. The dataset adopts the LeRobot format, with each episode containing a dashboard camera clip, corresponding 9D ego-motion trajectories (including 3D translation and 6D rotation per frame), and a short natural language maneuver label. Data is generated via the cosmosmola pipeline on NVIDIA Cosmos3-Edge: first, an edge inferencer analyzes the starting frame and lists vehicle motion maneuvers supported by the scene; then, an edge image-to-video model renders plausible driving clips based on the starting image and feasible natural language maneuver conditions; next, edge inverse dynamics recovers 9D ego trajectories from the generated clips, ensuring consistency between video and trajectories; finally, it is packaged as a native LeRobot dataset. The starting frames are from real front camera frames (with faces and license plates blurred), but the clips are entirely model-generated and do not include redistribution of real driving footage. Dataset features include: 832×480 resolution front camera clips, 9D ego-motion actions per frame, 9D zero observation states as placeholders, and scene-based maneuver task labels for each episode. Maneuver distribution reflects real-world scenario capacity, primarily straight driving, with turns, deceleration, or stops when supported by the scene. The dataset size is less than 10K, continuously growing, and applicable to tasks in robotics, autonomous driving, and trajectory prediction, with content constrained by the NVIDIA Open Model License.

创建时间:
2026-07-22
原始信息汇总

Cosmos3-Edge AV Trajectories (scene-grounded) 数据集概述

基本信息

  • 许可证: NVIDIA Open Model License
  • 任务类别: 机器人学 (robotics)
  • 标签: lerobot, robotics, autonomous-driving, trajectory-prediction, cosmos, smolvla, synthetic
  • 数据集规模: n<10K (小于10,000个样本)

数据集描述

该数据集是一个合成自动驾驶数据集,用于训练 图像→未来轨迹 策略(例如微调 SmolVLA)。每个episode将行车记录仪片段与 9D运动轨迹 以及一个简短的 自然语言操作标签 配对,数据格式为 LeRobot。数据集会随时间持续增长。

生成方法

数据集通过 cosmosmola 流水线 在 NVIDIA Cosmos3-Edge 上完全生成,流程如下:

  1. 推理 (Reason): Edge Reasoner 分析起始帧,列出场景实际允许的车辆操作动作。
  2. 生成 (Generate): Edge 图像转视频模型根据起始图像和一种可行的自然语言操作条件,渲染出合理的驾驶片段。
  3. 恢复 (Recover): Edge 逆动力学模型从生成的片段中恢复 9D 自车轨迹,确保(视频,轨迹)对自洽。
  4. 打包 (Package): 组装为原生 LeRobot 数据集,操作文本作为语言标签。

起始帧来自 nvidia/PhysicalAI-Autonomous-Vehicles 数据集的真实前摄像头帧(人脸/车牌已在源头模糊处理)。所有片段均由 Cosmos3-Edge 模型生成,不重新分发真实驾驶录像。

数据集特征

  • observation.images.ego_view: 前摄像头片段,分辨率 832×480
  • action: 每帧的 9D 自车运动数据,格式为 [平移(3), rot6d(6)],逐帧向后
  • observation.state: 9D 零值(不捕捉自车本体感知)
  • task (每个episode): 场景相关的操作描述(自然语言)

使用示例

python from lerobot.datasets.lerobot_dataset import LeRobotDataset ds = LeRobotDataset("hakuturu583/cosmos-edge-av-trajectories")

注意事项

  • 操作分布反映真实场景的可行性(主要为直行,在场景允许的情况下包括转弯、减速或停车)
  • observation.state 为零占位符,如有真实速度/转向数据可替换
  • 内容由 Cosmos3-Edge 生成,受 NVIDIA Open Model License 约束
搜集汇总
数据集介绍
cosmos-edge-av-trajectories 数据集图片
构建方式
该数据集基于NVIDIA Cosmos3-Edge模型,通过cosmosmola管道构建。首先,Edge Reasoner分析起始帧,识别场景实际支持的运动操纵;随后,Edge图像到视频模型根据自然语言操纵描述生成逼真的驾驶片段,并利用逆动力学从视频中恢复9自由度自我轨迹,确保数据自洽;最终,将这些元素组装成LeRobot格式的数据集,操纵文本作为语言标签。起始帧源自真实前置摄像头图像,但生成的视频片段均为模型产出,不包含真实驾驶画面。
特点
数据集以LeRobot格式封装,每个片段包含前置摄像头视频、9自由度自我运动轨迹以及自然语言操纵标签。轨迹以平移和旋转向量表示,并按帧对齐。任务标签从场景中推导得出,反映了真实道路的可行操控分布,如直行、转弯、减速等,避免了不切实际的操纵。数据集规模持续增长,为轨迹预测策略提供可扩展的训练资源。
使用方法
用户可通过LeRobot库加载数据集,例如使用`LeRobotDataset("hakuturu583/cosmos-edge-av-trajectories")`。它适用于微调SmolVLA等图像到未来轨迹策略模型,通过指定策略类型、数据集标识符及批次大小等参数进行训练。注意,`observation.state`字段为占位零值,可替换为实际速度或转向数据。所有内容受NVIDIA开放模型许可约束。
背景与挑战
背景概述
在自动驾驶与机器人操作交叉融合的前沿领域,预测自车未来轨迹是实现安全、智能决策的关键技术之一。该数据集由研究团队借助NVIDIA Cosmos3-Edge平台构建,于近期发布,旨在为基于图像的未来轨迹预测策略(如SmolVLA模型微调)提供高质量数据支撑。其核心研究问题在于如何利用合成场景生成技术,从单一前视图像出发,产出具有自洽性的多帧运动轨迹和自然语言操控标签。该数据集的独特之处在于其场景接地(scene-grounded)生成流程:通过先分析场景可执行的驾驶动作,再生成相应视频,最后反解出自车9D轨迹,确保了数据的内在一致性和物理合理性。此举极大地丰富了开源社区在自动驾驶轨迹预测与视觉-语言-动作联合建模领域的数据资源,为低数据场景下的模型泛化提供了宝贵基准。
当前挑战
该数据集主要应对的领域挑战包括:传统真实驾驶数据采集成本高昂、场景多样性受限,且难以获得精确的稠密运动轨迹标注。构建过程中面临的核心挑战在于:其一,生成的视频与轨迹必须严格符合真实道路拓扑和交通规则,任何虚假动作都会误导模型对场景语义的理解;其二,逆动力学恢复轨迹的精度需足够高,以保证从视频反推的9D运动与原始规划一致,避免合成伪影引发的训练噪声;其三,合成数据与真实场景分布存在域间隙,需谨慎评估模型在域迁移时的泛化能力;最后,连续迭代生成带来的数据规模扩展需兼顾计算效率与质量控制,确保新增样本不引入系统性偏差。
常用场景
经典使用场景
在机器人学习与自主驾驶交叉领域,cosmos-edge-av-trajectories数据集为从单目图像到未来运动轨迹的端到端策略学习提供了关键支撑。其核心用法在于训练视觉-语言-动作(VLA)模型,例如基于SmolVLA架构的微调任务,使模型能够依据前视摄像头画面直接预测车辆在未来数帧内的9自由度运动轨迹,包括三维平移和六维旋转分量。这一范式将感知、推理与规划融为一体,无需传统管线中繁琐的状态估计与分离式决策模块。
实际应用
在现实部署层面,该数据集支撑着下一代自主驾驶系统的规划模块研发。开发者可利用其微调轻量级视觉语言动作模型,使其能够理解复杂道路结构——例如基于车道线布局判断左转可行性而非强行学习不存在的转向模式。得益于每段剪辑附带的自然语言操作标注,模型还可实现语言引导的动态决策,如根据指令“前方斑马线慢行”产生对应减速轨迹,为可解释的类人驾驶行为构建提供数据基础。
衍生相关工作
围绕此数据集衍生的经典工作主要聚焦于生成式驾驶策略。以SmolVLA为代表的视觉语言动作模型通过在此数据上微调,学会了将图像特征直接解码为连续轨迹,开创了从视频生成-轨迹恢复闭环中学习运动先验的范式。此外,Cosmos3-Edge管道本身构成的场景推理-视频生成-逆动力学三阶段流程,推动了可控驾驶视频生成和基于物理规律的自监督表达学习方向的发展,启发了后续将世界模型与策略学习统一化的系列研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务