遇见数据集

OpenLongTail

收藏
arXiv2026-07-11 更新2026-07-14 收录
数据链接:
官方服务:

资源简介:

OpenLongTail是由德克萨斯农工大学、英伟达等多机构联合创建的开源生成式数据引擎,旨在解决自动驾驶领域长尾事件数据稀缺的瓶颈问题。该数据集通过创新的姿态感知外推视图合成管道,将异构的单目行车视频转化为空间对齐且时间连贯的多视角资产,数据规模包含1万条精调样本,并整合了来自Waymo E2E、众包视频等多源数据。其创建过程深度融合了普吕克射线几何编码、时序深度扭曲和跨视图记忆库等先进技术,实现了从单目观测到目标相机阵列的几何一致生成。该数据集主要应用于自动驾驶策略的鲁棒性训练,能够有效提升模型在动物穿行、施工区等罕见长尾场景中的泛化能力和安全性能。

OpenLongTail is an open-source generative data engine jointly developed by multiple institutions including Texas A&M University and NVIDIA. It aims to address the bottleneck issue of scarce data for long-tail events in the autonomous driving domain. By leveraging an innovative pose-aware extrapolation view synthesis pipeline, this engine converts heterogeneous monocular driving videos into spatially aligned and temporally consistent multi-view assets. It includes 10,000 fine-tuned samples and integrates multi-source data from sources such as Waymo E2E and crowdsourced videos. Its development process deeply integrates advanced technologies including Plücker ray geometric encoding, temporal depth warping, and cross-view memory banks, enabling geometrically consistent generation from monocular observations to target camera arrays. This dataset is primarily applied for robustness training of autonomous driving strategies, and can effectively improve the generalization ability and safety performance of models in rare long-tail scenarios such as animal crossings and construction zones.

创建时间:
2026-07-11
原始信息汇总

数据集名称

OpenLongTail:长尾驾驶数据的生成式缩放

核心任务

将异构的长尾驾驶视频(尤其单目视角)转化为姿态对齐、时间一致的完整多视角环绕场景数据,用于规模化训练自主驾驶策略模型,提升对长尾事件的鲁棒性。

关键方法

  • 度量姿态恢复 (Metric Pose Recovery):使用MapAnything恢复度量尺度的自我轨迹,并通过卡尔曼+RTS平滑消除抖动。
  • 普吕克射线几何 (Plücker Ray Geometry):为每个令牌编码目标相机光线,确保所有分支在统一的3D射线框架下工作。
  • 时间深度扭曲 (Temporal Depth Warp):基于深度的重投影将可见的前视角证据传播到侧方和后方目标视角,即使零重叠区域也可处理。
  • 跨视角记忆 (Cross-View Memory):构建有向记忆图,使每个目标视角能基于已生成的相邻视角进行条件生成,实现无缝一致性。
  • 生成引擎基线:基于Wan 2.1-VACE骨干网络。

数据生成能力

  • 输入:单一前视角(单目)长尾驾驶视频
  • 输出:前、左、右、左后、右后、后长焦共六个标准环绕视角(目标相机配置)
  • 支持跨来源缩放:可将外部单目视频(如Waymo E2E)转化为目标配置的多视角资产,拓展训练池。

实验验证

  • 视觉保真度与跨视角一致性:通过外推视角合成和姿态指标验证有效性。
  • 闭环驾驶策略提升:在AlpaSim的53个长尾事件闭环评估中:
    • 使用OpenLongTail生成的合成多视角数据微调Alpamayo-R1策略,平均AlpaSim得分达到0.748,碰撞率降至0.0%;
    • 性能接近使用真实多视角数据的模型(0.764 AS,0.0%碰撞率),优于基线模型。
  • 跨来源缩放:结合NVIDIA PAV内部数据与Waymo E2E外部数据生成的合成资产,在十字路口、骑行者、非常见车辆等场景中产出更一致的闭环滚动结果。

论文与代码

  • 论文:arXiv:2607.09655
  • 代码及项目页面:https://openlongtail.github.io/
搜集汇总
数据集介绍
OpenLongTail 数据集图片
构建方式
OpenLongTail的构建始于对异构长尾驾驶视频的收集,这些视频来源于NVIDIA PhysicalAI-Autonomous-Vehicles、PandaSet、nuScenes以及Waymo E2E等大规模数据集,以及众包的行车记录仪视频。为了将这些缺乏完整多视角覆盖的杂乱数据转化为可用于策略学习的同步多视角资产,该引擎首先利用MapAnything从单目前置视频中恢复度量尺度的自我轨迹,并经过卡尔曼滤波与RTS平滑以消除抖动。接着,通过一个基于Wan 2.1-VACE扩散模型的姿态感知外推视图合成流水线,将Plücker光线几何、时间深度扭曲和跨视角记忆库注入生成过程,为每个目标相机合成缺失的侧方和后部视图,最终输出姿态对齐、时序一致的多视角视频。
特点
OpenLongTail的核心特色在于其能够将来源多样、标注格式不一的单目长尾驾驶视频,统一转化为具备精确姿态信息的同步多视角资产,从而解锁了以往无法利用的异构数据源。该引擎在生成过程中深度融合了Plücker射线几何编码,确保所有合成视图共享一致的3D空间帧;同时,通过时序深度扭曲为缺乏重叠的相机(如后视)提供几何对齐的可见证据,并采用跨视角记忆库以自回归方式传播相邻视图间的上下文信息,显著增强了跨视角几何一致性。实验表明,由此生成的资产在视觉保真度、时序连贯性和自我轨迹恢复精度上均优于现有方法。
使用方法
OpenLongTail的使用遵循一个流水线式的推理流程:用户首先输入一段单目前置驾驶视频,引擎自动恢复并稳定度量尺度的自我运动轨迹,随后利用预训练的扩散模型,在Plücker光线、深度扭曲和记忆库的联合条件下,按照预定义的拓扑顺序(先侧视、后后视)自回归地合成五个非前置视角(左前、右前、左后、右后、后长焦)。生成的完整多视角资产可直接用于下游视觉-语言-动作(VLA)驾驶策略的监督微调,例如在AlpaSim闭环仿真环境中评估长尾场景下的驾驶鲁棒性。该项目开源了生成数据、模型检查点、转换工具与代码,支持用户对自身收集的长尾视频进行可扩展的数据增广。
背景与挑战
背景概述
OpenLongTail数据集由德州农工大学、英伟达、威斯康星大学麦迪逊分校、德克萨斯大学奥斯汀分校、耶鲁大学、Adobe、Meta、特拉华大学及斯坦福大学的研究团队于2026年联合创建,旨在解决自动驾驶领域长尾事件数据稀缺的瓶颈。尽管现有大规模驾驶数据集推动了视觉-语言-动作(VLA)策略在常规场景下的发展,但诸如动物穿行、施工区域等长尾事件在精心策划的数据集中极为罕见,且难以通过校准的多相机系统大规模捕获。这些异构源的现实世界长尾视频往往缺乏完整视角覆盖,仅来自单目行车记录仪,因而无法直接转化为策略训练所需的多视图同步资产。OpenLongTail通过开源生成数据引擎,将异构视频转换为视角对齐、时间一致的多视图数据,显著提升了自动驾驶策略在长尾事件中的鲁棒性,为领域提供了可扩展的数据生成范式。
当前挑战
OpenLongTail所解决的领域挑战在于,现有自动驾驶数据集对长尾事件的覆盖严重不足,且异构来源(如行车记录仪、众包视频)的片段缺乏校准的多相机位姿及完整视角,导致模型在罕见场景下频繁出现安全关键性失败。构建过程中,研究团队面临两大难题:其一,如何从单目视频中恢复度量尺度的自车位姿,并确保位姿在时间上的平滑与一致性,以避免生成过程中因位姿抖动导致的视觉伪影;其二,在侧面及后视相机视野与前置相机重叠极小甚至无重叠的情况下,如何通过外推式视角合成生成空间一致、时间连贯的缺失视角,同时避免交叉视图间的几何断裂。为此,OpenLongTail融合了Plücker射线几何、时序深度扭曲及跨视图记忆库,有效突破了单目视频到多视图资产转化的技术壁垒。
常用场景
经典使用场景
OpenLongTail的核心应用场景是将异构来源的长尾驾驶视频转化为时空一致的多视角数据资产。具体而言,该数据集能够从单目行车记录仪或未标定的前视视频中,通过度量尺度轨迹恢复与Plücker射线几何注入,生成同步的多相机环视视频。这一能力使得大量散落在不同数据源中的罕见事件——如动物横穿道路、施工区域、逆向行驶和非典型车辆行为——得以被统一转化为适用于端到端驾驶策略训练的标准化数据,从而突破了传统数据集在长尾场景覆盖上的容量瓶颈。
衍生相关工作
OpenLongTail的提出催生了一系列围绕生成式数据缩放与驾驶策略鲁棒性提升的后续工作。一方面,其基于Plücker射线几何和跨视角记忆库的合成方法启发了更高效的视角外推生成模型,推动了可控视频生成在驾驶场景中的几何一致性研究。另一方面,其闭环仿真评估体系为长尾驾驶策略的量化评测树立了标杆,促进了端到端VLA模型在罕见条件下的泛化能力探索。此外,该工作中关于数据分布对齐与缩放效率关系的分析,为未来的样本高效数据筛选与领域自适应方法提供了重要的理论启示和实验验证。
数据集最近研究
最新研究方向
在自动驾驶领域,长尾事件数据的稀缺性长期制约着闭环策略的鲁棒性。OpenLongTail作为一项开创性的开源生成式数据引擎,致力于将异构、未标定的单目长尾行车视频,转化为空间对齐且时间连贯的多视角训练资产。其前沿研究方向聚焦于借助几何感知的扩散模型与Plücker射线注入技术,实现外推视角的高保真合成,从而弥合碎片化数据源与结构化策略训练之间的模态鸿沟。该工作不仅显著提升了在复杂路口、非常规车辆及施工区域等极端场景下的闭环驾驶表现,更揭示了生成式扩展的数据分布对齐效应——即数据来源的多样性需与目标长尾切片精准匹配。OpenLongTail的提出,为利用海量互联网单目视频进行规模化、低成本的长尾策略泛化开辟了全新路径,具有深远的学术价值与产业意义。
相关研究论文
  • 1
    OpenLongTail: Generative Scaling of Long-Tail Driving Data德克萨斯农工大学; 英伟达; 威斯康星大学麦迪逊分校; 德克萨斯大学奥斯汀分校; 耶鲁大学; Adobe; Meta; 特拉华大学; 斯坦福大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务