遇见数据集

CrashTwin

收藏
github2026-06-21 更新2026-07-04 收录
数据链接:
官方服务:

资源简介:

CrashTwin是一个物理基础的评估框架,用于世界模型碰撞推演。它包含CrashTwin-Eval数据集,该数据集有300个合成和44个真实世界的碰撞视频,每个剪辑包含两个碰撞参与者,并使用相同的公共重建和评分协议进行评估。

CrashTwin is a physics-based evaluation framework for collision inference in world models. It includes the CrashTwin-Eval dataset, which comprises 300 synthetic and 44 real-world collision videos. Each video clip involves two collision participants, and all samples are evaluated using the same public reconstruction and scoring protocols.

创建时间:
2026-06-14
原始信息汇总

数据集概述:CrashTwin

CrashTwin 是一个基于物理的基准测试数据集,专门用于评估世界模型在碰撞场景下的多智能体动力学表现。该数据集提供了一套标准化的评估协议,通过从模型生成的碰撞视频中重建物理属性并计算诊断分数,来量化世界模型的碰撞预测能力。

核心组成

CrashTwin 分为两个主要部分:

  • CrashTwin-Eval:用于定量基准测试的固定评估集,包含 300 个合成碰撞视频和 44 个真实世界碰撞视频,总计 344 个场景。每个视频片段包含两个碰撞主体。
  • CrashTwin-Data:用于训练和后训练的补充数据。

评估流程

  1. 数据输入:将待评估模型生成的碰撞视频放入 predictions/<model_name>/ 目录。
  2. 物理属性重建:评估系统从单目视频中重建公制尺度的物理属性(如轨迹、速度等)。
  3. 评分与报告:系统输出每个视频的详细指标和汇总的基准测试分数,最终结果保存在 outputs/<model_name>/ 目录下的 CSV 文件中。

数据集布局

下载 CrashTwin-Eval 并添加模型预测视频后,仓库的标准目录结构如下:

CrashTwin/ ├── benchmark/ # 基准数据(CSV、元数据、车辆规格) │ ├── crashtwin_eval.csv │ ├── auto_json/ │ └── vehicle_specs/ ├── checkpoints/ # 评估所需的预训练模型权重 │ ├── droid.pth │ ├── metric_depth_vit_giant2_800k.pth │ ├── nuScenes_3Dtracking.pth │ └── searaft/ ├── first_frames/ # 合成视频首帧图像 ├── assets/ # 处理脚本 └── predictions/ # 待评估模型生成的视频 └── <model_name>/ ├── <video_id>.mp4 └── ...

评估结果输出

评估完成后,主要结果文件位于 outputs/<model_name>/

  • summary_metrics.csv:整体 CrashTwin-Eval 汇总分数。
  • per_video_metrics.csv:每个评估视频的独立指标。
  • failed_videos.csv:未能完成评估的视频记录。
  • per_video/:包含每个视频的详细中间重建结果和可视化文件。

技术架构

CrashTwin 的评估流程依赖于多项开源技术,包括:

  • DROID-SLAM:相机运动估计。
  • Metric3D:公制深度重建。
  • SAM 2:视频目标分割。
  • SEA-RAFT:光流估计。
  • CenterTrack:单目3D车辆检测与跟踪。
  • OpenCLIP:外观特征提取。

引用资源

搜集汇总
数据集介绍
CrashTwin 数据集图片
构建方式
CrashTwin 数据集的构建根植于对世界模型中多智能体碰撞动力学评估的物理基础需求。该数据集包含 300 个合成碰撞视频与 44 个真实世界碰撞视频,每个片段均涉及两个碰撞实体。其数据来源涵盖仿真环境生成及真实场景采集,并遵循统一的预处理流程。数据集通过 Docker 容器化工具实现标准化处理,包括从单目视频中重建公制尺度的物理属性,如物体运动轨迹、深度与三维边界框,进而为每一视频片段计算诊断性评估分数。这种基于物理约束的构建范式确保了数据在时空一致性上的高度保真。
使用方法
使用 CrashTwin 首先需从 Hugging Face 下载 CrashTwin-Eval 数据集,并将其与模型生成视频置于指定目录结构中。评估流程依赖于 Docker 容器,用户需拉取预处理与重建镜像,并通过提供的评估脚本一次性启动。脚本支持单卡或多卡并行,自动分片处理基准测试视频。评估后,用户可在输出目录获取汇总指标与逐视频分析文件(含 JSON 格式得分与可视化轨迹),从而系统性地诊断世界模型在碰撞预测任务中的表现。训练或后训练数据则通过 CrashTwin-Data 独立获取,以支持模型微调。
背景与挑战
背景概述
CrashTwin是由德克萨斯A&M大学、明尼苏达大学、耶鲁大学、德克萨斯大学奥斯汀分校、英伟达及斯坦福大学等机构的研究人员于近年联合构建的物理驱动多智能体动力学基准数据集。该数据集聚焦于世界模型在碰撞场景下的多智能体动态预测能力评估,通过引入物理约束的评估框架,旨在解决现有世界模型生成碰撞视频时缺乏客观定量指标的问题。CrashTwin包含300个合成场景与44个真实世界的碰撞视频,每个片段均涉及两碰撞主体,并配套了统一的度量级物理属性重建与评分协议。该数据集为自动驾驶、机器人交互等安全关键领域提供了标准化的诊断工具,显著推动了多智能体动力学建模研究的发展。
当前挑战
CrashTwin所解决的领域挑战在于世界模型生成的碰撞视频缺乏物理一致性验证手段,传统评估方法难以量化预测轨迹与真实物理规律的吻合程度。在构建过程中,研究人员面临多重技术挑战:首先,必须从单目视频中精确恢复米制级三维物理属性,这涉及相机运动估计、深度重建、三维检测与跟踪等多模态感知任务的协同;其次,需要设计能够跨越合成与真实域差异的标准化重建流程,确保评估协议在不同数据源上保持公平性;此外,多智能体碰撞的瞬时动态对时序对齐与空间分辨率提出严苛要求,任何感知模块的误差累积都会显著影响最终诊断分数的可靠性。
常用场景
经典使用场景
在具身智能与自动驾驶领域,世界模型对多智能体动力学的精准建模是保障安全决策的核心挑战。CrashTwin作为一个物理锚定的基准数据集,其经典使用场景聚焦于评估世界模型生成的碰撞视频中多智能体的动力学真实性与物理一致性。研究者利用该数据集中的344个精心设计的合成与真实碰撞场景,通过统一的评估协议,从单目视频中重建公制尺度的物理属性,系统量化模型在速度、加速度及碰撞响应等维度上的物理偏差。
解决学术问题
该数据集有效解决了当前世界模型评估中缺乏物理可解释性验证标准的关键学术问题。现有评估多依赖视觉感知质量指标,却难以衡量模型对真实物理规律的内化程度。CrashTwin通过引入物理主义诊断评分,填补了多智能体轨迹规划中的碰撞动力学验证空白,为对比不同架构的世界模型提供了可复现的基准。其研究意义在于推动世界模型从“视觉逼真”向“物理可信”的范式演进,为安全关键系统如自动驾驶的闭环仿真奠定方法论基础。
实际应用
在实际工程领域,CrashTwin为自动驾驶仿真测试平台提供了高保真的碰撞场景评估工具。自动驾驶公司可将其集成到开发流水线中,检验规划与预测模型在罕见但危险的碰撞情境下的物理合理性,从而在不依赖真实路测的前提下暴露隐性安全缺陷。此外,该数据集还可用于训练后优化,通过校准世界模型对动量、摩擦等物理量的表征精度,提升仿真器在复杂多车交互场景中的可信度,降低实车测试风险与成本。
数据集最近研究
最新研究方向
CrashTwin作为首个基于物理规律的多智能体碰撞动力学基准,正推动世界模型从视觉一致性向物理可解释性跃迁。在自动驾驶安全验证与具身智能体碰撞规避等前沿领域,该数据集通过精确重建单目视频中的公制尺度物理属性(如速度、动量与接触力),为评估生成式世界模型在交互场景中的物理真实性提供了量化诊断框架。其包含344个精心设计的合成与现实碰撞场景,结合可复现的重建-评分协议,有效揭示了当前视频生成模型在物理规则遵守、多体因果推理及碰撞后动力学演化上的根本局限。这一工作直接回应了近期学界对‘世界模型必须内嵌物理常识’的强烈呼吁,为构建可靠、可验证的下一代具身智能系统树立了关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务