K-Risk
收藏资源简介:
K-Risk是一个知识增强的高风险驾驶场景数据集,包含LLM生成的自动驾驶自然语言标注。它聚合了欧洲、中国和美国的20个自然驾驶(HV)和自动驾驶车辆(AV)轨迹源,涵盖高速公路、城市快速路、交叉口和环岛,并精选了31,398个高风险事件,包括1,036个极端近碰撞事件子集。每个事件以CSV(轨迹)、JSON(元数据)和TXT(自然语言标注)的同步三元组形式存储,支持CPT、SFT、RLHF和RLVR等后训练阶段。
K-Risk is a knowledge-augmented high-risk driving scenario dataset containing natural language annotations for autonomous driving generated by Large Language Models (LLMs). It aggregates 20 trajectory sources from naturalistic human-driven vehicles (HV) and autonomous vehicles (AV) across Europe, China and the United States, covering highways, urban expressways, intersections and roundabouts, and curates 31,398 high-risk incidents including a subset of 1,036 extreme near-collision events. Each incident is stored as a synchronized triplet of CSV (trajectory data), JSON (metadata) and TXT (natural language annotation), supporting post-training stages such as CPT, SFT, RLHF and RLVR.
K-Risk 数据集概述
K-Risk 是一个知识增强的高风险驾驶场景数据集,结合了结构化车辆轨迹与大语言模型(LLM)生成的自然语言注释,专为自动驾驶安全关键场景设计。
核心特点
- 多区域、多环境:数据集整合了来自欧洲、中国和美国的 20 个人类驾驶(HV)和自动驾驶(AV)轨迹源,涵盖高速公路、城市快速路、交叉路口和环岛。
- 多维风险定义:事件通过驾驶员风险场(DRF)过滤器、校准的硬操作阈值(急加速/制动、变道)和两秒轨迹冲突预测器筛选,并评级为中等、高或极端风险。
- 同步三元组:每个事件以 CSV(轨迹)、JSON(符号元数据)和 TXT(自然语言注释)格式存储,共享统一的事件标识符。
- 闭环 LLM 注释:代表性子集接收 LLM 的因果风险分析和离散动作建议,基于五动作模式,并在无碰撞模拟器中通过迭代反思进行验证。
- 可复用性:支持训练后阶段,包括 CPT、SFT、RLHF(偏好对)和 RLVR(可验证模拟器奖励),用于驾驶智能体。
数据集规模
- 轨迹源数量:20 个(6 个人类驾驶 + 14 个自动驾驶)
- 区域:欧洲、中国、美国
- 环境:高速公路、城市快速路、交叉路口、环岛
- 精选高风险事件:31,398 个
- 极端近碰撞子集:1,036 个事件
- 风险分布(人类驾驶):中等 76.8% · 高 19.7% · 极端 3.5%
- 唯一智能体:53,295 个(非汽车类占 18.5%:弱势道路使用者 + 重型/特殊车辆)
- LLM 注释子集:372 个事件(来自 GPT-4o 和 GPT-4.1 的响应)
- 动作模式:IDLE · Turn Left · Turn Right · Acceleration · Deceleration
数据组成
- 事件表示:每个事件由 CSV、JSON 和 TXT 文件构成,共享同一个事件 ID。
- 子集划分:人类驾驶源分为高/正常风险文件夹;极端近碰撞事件汇总在单独的 extreme 文件夹中(含 TTC_1s 和 TTC_2s 子集)。自动驾驶源按触发风险的准则(acc、brake、ttc)组织。
- LLM 分析子集:包含输入 LLM 的结构化场景描述(event_discriptions)、GPT-4o 响应(analysis_gpt4o)和 GPT-4.1 响应(analysis_gpt4.1)。
来源数据集
K-Risk 是一个次级数据集,仅发布派生的事件级片段,完整原始录音需从各自提供商获取:
- 人类驾驶车辆:highD(德国高速公路)、inD(德国交叉路口)、rounD(德国环岛)、ExpresswayA(中国城市快速路)、FreewayB(中国城市快速路)、NGSIM I-80(美国高速公路)。
- 自动驾驶车辆:包含 Argoverse 2、Waymo Open Motion、Waymo Open Perception、MicroSimACC、多个 OpenACC 源(JRC 欧洲)以及 CATS、Central Ohio、Vanderbilt ACC 数据集(均通过 Ultra-AV 统一收集)。
数据模式
每个事件包含以下字段(来源间可能略有差异):
- 事件级描述:事件 ID、来源数据集、Ego ID、风险等级、帧范围,以及高D来源中的关系和行为信息。
- 逐帧轨迹字段:帧索引、智能体 ID、位置(米)、尺寸(米)、速度(米/秒)、速度分量、加速度(米/秒²)、航向(度)、偏航率(度/秒)、车道、智能体类别、间距(米、秒)、碰撞时间(秒)、轨迹冲突、风险值、周围智能体、行为标志。
- 自然语言注释:结构化场景描述、基于规则的风险提醒、LLM 风险分析和离散动作 ID。
许可与获取
- 代码与管道:基于 MIT 许可在 GitHub 上发布(https://github.com/benmagnifico/K-Risk)。
- 数据集:通过 Figshare 分发(DOI 待指定),包含 trajectory_data、event_annotations 和 llm_analysis 目录。
- 许可:管道代码和派生 K-Risk 记录仅供研究使用。原始录音遵循各自提供商的许可条款。




