遇见数据集

K-Risk

收藏
github2026-06-25 更新2026-06-29 收录
官方服务:

资源简介:

K-Risk是一个知识增强的高风险驾驶场景数据集,包含LLM生成的自动驾驶自然语言标注。它聚合了欧洲、中国和美国的20个自然驾驶(HV)和自动驾驶车辆(AV)轨迹源,涵盖高速公路、城市快速路、交叉口和环岛,并精选了31,398个高风险事件,包括1,036个极端近碰撞事件子集。每个事件以CSV(轨迹)、JSON(元数据)和TXT(自然语言标注)的同步三元组形式存储,支持CPT、SFT、RLHF和RLVR等后训练阶段。

K-Risk is a knowledge-augmented high-risk driving scenario dataset containing natural language annotations for autonomous driving generated by Large Language Models (LLMs). It aggregates 20 trajectory sources from naturalistic human-driven vehicles (HV) and autonomous vehicles (AV) across Europe, China and the United States, covering highways, urban expressways, intersections and roundabouts, and curates 31,398 high-risk incidents including a subset of 1,036 extreme near-collision events. Each incident is stored as a synchronized triplet of CSV (trajectory data), JSON (metadata) and TXT (natural language annotation), supporting post-training stages such as CPT, SFT, RLHF and RLVR.

创建时间:
2026-06-25
原始信息汇总

K-Risk 数据集概述

K-Risk 是一个知识增强的高风险驾驶场景数据集,结合了结构化车辆轨迹与大语言模型(LLM)生成的自然语言注释,专为自动驾驶安全关键场景设计。

核心特点

  • 多区域、多环境:数据集整合了来自欧洲、中国和美国的 20 个人类驾驶(HV)和自动驾驶(AV)轨迹源,涵盖高速公路、城市快速路、交叉路口和环岛。
  • 多维风险定义:事件通过驾驶员风险场(DRF)过滤器、校准的硬操作阈值(急加速/制动、变道)和两秒轨迹冲突预测器筛选,并评级为中等、高或极端风险。
  • 同步三元组:每个事件以 CSV(轨迹)、JSON(符号元数据)和 TXT(自然语言注释)格式存储,共享统一的事件标识符。
  • 闭环 LLM 注释:代表性子集接收 LLM 的因果风险分析和离散动作建议,基于五动作模式,并在无碰撞模拟器中通过迭代反思进行验证。
  • 可复用性:支持训练后阶段,包括 CPT、SFT、RLHF(偏好对)和 RLVR(可验证模拟器奖励),用于驾驶智能体。

数据集规模

  • 轨迹源数量:20 个(6 个人类驾驶 + 14 个自动驾驶)
  • 区域:欧洲、中国、美国
  • 环境:高速公路、城市快速路、交叉路口、环岛
  • 精选高风险事件:31,398 个
  • 极端近碰撞子集:1,036 个事件
  • 风险分布(人类驾驶):中等 76.8% · 高 19.7% · 极端 3.5%
  • 唯一智能体:53,295 个(非汽车类占 18.5%:弱势道路使用者 + 重型/特殊车辆)
  • LLM 注释子集:372 个事件(来自 GPT-4o 和 GPT-4.1 的响应)
  • 动作模式:IDLE · Turn Left · Turn Right · Acceleration · Deceleration

数据组成

  • 事件表示:每个事件由 CSV、JSON 和 TXT 文件构成,共享同一个事件 ID。
  • 子集划分:人类驾驶源分为高/正常风险文件夹;极端近碰撞事件汇总在单独的 extreme 文件夹中(含 TTC_1s 和 TTC_2s 子集)。自动驾驶源按触发风险的准则(acc、brake、ttc)组织。
  • LLM 分析子集:包含输入 LLM 的结构化场景描述(event_discriptions)、GPT-4o 响应(analysis_gpt4o)和 GPT-4.1 响应(analysis_gpt4.1)。

来源数据集

K-Risk 是一个次级数据集,仅发布派生的事件级片段,完整原始录音需从各自提供商获取:

  • 人类驾驶车辆:highD(德国高速公路)、inD(德国交叉路口)、rounD(德国环岛)、ExpresswayA(中国城市快速路)、FreewayB(中国城市快速路)、NGSIM I-80(美国高速公路)。
  • 自动驾驶车辆:包含 Argoverse 2、Waymo Open Motion、Waymo Open Perception、MicroSimACC、多个 OpenACC 源(JRC 欧洲)以及 CATS、Central Ohio、Vanderbilt ACC 数据集(均通过 Ultra-AV 统一收集)。

数据模式

每个事件包含以下字段(来源间可能略有差异):

  • 事件级描述:事件 ID、来源数据集、Ego ID、风险等级、帧范围,以及高D来源中的关系和行为信息。
  • 逐帧轨迹字段:帧索引、智能体 ID、位置(米)、尺寸(米)、速度(米/秒)、速度分量、加速度(米/秒²)、航向(度)、偏航率(度/秒)、车道、智能体类别、间距(米、秒)、碰撞时间(秒)、轨迹冲突、风险值、周围智能体、行为标志。
  • 自然语言注释:结构化场景描述、基于规则的风险提醒、LLM 风险分析和离散动作 ID。

许可与获取

  • 代码与管道:基于 MIT 许可在 GitHub 上发布(https://github.com/benmagnifico/K-Risk)。
  • 数据集:通过 Figshare 分发(DOI 待指定),包含 trajectory_data、event_annotations 和 llm_analysis 目录。
  • 许可:管道代码和派生 K-Risk 记录仅供研究使用。原始录音遵循各自提供商的许可条款。
搜集汇总
数据集介绍
K-Risk 数据集图片
构建方式
在自动驾驶领域,高风险场景的识别与理解是保障行车安全的核心挑战。K-Risk数据集通过整合来自欧洲、中国和美国的20个自然驾驶与自动驾驶轨迹数据源,覆盖高速公路、城市快速路、交叉路口及环岛等多种交通环境,构建了一个大规模的高风险驾驶事件库。数据集的构建采用多维风险定义策略,首先利用驾驶员风险场(DRF)滤波器、校准的硬操纵阈值(如急加速、急刹车及车道变更)以及两秒轨迹冲突预测器对原始轨迹进行事件筛选,随后将事件划分为中等风险、高风险和极端风险三个等级。最终从海量轨迹中筛选出31,398个高风险事件,其中包括1,036个极端近碰撞事件,为自动驾驶安全性研究提供了丰富的数据基础。
特点
K-Risk数据集的核心特点在于其多维度、多层次的风险评估体系与深度融合的语义注释。每个高风险事件均以同步的CSV轨迹文件、JSON元数据文件和TXT自然语言注释文件三元组形式存储,确保数据的一致性与可追溯性。特别值得关注的是,该数据集引入了一种闭环的大语言模型(LLM)注释机制,对代表性事件进行因果风险分析,并依据包含怠速、左转、右转、加速和减速的五动作模式生成离散行动建议。此外,数据集中包含53,295个独特的交通个体,其中非汽车类目标(如弱势道路使用者及重型/特种车辆)占比18.5%,显著增强了数据集的多样性和现实代表性。
使用方法
K-Risk数据集的使用方法围绕其提供的代码管线与数据组织方式展开。用户首先需从Figshare独立下载处理好的事件级轨迹数据,并将其与本代码仓库中的脚本配合使用。通过调用对应于不同数据源的描述生成函数(如generate_highd、generate_expresswayA等),用户可将JSON格式的事件元数据转换为多帧英文场景描述。进一步,利用llm_test.ipynb笔记本中的采样与查询接口,可将场景描述与系统提示词一同发送至GPT-4o等大语言模型,获取因果风险分析结果与行动建议。该数据集可广泛应用于自动驾驶智能体的连续预训练(CPT)、监督微调(SFT)、基于人类反馈的强化学习(RLHF)以及可验证模拟器奖励的强化学习(RLVR)等多个后训练阶段。
背景与挑战
背景概述
K-Risk数据集由研究团队于2026年构建,旨在突破自动驾驶领域高风险场景数据匮乏与语义鸿沟的瓶颈。该数据集汇聚了欧洲、中国及美国20个自然驾驶与自动驾驶轨迹源,涵盖高速公路、城市快速路、交叉口及环岛等多元环境,通过多维风险定义(驾驶风险场、硬操纵阈值及轨迹冲突预测)筛选出31,398个高风险事件,其中包含1,036个极端近碰撞子集。尤为创新的是,数据集引入闭环大语言模型(LLM)标注机制,为代表性事件生成因果风险分析与离散动作建议,实现了结构化轨迹数据与自然语言语义的深度融合。K-Risk为自动驾驶智能体的持续预训练、监督微调及强化学习提供了可复用的标准化语料,对推动安全关键场景的认知与决策研究具有里程碑意义。
当前挑战
K-Risk所解决的领域挑战在于高风险驾驶场景的复杂性与稀缺性。传统数据集多聚焦常规工况,难以覆盖碰撞边缘的动态交互模式,而K-Risk通过多源异构轨迹的融合构建,需应对不同采集协议下的时空对齐与语义统一难题。构建过程中,挑战尤为显著:首先,从20个来源提取事件需设计可迁移的检测算法,平衡召回率与误报率;其次,LLM标注面临场景描述生成器对车道拓扑的强依赖性,需为每个源定制化系统提示词;再次,闭环验证环节需确保LLM输出在无碰撞模拟器中与真实行为一致,迭代反思机制增加了计算开销;最后,多维度风险分级(中等/高/极端)需校准跨源的阈值参数,避免地域偏差影响模型泛化能力。
常用场景
经典使用场景
在自动驾驶安全评估与决策系统开发中,K-Risk数据集作为兼具规模与精度的风险场景基准库,被广泛用于训练和测试自动驾驶智能体在极端工况下的感知与规划能力。该数据集整合了横跨欧洲、中国和美国20个自然与自动驾驶轨迹数据源,涵盖高速公路、城市快速路、交叉口及环岛等多类复杂交通环境,从中精筛出31,398个高风险事件,并特别收录1,036个极端近碰撞子集。研究者可依托其结构化轨迹数据与LLM生成的语义注释,构建从环境理解到风险响应的闭环验证框架,尤其适用于考核算法在稀有的危险边界条件下的避险决策表现。
实际应用
在实际应用层面,K-Risk数据集可直接赋能自动驾驶系统在商业化部署前的高效安全验证,尤其在面向L3级以上自动驾驶功能的法规认证和场景库构建中发挥关键作用。该数据集的三元组存储格式——CSV轨迹数据、JSON符号化元数据与TXT自然语言注释——使其能够无缝接入后训练阶段的多种范式,包括连续预训练、监督微调、基于人类反馈的强化学习以及具备可验证奖励函数的强化学习。工程团队可将其作为仿真器中的测试基准,批量评估自车在近碰撞情境下的避撞策略,显著缩短高保真仿真场景的构造周期。
衍生相关工作
K-Risk的发布已催生了一系列相关衍生研究,形成了以风险场景智能标注为轴心的创新工作链。基于其闭循环LLM标注框架,后续研究逐步发展了跨模型驾驶行为对齐技术,探索了GPT-4o与GPT-4.1等多模态语言模型在复杂交通情景下的因果推理一致性。此外,数据集中包含的驾驶员风险场特征与五维动作空间定义,被广泛借鉴用于设计面向自动驾驶的可解释性奖励函数与偏好对构建方法。这些衍生工作不仅在学术层面扩展了安全关键场景的自动化生成边界,也为工业界建立标准化、可复现的风险评估基准提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务