遇见数据集

build-small-hackathon/limp-mode-traces

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含来自Limp Mode的完整评估轨迹,Limp Mode是一个离线路边副驾驶系统。每个记录对应202个案例黄金套件中的一次诊断,涵盖驾驶员输入、检索器返回的内容、模型回答、触发的确定性安全规则以及安全底线后的最终裁决。数据集包含774条轨迹,跨越多个运行版本,如base-202-cleanpipe、baseline-202-pretraining、fixed-floor-pipeline、leap1-ft-202、tuned-rag-pipeline、zeroshot-full-pipeline和zeroshot-model-alone。关键列包括:model_verdict与final_verdict对比显示所有安全底线干预;dangerous_as_safe指标必须为0(表示预期为STOP但回答为DRIVE的情况);knowledge_surfaced跟踪隐藏知识(如惯性开关、电动汽车12V电池等)是否影响答案。这些轨迹记录了项目的主要发现:朴素RAG导致准确率从88%降至59%而知识覆盖率上升、危险标志底线升级错误以及微调前后的变化。

This dataset contains full evaluation trajectories from Limp Mode, an offline roadside co-pilot system. Each record corresponds to a diagnostic run within the gold-standard test suite of 202 cases, covering driver inputs, retrieved content from the retriever, model responses, triggered deterministic safety rules, and the final adjudication post-safety threshold enforcement. The dataset includes 774 trajectories spanning multiple operational versions, including base-202-cleanpipe, baseline-202-pretraining, fixed-floor-pipeline, leap1-ft-202, tuned-rag-pipeline, zeroshot-full-pipeline, and zeroshot-model-alone. Key columns include: the comparison between `model_verdict` and `final_verdict` to reveal all safety threshold interventions; the `dangerous_as_safe` metric which must equal 0 (referring to cases where the expected output was STOP but the model response was DRIVE); and `knowledge_surfaced`, which tracks whether hidden knowledge (e.g., inertia switches, 12V batteries for electric vehicles, etc.) impacts the model's outputs. These trajectories document the project's core findings: naive RAG reduces model accuracy from 88% to 59% while increasing knowledge coverage, errors in safety threshold escalation for hazardous scenarios, and performance changes observed before and after fine-tuning.

提供机构:
build-small-hackathon
搜集汇总
数据集介绍
build-small-hackathon/limp-mode-traces 数据集图片
构建方式
Limp Mode pipeline traces 数据集源于针对离线路边协同驾驶助手Limp Mode的全面评估流程。该数据集记录了在包含202个案例的金标准测试集上进行的每一次诊断过程,涵盖驾驶员输入、检索系统提取的内容、模型生成的回答、确定性安全规则的触发状态以及经过安全底线后的最终判定。数据收集跨越了七个不同的实验流水线版本,包括基础清理管道、预训练基线、固定安全底线管道、微调版本、调优RAG管道、零样本全管道以及纯模型版本,共计774条追踪记录。
特点
该数据集的核心特色在于其多维度对比能力,特别是通过`model_verdict`与`final_verdict`两列对比,能够清晰揭示安全底线的每一次干预行为。`dangerous_as_safe`指标作为关键安全度量,必须严格为零(即模型预期输出‘停止’而实际输出‘行驶’的情形)。此外,`knowledge_surfaced`列追踪了隐蔽陷阱知识(如惯性开关、电动汽车12V电池故障等)是否成功传递至最终回答中,为评估检索增强生成系统的知识覆盖率提供了独特视角。
使用方法
研究者和工程师可以直接加载该数据集进行安全关键系统的诊断分析,通过对比不同流水线的`model_verdict`与`final_verdict`列来识别安全底线干预模式。数据集中记录的实验发现——如朴素RAG导致准确率从88%骤降至59%但知识覆盖率提升、危险标志底线的升级漏洞以及微调前后的性能变化——均可作为基准测试依据。用户可针对特定问题筛选追踪记录,或利用`knowledge_surfaced`列分析知识检索瓶颈,进而优化RAG流水线设计。
背景与挑战
背景概述
在车辆故障诊断领域,智能辅助系统正逐步从实验室走向实际应用,但如何确保其在真实场景中的安全性与可靠性仍是关键难题。Limp Mode管道追踪数据集诞生于2023年举办的Build Small黑客马拉松,由参与构建离线道路辅助系统Limp Mode的研究团队创建,旨在系统性地评估与优化基于检索增强生成(RAG)的车辆故障诊断pipeline。该数据集记录了针对202个标准病例的诊断全流程,涵盖驾驶员输入、检索结果、模型回答及安全规则触发等关键环节,为衡量安全地板机制的有效性提供了结构化证据。作为开放评估基准,它揭示了朴素RAG在提升知识覆盖范围的同时可能引入准确性下降的悖论,推动了故障诊断领域对安全关键型AI系统的深入思考。
当前挑战
当前数据集主要解决领域内两大核心挑战:首先是诊断准确性保持与知识覆盖率提升之间的平衡问题,实验中观察到的朴素RAG将准确率从88%剧降至59%的现象,凸显了检索增强策略可能引入信息噪声而导致模型混淆的悖论;其次是安全地板机制的设计与验证,数据集中记录的'危险判为安全'指标必须为零的硬约束,以及因故障标志升级引发的安全漏洞,揭示了确定性规则与神经网络输出之间的冲突与对齐难题。在构建过程中,团队面临了从202个标准病例中系统捕获隐藏陷阱知识(如惯性开关、12V电池特性)的挑战,以及如何设计多轮真实诊断轨迹以确保数据覆盖边缘案例的复杂性。
常用场景
经典使用场景
在自动驾驶安全评估领域,limp-mode-traces数据集为构建离线路侧驾驶副驾系统提供了完整的诊断追踪记录。该数据集包含774条在202例黄金测试套件上运行的诊断痕迹,覆盖从驾驶员输入、检索器返回内容、模型回答到确定性安全规则触发与最终裁决的全链路信息。研究者可通过model_verdict与final_verdict的对比,精准定位安全底线干预的触发时刻,并利用dangerous_as_safe这一关键指标确保系统在预期停止却输出驱动指令时及时告警。该数据集特别适用于评估检索增强生成模型在安全关键场景中的表现,以及验证安全规则层的有效性。
解决学术问题
该数据集解决了多模态安全系统中检索增强生成与规则引擎协同工作的核心评估难题。通过记录不同管线变体(如基础管线、预训练基线、微调策略)的运行痕迹,它揭示了朴素RAG在提升知识覆盖率的同时导致准确率从88%骤降至59%的反直觉现象,以及危险标志安全底线升级漏洞等关键学术问题。这些发现促使研究者重新思考知识检索与安全决策的平衡问题,为设计鲁棒的安全保障机制提供了实证基础,推动了自动驾驶辅助系统中知识引导与规则约束融合的研究范式发展。
衍生相关工作
基于该数据集的核心发现,已衍生出多项代表性研究工作。包括针对朴素RAG准确率下降问题提出的知识覆盖-决策可信度模型,通过量化检索知识质量与安全决策的相关性来优化管线配置;针对危险标志安全底线升级漏洞开发的层级化仲裁机制,在规则引擎与模型输出之间增加冲突检测层;以及利用固定错误管线数据进行对抗训练的方法,通过模拟安全规则误触发场景增强模型的鲁棒性。这些工作共同推动了带安全保障的检索增强生成系统向更可靠的工程实践演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务