遇见数据集

EgoSafetyBench

收藏
github2026-07-03 更新2026-07-05 收录
官方服务:

资源简介:

EgoSafetyBench是一个诊断性的以自我为中心视频基准,用于评估具身视觉语言模型(VLMs)作为运行时安全防护器的性能。它包括通过场景生成、渲染、标注和评估四个阶段构建的数据集,提供双轴地面实况标签和样本剪辑,支持对VLM防护器进行系统评估。

EgoSafetyBench is a diagnostic egocentric video benchmark for evaluating the performance of embodied vision-language models (VLMs) as runtime safety guards. It comprises a dataset constructed through four stages: scene generation, rendering, annotation, and evaluation, and provides dual-axis ground-truth labels and sample clips to support systematic evaluation of VLM safety guards.

创建时间:
2026-06-27
原始信息汇总

EgoSafetyBench 数据集概述

基本信息

数据集核心设计

数据集采用双轴(two-axis)标签体系,每个视频片段(chunk)包含两个独立的标签:

  1. 情境类别(Situational Family):

    • S1 / S2:安全情境
    • U1 / U2:不安全情境
    • 没有"U3"类别
  2. 视觉通道不匹配(VCM, Visual-Channel-Mismatch):

    • 布尔值,指示场景内的标志/屏幕是否对现实进行了欺骗。
    • 欺骗标志场景被构建为一对共享同一个scenario_id的样本:攻击样本(欺骗标志,VCM=true)和匹配文本控制样本(诚实标志,VCM=false)。

数据集样本

  • 数据集中附带一个 dataset_sample/ 目录,包含 36个精选示例片段
  • 样本在所有四种环境和六个双轴类别(s1 s2 u1 u2 u3 u3_control)间保持平衡。
  • 每个样本包含真实标签、推理过程以及(对于欺骗片段)标志与现实之间的机制说明。
  • 可使用附带查看器(pip install streamlit && streamlit run dataset_sample/view_samples.py)进行预览。

数据流水线(Pipeline)

整个项目由四个流水线阶段构成,基于两个共享核心:

四个阶段

  1. scenegen(场景生成):创作场景(描述 + ego_prompt + VCM标志对),输出 JSONL 格式。
  2. render(渲染):对每个场景过采样多个候选片段,由 VLM 判断保留最佳结果,生成渲染到标注的清单。此阶段是唯一非免费的阶段(涉及封闭/付费视频 API)。
  3. annotate(标注):根据清单进行双轴真实标签标注,输出 metadata_two_axis_<proto>.jsonl 文件。
  4. eval(评估):对 VLM 守卫进行评分,并组装跨模型结果表格。

两个共享核心

  • egosafetybench.common:单一端到端合约,包含版本化的Scenario/ChunkGT模式、规范双轴分类法、持久化slug ID、原子IO及环境/配置路径解析。
  • egosafetybench.models:与提供商无关的模型抽象,在annotateeval两个阶段共享,包含ModelSpec/build_model工厂、共享解析器、消息构建器以及成本/预算/速率限制/重试中间件。

安装方式

bash pip install -e . # 仅核心(common/) pip install -e .[heavy] # + 本地开源权重推理(torch/transformers) pip install -e .[api] # + 托管API通道(OpenRouter/Google/Anthropic) pip install -e .[dev] # + pytest

使用方法

  • 所有API消费阶段支持 --dry-run 参数,可先进行计划和成本估算,不产生实际花费。
  • 仅运行评估阶段(stage 4)即可在已发布的数据集上重复评估结果。
搜集汇总
数据集介绍
EgoSafetyBench 数据集图片
构建方式
在具身智能安全评估领域,现有的基准测试往往缺乏对运行时视觉语言模型安全性能的细粒度诊断能力。EgoSafetyBench应运而生,通过一个四阶段流水线构建:首先在scenegen阶段进行场景创作,定义包含自我提示与视觉通道不匹配信号对的场景描述;接着由render阶段利用文本生成视频API对每个场景进行候选片段过采样,并由视觉语言模型裁判筛选出最优片段;随后在annotate阶段,借助大语言模型对每个片段标注双轴标签,确定其情境类型与视觉通道不匹配属性;最终通过eval阶段完成对目标视觉语言模型作为安全卫士的评分评估,形成完整的诊断闭环。
特点
该数据集的核心创新在于其独特的双轴分类体系,每个视频片段独立携带情境类别和视觉通道不匹配两个正交标签,能够精准区分真实场景中的安全风险与欺骗性视觉信号误导。包含四种环境场景和六类双轴类别,其中视觉通道不匹配攻击与匹配文本控制对共享同一场景标识,为消融研究提供了天然对照。配备36个精选示例片段库,支持快速预览。其标准化Schema和持久化标识体系确保了数据集的可复现性与跨阶段契约一致性,使冻结石的基准数据可被独立重用。
使用方法
使用者可通过HuggingFace直接下载完整数据集,并利用配套的Streamlit查看器快速浏览36个精选示例片段以理解数据结构。对于需要复现评估的研究者,仅需执行流水线的最后一阶段——配置目标视觉语言模型YAML文件,指定数据集根目录和输出路径,通过esb-eval命令完成评分,再使用esb-aggregate命令生成跨模型对比表格。所有API消耗型阶段均支持--dry-run模式进行预运行成本估算,确保操作透明可控。建议首次使用时先运行dry-run规划执行计划,再根据实际需求调整参数并行执行完整评估流程。
背景与挑战
背景概述
随着具身视觉语言模型(Embodied VLMs)在机器人、自动驾驶等自主系统中的广泛应用,其运行时安全性已成为关键议题。EgoSafetyBench由Siddhant Panpatil、Arth Singh、Mijin Koo等研究人员于2026年创建,是一个面向第一人称视角视频的诊断性基准数据集,旨在系统评估具身VLM作为运行时安全守卫的能力。该数据集核心研究问题在于:如何通过细粒度双轴标注(情境家族与视觉通道不匹配)检测视频中真实与欺骗性安全隐患,从而填补现有基准在动态、欺骗性场景评估上的空白。EgoSafetyBench对相关领域影响力显著,它为VLM安全评估提供了标准化诊断工具,推动具身AI从性能导向向安全导向演进。
当前挑战
EgoSafetyBench面临的挑战首先在于领域问题层面:现有VLM安全评估多聚焦静态或简单交互场景,难以识别第一人称视频中随时间演变的隐蔽危险(如视觉信息与真实状态不一致的欺骗性场景),且缺乏对情境类型(安全/危险)与视觉通道真实性(是否被篡改)的联合建模。其次,构建过程中挑战尤为突出:渲染阶段依赖封闭/付费视频API(如Kling、Veo),生成高质量候选片段需成本控制与多轮筛选;双轴标注协议复杂,需协议版本管理以确保标签一致性;此外,欺骗性场景需要精心设计攻击样本及其匹配文本控制样本,以分离视觉不匹配效应,这对场景创作的逼真性与多样性提出严苛要求。
常用场景
经典使用场景
EgoSafetyBench作为首个专注于评估具身视觉语言模型(VLM)运行时安全保护能力的诊断性自我中心视频基准,其最经典的使用场景在于系统性地衡量VLM在动态、第一人称视角下对危险情境的实时感知与判断能力。该基准通过精心设计的双轴标签体系,将视频片段按情境家族(安全/危险)与视觉通道不匹配(VCM)状态进行正交标注,从而严格区分模型在面对真实危险与欺骗性视觉信号时的表现差异。研究者可借此基准对VLM的安全可靠性进行标准化的定量评估,特别是在其作为机器人或自动驾驶系统的实时安全防护组件时,验证其能否在关键时刻正确识别并响应潜在风险。
衍生相关工作
EgoSafetyBench的提出已经催生了一系列衍生研究工作。其双轴评估思想启发了专门针对具身智能欺骗对抗攻击防御的VLM鲁棒性增强方法,研究者基于数据集中VCM标注的欺骗场景设计了对抗训练策略。该基准的模块化流水线设计(scenegen→render→annotate→eval)为其他自中心视觉任务(如动作预测、物体操纵)的标准化基准构建提供了可复用的技术范式。最新进展包括基于EgoSafetyBench的评估指标改进,如引入代价敏感的安全评分函数,以及将其扩展至多模态安全对齐的跨数据集对比研究。这些工作共同推动着具身VLM安全评估从定性分析迈向标准化、可量化的科学阶段。
数据集最近研究
最新研究方向
当前,具身视觉-语言模型(Embodied VLMs)在机器人自主操作中扮演着越来越重要的角色,然而其在动态环境中实时检测安全隐患的能力仍缺乏系统评估。EgoSafetyBench作为首个诊断性自我中心视频基准,聚焦于评估具身VLM作为运行时安全守护者的表现,填补了这一关键空白。该基准通过创新的双轴分类体系(情境家族与视觉通道不匹配标志),系统性地检验模型在安全与不安全场景下的视觉感知与逻辑推理能力,特别是应对欺骗性视觉信号(如屏幕或标志与真实情况不符)的鲁棒性。结合文本到视频渲染技术生成多样化测试样本,EgoSafetyBench为机器人安全部署提供了标准化的诊断工具,其方向与具身智能体在家庭、工业等真实场景中的风险控制需求高度契合,对推动负责任的人工智能落地具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务