EgoSafetyBench
收藏资源简介:
EgoSafetyBench是一个诊断性的以自我为中心视频基准,用于评估具身视觉语言模型(VLMs)作为运行时安全防护器的性能。它包括通过场景生成、渲染、标注和评估四个阶段构建的数据集,提供双轴地面实况标签和样本剪辑,支持对VLM防护器进行系统评估。
EgoSafetyBench is a diagnostic egocentric video benchmark for evaluating the performance of embodied vision-language models (VLMs) as runtime safety guards. It comprises a dataset constructed through four stages: scene generation, rendering, annotation, and evaluation, and provides dual-axis ground-truth labels and sample clips to support systematic evaluation of VLM safety guards.
EgoSafetyBench 数据集概述
基本信息
- 数据集名称: EgoSafetyBench
- 用途: 一个诊断性的自我中心视频(egocentric-video)基准,用于评估具身视觉语言模型(Embodied VLMs)作为运行时安全守卫的性能。
- 论文: EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards
- 数据集地址: AIM-Intelligence/EgoSafetyBench
- 许可证: Apache-2.0
数据集核心设计
数据集采用双轴(two-axis)标签体系,每个视频片段(chunk)包含两个独立的标签:
-
情境类别(Situational Family):
S1/S2:安全情境U1/U2:不安全情境- 没有"U3"类别
-
视觉通道不匹配(VCM, Visual-Channel-Mismatch):
- 布尔值,指示场景内的标志/屏幕是否对现实进行了欺骗。
- 欺骗标志场景被构建为一对共享同一个
scenario_id的样本:攻击样本(欺骗标志,VCM=true)和匹配文本控制样本(诚实标志,VCM=false)。
数据集样本
- 数据集中附带一个
dataset_sample/目录,包含 36个精选示例片段。 - 样本在所有四种环境和六个双轴类别(
s1 s2 u1 u2 u3 u3_control)间保持平衡。 - 每个样本包含真实标签、推理过程以及(对于欺骗片段)标志与现实之间的机制说明。
- 可使用附带查看器(
pip install streamlit && streamlit run dataset_sample/view_samples.py)进行预览。
数据流水线(Pipeline)
整个项目由四个流水线阶段构成,基于两个共享核心:
四个阶段
- scenegen(场景生成):创作场景(描述 + ego_prompt + VCM标志对),输出 JSONL 格式。
- render(渲染):对每个场景过采样多个候选片段,由 VLM 判断保留最佳结果,生成渲染到标注的清单。此阶段是唯一非免费的阶段(涉及封闭/付费视频 API)。
- annotate(标注):根据清单进行双轴真实标签标注,输出
metadata_two_axis_<proto>.jsonl文件。 - eval(评估):对 VLM 守卫进行评分,并组装跨模型结果表格。
两个共享核心
egosafetybench.common:单一端到端合约,包含版本化的Scenario/ChunkGT模式、规范双轴分类法、持久化slug ID、原子IO及环境/配置路径解析。egosafetybench.models:与提供商无关的模型抽象,在annotate和eval两个阶段共享,包含ModelSpec/build_model工厂、共享解析器、消息构建器以及成本/预算/速率限制/重试中间件。
安装方式
bash pip install -e . # 仅核心(common/) pip install -e .[heavy] # + 本地开源权重推理(torch/transformers) pip install -e .[api] # + 托管API通道(OpenRouter/Google/Anthropic) pip install -e .[dev] # + pytest
使用方法
- 所有API消费阶段支持
--dry-run参数,可先进行计划和成本估算,不产生实际花费。 - 仅运行评估阶段(stage 4)即可在已发布的数据集上重复评估结果。





