遇见数据集

Simuletic/Surveillance-VLM-Weapon-Knife-Detection-Dataset

收藏
Hugging Face2025-12-17 更新2025-12-20 收录
官方服务:

资源简介:

这是一个名为Simuletic Safety VLM Dataset的开源数据集,专为视觉语言模型(VLMs)的指令调优设计。数据集旨在教导模型定位武器(刀具和枪支)、推理威胁并避免误报。包含高质量的样本,涵盖三个关键类别:刀具检测、枪支检测和安全/阴性样本。数据集采用标准化的0-1000坐标系统,与Qwen-VL/LLaVA兼容,并包含链式思维安全推理。数据以行业标准的JSON对话格式存储,适用于多模态LLMs(如Qwen-VL、LLaVA、PaliGemma)的微调、安全性和基础能力的基准测试,以及自主监控代理的研究。数据为计算机生成,无真实人类记录或伤害,采用CC BY 4.0许可。

This is an open-source dataset named Simuletic Safety VLM Dataset, designed for instruction tuning of Vision Language Models (VLMs). It teaches models to locate weapons (knives and firearms), reason about threats, and avoid false positives. The dataset includes high-quality samples covering three critical categories: knife detection, firearm detection, and safe/negative samples. It uses normalized coordinates (0-1000 scale) compatible with Qwen-VL/LLaVA and incorporates chain-of-thought safety reasoning. The data is pre-formatted in a standard JSON conversation format and intended for fine-tuning multimodal LLMs (e.g., Qwen-VL, LLaVA, PaliGemma), benchmarking safety and grounding capabilities, and researching autonomous surveillance agents. The data is computer-generated, with no real humans recorded or harmed, and is licensed under CC BY 4.0.

提供机构:
Simuletic
搜集汇总
数据集介绍
Simuletic/Surveillance-VLM-Weapon-Knife-Detection-Dataset 数据集图片
构建方式
在智能视频监控与公共安全领域,精细化的视觉语言模型(VLM)对于提升威胁感知能力至关重要。Simuletic/Surveillance-VLM-Weapon-Knife-Detection-Dataset 作为一个开源子集,源自全面的 Simuletic Safety VLM 数据集,专为指令微调而设计。其构建方式采用合成数据生成技术,通过计算机生成的高质量样本,覆盖刀具检测、枪械检测及安全负样本三大关键类别。每个样本均包含标准化的归一化边界框坐标(0-1000尺度),并配以结构化对话格式,将视觉定位与文本推理紧密结合,确保模型能够学习到精确的坐标输出与场景分类能力。
特点
该数据集的核心特点在于其面向视觉语言模型的深度优化。它融合了基于坐标的接地对话(Grounded Conversations),引导模型输出具体定位信息,同时借助链式思维安全推理(Chain-of-Thought Safety),促使模型依据视觉证据进行安全或危险的二元分类,有效减少幻觉与误报。数据格式遵循工业标准,兼容 LLaMA-Factory 和 Axolotl 等主流微调框架,且所有坐标均采用分辨率无关的归一化设计,显著提升了跨模型的可迁移性与实用性。
使用方法
使用该数据集时,研究者可将其直接用于微调多模态大语言模型,如 Qwen-VL、LLaVA 或 PaliGemma,以增强其武器检测与威胁评估能力。数据以 JSON 对话格式存储,每条记录包含图像路径与多轮人机对话,模型需学习从“定位刀具”到“分析威胁等级”的完整推理链路。此外,该数据集还适用于自主监控代理的基准测试与安全能力评估,研究者可通过标准化接口加载数据,并基于合成样本的标注进行模型性能验证,推动监控场景下的智能决策研究。
背景与挑战
背景概述
在智能视频监控领域,随着视觉语言模型(VLM)的兴起,如何赋予模型精准的目标定位与威胁推理能力成为研究焦点。Simuletic/Surveillance-VLM-Weapon-Knife-Detection-Dataset由Simuletic团队于2025年发布,旨在通过合成数据驱动的方式,解决监控场景中武器检测与安全评估的核心问题。该数据集专注于指令微调(Instruction Tuning),使VLM能够识别持刀与持枪个体,并基于视觉证据进行威胁等级分类,避免误报。其采用归一化坐标与链式推理(Chain-of-Thought)设计,兼容Qwen-VL、LLaVA等主流多模态框架,为自主监控智能体的研究提供了标准化基准,对推动安防领域的人工智能应用具有重要影响力。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:监控场景中的武器检测需应对光照变化、遮挡、视角差异及小目标识别等难题,同时要区分真实威胁与日常物品(如工具与刀具的混淆),避免模型产生幻觉。其次,构建过程中的挑战在于合成数据的真实性与泛化性:尽管采用计算机生成图像规避隐私与伦理风险,但如何确保合成场景的多样性以覆盖极端案例(如低像素、快速运动),并维持标注精度以支持精确的边界框回归,仍是技术难点。此外,数据集的规模限制可能影响模型在真实世界中的鲁棒性,需通过扩展场景与边缘案例来提升适应性。
常用场景
经典使用场景
在智能视频监控与多模态大模型交叉领域,该数据集最经典的使用场景是用于视觉语言模型的指令微调(Instruction Tuning),以赋予模型对监控画面中武器(如刀具和枪支)的精准定位与威胁等级推理能力。通过提供带归一化坐标的边界框标注和链式思维安全推理链条,研究者能够训练出既可输出具体坐标、又能区分危险与安全状态的视觉语言模型,从而在复杂监控环境中实现高精度的异常检测与实时告警。
实际应用
在实际应用层面,该数据集赋能了自主监控代理(Autonomous Surveillance Agents)的构建,使其能够部署于地铁站、机场、校园等关键公共区域。经过微调的模型可实时分析摄像头画面,在检测到刀具或枪支时自动触发警报并生成包含物体位置与威胁等级的文本报告,辅助安保人员快速决策。此外,其合成数据特性规避了隐私风险,使得大规模模拟不同光照、遮挡与视角下的危险场景成为可能,为商用安防系统的低成本迭代提供了数据基础。
衍生相关工作
基于该数据集,学界与工业界已衍生出多项经典工作。例如,研究者将其作为基准测试集,系统评估了Qwen-VL、LLaVA等主流视觉语言模型在安全场景中的定位精度与误报率,揭示了现有模型在处理细粒度威胁分类时的局限性。另有工作利用其链式思维标注格式,探索了多步推理与视觉定位的联合优化策略,提出了面向监控视频的“检测-推理-决策”流水线框架。这些衍生产出不仅验证了数据集的有效性,更推动了安全领域专用多模态模型的标准化评估体系建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务