LogiScope-VQA
收藏资源简介:
LogiScope-VQA是首个专门用于评估大型多模态模型在真实工业场景中物流危险识别能力的基准数据集,包含2476张图像、2918个视频片段和10274个经过人工验证的视觉问答对,涵盖18个核心对象和20种风险类型。
LogiScope-VQA is the first benchmark dataset specifically designed to evaluate the logistics hazard recognition capabilities of large multimodal models in real industrial scenarios. It contains 2476 images, 2918 video clips, and 10274 manually verified visual question-answer pairs, covering 18 core objects and 20 risk types.
LogiScope-VQA 数据集概述
基本信息
- 数据集名称:LogiScope-VQA
- 定位:首个专门用于评估大型多模态模型(LMMs)在真实工业场景中进行物流危险识别的基准
- 论文标题:LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios
- 论文地址:https://arxiv.org/abs/2609.09790
- 数据集预览地址:https://huggingface.co/datasets/zhouhanjing/LogiScope-VQA-preview
- 数据来源:来自菜鸟全球仓储园区一年内收集的 350 万段监控视频
数据规模
完整基准(full benchmark)
- 5,394 个高质量视觉样本:包含 2,476 张图像和 2,918 段视频片段
- 10,274 个 VQA 对:经人工验证,包含选择题和开放式格式
- 数据构成:以私有仓库监控影像为主,辅以开源数据和合成样本(通过图像编辑生成,用于丰富稀有风险因素)
- 每对 VQA 均经过三轮专家交叉验证,最终版本在核心目标、风险类型和幻觉率上进行了重平衡,以缓解长尾偏斜
预览子集(Preview Release)
- 在评审期间公开释放 10% 预览子集
- 483 个视觉样本 / 1,000 个 VQA
- 用于供评审者和读者检查数据格式与质量
- 完整基准将在论文被接收后释放
覆盖范围
- 18 个核心目标
- 20 种风险类型(基于真实仓库安全法规)
任务分类体系(Task Taxonomy)
任务分类跨越三个层级:3 个能力维度 → 10 个任务 → 39 个子任务,构成从视觉感知到风险推理的渐进式课程:
- 工业元素感知(Industrial Element Perception)——对密集、低分辨率监控目标的细粒度/粗粒度感知
- 仓库知识理解(Warehouse Knowledge Understanding)——常识、空间关系和操作员角色
- 潜在风险推理(Potential Risk Reasoning)——周界访问控制、火灾监控、人员安全职责和设备操作合规性
关键发现(Key Findings)
以下发现基于完整基准得出,预览子集不用于复现这些数字:
- 细粒度感知仍是主要瓶颈:模型难以处理低分辨率、广角、严重遮挡和密集杂乱的监控影像,在细粒度感知任务上甚至低于新手人类水平。
- 安全风险偏差是一个重要但被忽视的问题:大多数模型表现出普遍的保守(过度报告)偏差,即使最强的模型也远未达到工业生产级就绪程度,且远低于人类专家水平。
发布计划
| 阶段 | 内容 | 状态 |
|---|---|---|
| 评审期间 | 预览子集 — 483 个视觉样本 / 1,000 个 VQA | ✅ 已可用 |
| 论文被接收后 | 完整基准 — 5,394 个视觉样本 / 10,274 个 VQA,以及评估代码 | ⏳ 计划中 |
使用方式
环境安装
bash pip install datasets
加载数据集
python from datasets import load_dataset
Preview subset (~10%) — available now
dataset = load_dataset("zhouhanjing/LogiScope-VQA-preview")
Full benchmark — available upon paper acceptance
dataset = load_dataset("zhouhanjing/LogiScope-VQA")
在预览仓库中,标注文件位于 test_preview.json,所有媒体路径相对于仓库根目录下的 test_preview/。
引用信息
bibtex @article{zhou2026logiscope, title = {LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios}, author = {Hanjing Zhou, Mingze Yin, Ying Lian, Jun Ma, Chang-Yu Hsieh, Yanbing Zhou}, journal = {arXiv preprint arXiv:2609.09790}, year = {2026} }
许可证
本仓库采用双许可证方案:
| 范围 | 许可证 | 文件 |
|---|---|---|
| 数据集(图像、视频、VQA、标注及其他数据资产) | CC BY-NC-SA 4.0 | LICENSE |
| 代码(评估脚本、工具及其他源代码) | MIT | CODE_LICENSE |
- CC BY-NC-SA 4.0 许可地址:https://creativecommons.org/licenses/by-nc-sa/4.0/
- MIT 许可地址:https://opensource.org/license/mit




