遇见数据集

LogiScope-VQA

收藏
github2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

LogiScope-VQA是首个专门用于评估大型多模态模型在真实工业场景中物流危险识别能力的基准数据集,包含2476张图像、2918个视频片段和10274个经过人工验证的视觉问答对,涵盖18个核心对象和20种风险类型。

LogiScope-VQA is the first benchmark dataset specifically designed to evaluate the logistics hazard recognition capabilities of large multimodal models in real industrial scenarios. It contains 2476 images, 2918 video clips, and 10274 manually verified visual question-answer pairs, covering 18 core objects and 20 risk types.

创建时间:
2026-08-26
原始信息汇总

LogiScope-VQA 数据集概述

基本信息

  • 数据集名称:LogiScope-VQA
  • 定位:首个专门用于评估大型多模态模型(LMMs)在真实工业场景中进行物流危险识别的基准
  • 论文标题:LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios
  • 论文地址:https://arxiv.org/abs/2609.09790
  • 数据集预览地址:https://huggingface.co/datasets/zhouhanjing/LogiScope-VQA-preview
  • 数据来源:来自菜鸟全球仓储园区一年内收集的 350 万段监控视频

数据规模

完整基准(full benchmark)

  • 5,394 个高质量视觉样本:包含 2,476 张图像和 2,918 段视频片段
  • 10,274 个 VQA 对:经人工验证,包含选择题和开放式格式
  • 数据构成:以私有仓库监控影像为主,辅以开源数据和合成样本(通过图像编辑生成,用于丰富稀有风险因素)
  • 每对 VQA 均经过三轮专家交叉验证,最终版本在核心目标、风险类型和幻觉率上进行了重平衡,以缓解长尾偏斜

预览子集(Preview Release)

  • 在评审期间公开释放 10% 预览子集
  • 483 个视觉样本 / 1,000 个 VQA
  • 用于供评审者和读者检查数据格式与质量
  • 完整基准将在论文被接收后释放

覆盖范围

  • 18 个核心目标
  • 20 种风险类型(基于真实仓库安全法规)

任务分类体系(Task Taxonomy)

任务分类跨越三个层级:3 个能力维度 → 10 个任务 → 39 个子任务,构成从视觉感知到风险推理的渐进式课程:

  1. 工业元素感知(Industrial Element Perception)——对密集、低分辨率监控目标的细粒度/粗粒度感知
  2. 仓库知识理解(Warehouse Knowledge Understanding)——常识、空间关系和操作员角色
  3. 潜在风险推理(Potential Risk Reasoning)——周界访问控制、火灾监控、人员安全职责和设备操作合规性

关键发现(Key Findings)

以下发现基于完整基准得出,预览子集不用于复现这些数字:

  • 细粒度感知仍是主要瓶颈:模型难以处理低分辨率、广角、严重遮挡和密集杂乱的监控影像,在细粒度感知任务上甚至低于新手人类水平。
  • 安全风险偏差是一个重要但被忽视的问题:大多数模型表现出普遍的保守(过度报告)偏差,即使最强的模型也远未达到工业生产级就绪程度,且远低于人类专家水平。

发布计划

阶段 内容 状态
评审期间 预览子集 — 483 个视觉样本 / 1,000 个 VQA ✅ 已可用
论文被接收后 完整基准 — 5,394 个视觉样本 / 10,274 个 VQA,以及评估代码 ⏳ 计划中

使用方式

环境安装

bash pip install datasets

加载数据集

python from datasets import load_dataset

Preview subset (~10%) — available now

dataset = load_dataset("zhouhanjing/LogiScope-VQA-preview")

Full benchmark — available upon paper acceptance

dataset = load_dataset("zhouhanjing/LogiScope-VQA")

在预览仓库中,标注文件位于 test_preview.json,所有媒体路径相对于仓库根目录下的 test_preview/

引用信息

bibtex @article{zhou2026logiscope, title = {LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios}, author = {Hanjing Zhou, Mingze Yin, Ying Lian, Jun Ma, Chang-Yu Hsieh, Yanbing Zhou}, journal = {arXiv preprint arXiv:2609.09790}, year = {2026} }

许可证

本仓库采用双许可证方案:

范围 许可证 文件
数据集(图像、视频、VQA、标注及其他数据资产) CC BY-NC-SA 4.0 LICENSE
代码(评估脚本、工具及其他源代码) MIT CODE_LICENSE
  • CC BY-NC-SA 4.0 许可地址:https://creativecommons.org/licenses/by-nc-sa/4.0/
  • MIT 许可地址:https://opensource.org/license/mit
搜集汇总
数据集介绍
LogiScope-VQA 数据集图片
构建方式
LogiScope-VQA的构建根植于真实工业场景下物流安全风险识别这一关键需求,依托菜鸟全球仓储园区历时一年采集的三百五十万段监控视频,从中筛选并构建高质量视觉语料库。数据来源以私有仓库监控为主体,同时融合开源数据与图像编辑生成的合成样本,以补充稀有风险因素的覆盖密度。视觉样本涵盖高架区、装卸月台、存储区、拣选货架及安检区域等多元场景,并兼顾昼夜光照差异。全部视觉问答对均经过三轮专家交叉验证,最终发布版本在核心物体、风险类型及幻觉率等维度进行重新平衡,以缓解长尾偏斜问题。
特点
该数据集的核心特征在于其规模与任务体系的系统性。全量基准包含五千三百九十四个视觉样本,其中图像两千四百七十六张、视频片段两千九百一十八段,并配有一万零二百七十四个经人工验证的视觉问答对,涵盖多选与开放两种作答形式。任务分类体系呈三级递进结构,由三个能力维度、十项任务及三十九项子任务构成,形成从视觉感知到风险推理的渐进式课程。数据集锚定十八类核心物体与二十种风险类型,均以真实仓库安全规程为依据,并揭示出细粒度感知瓶颈与安全风险偏置这两个尚未被充分关注的关键问题。
使用方法
研究者可通过HuggingFace平台便捷获取该数据集。在审稿阶段,公开的预览子集包含四百八十三个视觉样本与一千个问答对,约占全量数据的百分之十,旨在供审阅者与读者查验数据格式与质量。使用Python环境安装datasets库后,调用load_dataset函数并指定数据集名称即可加载预览子集,全量基准将在论文录用后以同名方式发布。预览仓库中,标注文件为test_preview.json,所有媒体路径均相对于仓库根目录下的test_preview文件夹。全量发布时还将配套提供评测代码,以供标准化比较与复现。
背景与挑战
背景概述
立足智能物流与工业安全交汇的前沿,LogiScope-VQA作为首个面向真实工业场景中物流危险识别的视觉语言模型评测基准,由菜鸟网络联合研究团队于2026年构建。依托全球仓储园区逾一年采集的350万段监控视频,该数据集凝练出5,394个视觉样本与10,274条人工验证的视觉问答对,覆盖18类核心物体与20种风险类型。其核心研究问题在于系统评估大型多模态模型在密集低分辨率监控画面下的细粒度感知与风险推理能力,填补了工业物流安全领域标准化评测资源的空白,对推动视觉语言模型落地高风险作业环境具有奠基性意义。
当前挑战
该数据集所直面的领域难题在于,物流危险识别迥异于通用图像分类任务,要求模型在广角、遮挡、低照度及昼夜交替的监控影像中精准辨识高危要素并推断潜在风险,对细粒度感知与领域知识融合提出严苛要求。构建过程中,研究团队需从海量私有监控数据中筛选并均衡长尾风险样本,借助图像编辑合成稀有风险因素,并通过三轮专家交叉验证确保标注可靠性。当前模型普遍呈现保守性过报偏差,即便最优模型亦远逊于人类专家,暴露出安全风险偏置这一被长期忽视的瓶颈,距工业级生产就绪尚有显著鸿沟。
常用场景
经典使用场景
在工业智能化的浪潮中,物流仓储场景的视觉风险感知正成为多模态学习的前沿阵地。LogiScope-VQA作为首个面向真实工业场景的物流隐患识别基准,其最经典的使用场景在于系统评估大型多模态模型在密集低分辨率监控画面中的细粒度感知能力。该基准涵盖高架库区、装卸月台、分拣货架及安检通道等多元场景,通过选择题与开放式问答相结合的形式,要求模型辨识十八类核心物体与二十种风险类型,从而在从视觉感知到风险推理的递进式课程中,全面刻画模型对仓储安全隐患的识别水平。
衍生相关工作
LogiScope-VQA的发布为工业多模态研究开辟了新的衍生方向。围绕该基准,后续工作可望在面向低分辨率监控的细粒度视觉编码、融合仓储安全规章的知识增强推理,以及缓解模型保守报警偏差的校准策略等方面展开深入探索。其分层任务体系亦为课程学习与多任务联合训练提供了天然的实验平台,有望催生一批针对工业垂直领域的多模态预训练模型与风险推理框架,进而推动智慧物流安全监测从被动记录向主动预判的范式演进。
数据集最近研究
最新研究方向
在工业智能化转型纵深推进的背景下,面向真实仓储场景的多模态风险感知与推理已成为视觉-语言模型评测的前沿阵地。LogiScope-VQA依托菜鸟全球仓储园区长达一年的350万段监控影像,构建了涵盖高货架区、装卸月台、安检通道等复杂工况的图像与视频问答基准,将研究焦点从通用视觉理解推进至细粒度工业危险源辨识。该数据集揭示的细粒度感知瓶颈与安全风险保守偏差两大核心发现,直指当前大模型在低分辨率、强遮挡、密集堆叠监控画面中的能力短板,为多模态模型走向工业级安全生产部署提供了关键诊断工具与方向指引。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务