遇见数据集

uv-scripts/vlm-object-detection

收藏
Hugging Face2026-05-12 更新2026-06-14 收录
官方服务:

资源简介:

VLM目标检测数据集是一个用于通过视觉语言模型(VLM)进行指令提示目标检测的资源,使用vLLM实现。它被设计为VLM作为标注器的原语,用于引导目标检测数据集的创建——用户可以提供自由形式的提示(如检测每张照片和插图、检测所有个人防护装备物品、检测每个电子元件并识别其参考标识符),模型将返回边界框JSON,适用于下游标注工具(如Label Studio、FiftyOne、COCO转换)。该数据集包括脚本和示例,支持零样本和少样本检测,适用于自然图像、文档布局等多种场景,但输出为标注级而非训练级,主要用于标注管道的初始种子。

The VLM Object Detection dataset is a resource for instruction-prompted object detection with vision-language models (VLM) via vLLM. It is designed as a VLM-as-labeller primitive for bootstrapping object-detection datasets—users can provide free-form prompts (e.g., detect every photograph and illustration, detect all PPE items, detect every electronic component and identify its reference designator), and the model returns bbox JSON ready for downstream labelling tools (Label Studio, FiftyOne, COCO conversion). The dataset includes scripts and examples, supporting zero-shot and few-shot detection for various scenarios such as natural images and document layouts, but the output is labelling-grade not training-grade, primarily serving as an initial seed for labelling pipelines.

提供机构:
uv-scripts
搜集汇总
数据集介绍
uv-scripts/vlm-object-detection 数据集图片
构建方式
该数据集通过视觉语言模型(VLM)与vLLM推理框架的协同作用,构建了一种基于指令提示的目标检测管线。其核心机制是将自由形式的自然语言指令作为输入,驱动模型输出符合预定义格式的边界框(bbox)JSON结果。脚本采用Qwen-VL系列模型的标准输出约定,即边界框坐标归一化至0-1000并存储于bbox_2d字段,同时生成label与sub_label字段以记录类别与描述性子标签。数据集的脚本支持零样本检测与少样本上下文学习两种模式,前者通过描述性提示直接触发模型检测,后者则借助一个示例图像及其标注结果来引导模型理解任务范式。输出数据的处理流程包含了从模型原始文本响应的解析、坐标反归一化至原始图像像素空间、以及结果自动整理为HuggingFace数据集格式,从而直接可用于下游标注工具如Label Studio或FiftyOne。
特点
该数据集最显著的特点在于其灵活性与任务适配能力。与传统的基于固定类名提示的检测方法不同,它允许用户以自然语言指令自由定义检测内容,例如要求模型检测所有电子元件并识别其参考编号,或在一份历史报纸页面上区分照片、插画、地图与广告。脚本特别强调了提示工程的经验性原则:建议在提示中枚举类别集合以约束模型词汇,保持纯正向指令以避免空输出,以及采用宽泛分类并事后过滤的策略来提升检测质量。sub_label字段的设计进一步丰富了输出信息,能够包含颜色、材质、行为描述甚至手写文本转录等非结构化内容,极大地扩展了检测任务的语义深度。此外,脚本对模型响应具有鲁棒性,可处理代码块包裹、尾部逗号等JSON格式变形,提升了在实际应用中的稳定性。
使用方法
该数据集的使用方法围绕HuggingFace Jobs的批量推理场景设计。用户通过hf jobs uv run命令启动脚本,需指定输入数据集、输出数据集、vLLM兼容的视觉语言模型(如Qwen/Qwen3.6-35B-A3B)以及自定义的检测提示。输出数据集中,每行原始数据被保留,并新增detections(包含边界框、标签与子标签的列表)、raw_response(模型完整回复)以及inference_info(含模型名称、提示文本、图像尺寸等元数据)三个字段。脚本还提供了inspect-detections.py工具,可在本地生成模型检测结果与真值标注的对比可视化,便于人工审核输出质量。对于少样本场景,需额外通过卷挂载方式提供示例图像及其预期JSON输出文件。数据集被定位为标注流程的种子步骤,其输出为标注级而非训练级,推荐导出至Label Studio等工具进行人工修正后再用于模型训练。
背景与挑战
背景概述
视觉语言模型(VLM)的崛起为开放世界目标检测开辟了新范式,传统依赖固定类别标注的数据集已难以满足多模态大模型对灵活交互与细粒度理解的需求。2025年,由研究者davanstrien等人基于Qwen-VL系列模型构建的vlm-object-detection数据集应运而生,旨在利用VLM的自由文本指令能力实现检测任意目标,并以VLM-as-labeller的核心理念推动目标检测数据集的自动化标注。该数据集采用Apache-2.0许可,通过零样本或少量样本提示,支持从野生动物物种识别到医疗防护装备检测等多样化工信领域,其输出格式兼容Label Studio、FiftyOne等主流标注工具,显著降低了人工标注成本。作为连接视觉语言模型与下游应用的关键桥梁,vlm-object-detection为开放词汇检测、弱监督学习以及数据增强提供了高效的技术方案,在计算机视觉与多模态研究领域展现出重要的实用价值。
当前挑战
当前数据集面临多重技术挑战:首先,VLM生成的边界框精度受模型架构与图像类型显著影响,在自然场景图像中(如动物照片)框定位误差可控制在10像素以内,但在密集文档布局(如报纸版面)中常出现边界发散或整体漏检,导致输出仅达“标注级”而非“训练级”质量标准;其次,模型对长尾类别存在语义混淆现象(如将狐与赤狐混淆),且自由文本提示语的设计缺乏统一范式,正向列举类别的约束策略虽可减少类名漂移,但针对开放式场景仍需依赖后处理过滤,增加了流程复杂度;此外,构建过程中,vLLM框架与特定GPU(如H200)的CUDA内存分配兼容性不足,需手动调整序列缓存参数(如max_num_seqs),且当前默认模型(Qwen3.6-35B-A3B)的推理计算资源需求较高,限制了在边缘设备上的可迁移性。
常用场景
经典使用场景
在计算机视觉与多模态理解的研究版图中,物体检测始终是基石性任务。该数据集依托Qwen-VL系列视觉语言模型,开创性地将自由形式的自然语言指令与检测能力融合,实现了零样本条件下的灵活目标定位。研究者在面对野生动物种类识别、医疗防护装备检测、历史报纸版面元素解析等多元化场景时,仅需提供一条描述性提示词,即可获得包含边界框坐标、类别标签及细粒度子标签的结构化输出。这种VLM-as-Labeller的范式,使得非专家用户也能以极低门槛完成高质量标注数据的初步构建,为后续人工精修与模型训练提供了高效的数据起点。
衍生相关工作
该数据集衍生出一系列重要的学术探索路径。基于其few-shot变体(qwen3vl-detect-fewshot.py),研究者发展出单样本上下文学习范式,通过展示代表性示例图像与期望输出,显著提升了密集版面场景下的检测精度。inspect-detections.py可视化工具催生了多篇关于VLM检测结果质量评估的方法论文,系统分析了模型在不同图像类型上的偏差模式。受其输出架构启发,后续工作进一步探索了子标签语义化的边界,将颜色、材质、行为描述等细粒度信息融入检测结果,推动了场景理解从“是什么”向“怎么样”的认知跃迁。这些衍生工作共同构成了VLM时代物体检测研究的全新生态。
数据集最近研究
最新研究方向
当前,利用视觉语言模型(VLM)进行零样本与少样本的目标检测正成为计算机视觉领域的前沿研究方向。该数据集通过将VLM作为标注自动化工具,突破了传统检测任务对预定义类别集的依赖,支持自由文本指令驱动的检测流程,特别适用于探索性标注、细粒度结构化标签提取及复杂场景(如历史档案页面、医疗防护装备、野生动物监测)的快速标注。其核心创新在于将Qwen-VL等大语言模型的语义理解能力与边界框输出格式无缝衔接,从而为下游标注工具(如Label Studio、FiftyOne)提供高质量的“标注级”初始化数据,显著加速数据集的构建与迭代。这一研究方向不仅降低了目标检测数据生产的门槛,更推动了少样本学习、零样本迁移在现实世界图像理解中的应用,为构建大规模、多模态训练数据集提供了可复用的高效范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务