遇见数据集

Vision-OPD-6K

收藏
Hugging Face2026-05-21 更新2026-05-22 收录
官方服务:

资源简介:

Vision-OPD-6K 是一个用于训练多模态大语言模型(MLLMs)细粒度视觉理解能力的数据集,包含6,241个细粒度视觉问答样本。该数据集是论文《Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation》的配套训练数据,旨在支持一种无需外部教师模型、真实标签、奖励验证器或推理时工具使用的区域到全局自蒸馏框架。每个数据样本包含两种图像输入:1) 带有红色边界框覆盖的全尺寸图像,作为学生策略(标准推理)的输入;2) 边界框内的裁剪区域图像,作为教师策略(特权输入)的输入。数据集以JSON Lines格式(train.jsonl)组织,每条记录包含图像路径、问题提示(含<image>占位符)、真实答案及额外信息。该数据集专门用于MLLMs的在线策略自蒸馏训练,以提升模型对图像细节的感知能力,并促进区域感知到全局感知的迁移研究。实验表明,使用该数据集训练的Vision-OPD模型在多项细粒度视觉评测基准上取得了具有竞争力的性能。

Vision-OPD-6K is a dataset for training fine-grained visual understanding capabilities of multimodal large language models (MLLMs), containing 6,241 fine-grained visual question-answering samples. This dataset accompanies the paper Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation and aims to support a region-to-global self-distillation framework that requires no external teacher models, ground-truth labels, reward verifiers, or inference-time tool usage. Each data sample includes two types of image inputs: 1) a full-size image with a red bounding box overlay, serving as input for the student policy (standard inference); 2) a cropped region image within the bounding box, serving as input for the teacher policy (privileged input). The dataset is organized in JSON Lines format (train.jsonl), with each record containing image paths, question prompts (including <image> placeholders), ground-truth answers, and additional information. It is specifically designed for on-policy self-distillation training of MLLMs to enhance the models perception of image details and facilitate research on region-aware to global-aware transfer. Experiments show that the Vision-OPD model trained with this dataset achieves competitive performance on multiple fine-grained visual evaluation benchmarks.

创建时间:
2026-05-19
原始信息汇总

数据集概述:Vision-OPD-6K

Vision-OPD-6K 是用于训练 Vision-OPD 模型的多模态视觉语言数据集,其核心目标是通过在策略自蒸馏框架,提升模型对图像细节的感知能力,无需外部教师模型、真实标签或推理时工具调用。

核心方法

该数据集服务于一种区域到全局的自蒸馏方法:

  • 教师策略:基于裁剪后的图像区域(包含详情的特权视角)进行推理。
  • 学生策略:基于完整的图像(带边界框覆盖)进行推理,如同标准推理流程。
  • 学生生成在策略的推理路径,教师则据此最小化与学生在下个token分布上的差异。

数据集规模与构成

属性
总样本数 6,241
图像类型 完整图像(带边界框覆盖,学生输入) + 裁剪区域图像(教师输入)
任务类型 细粒度视觉问答(VQA)

数据格式与结构

数据以 train.jsonl 文件存储,每条记录包含以下字段:

字段名 类型 描述
images list[str] 学生输入图像(带边界框)的相对路径
teacher_images list[str] 教师输入图像(裁剪区域)的相对路径
problem str 带有 <image> 标记的问题提示
answer str 标准答案
extra_info dict 包含 answerquestion(无 <image> 前缀)的额外信息

图像数据以压缩文件形式提供,需通过特定命令解压(详见README)。

训练效果

在多个细粒度感知基准测试(如V* Bench、ZoomBench、HR Bench等)上,使用该数据集训练的 Vision-OPD 模型(4B和9B参数)表现优异,平均得分超越了包括更大参数量的开源、闭源及“思考-图像”代理模型。

许可与引用

搜集汇总
数据集介绍
Vision-OPD-6K 数据集图片
构建方式
Vision-OPD-6K数据集是为支撑Vision-OPD框架的自我蒸馏训练而精心构建的。该框架摒弃了传统的外部教师模型或真实标注,转而从同一多模态大语言模型中实例化两种条件策略:一是以裁剪区域图像为特权的教师策略,二是以完整图像为输入的学生策略。数据集包含6,241个细粒度视觉问答样本,每个样本均提供带红色边界框叠加的完整图像(学生输入)与对应的裁剪区域图像(教师输入),二者通过JSONL格式的记录进行关联,确保训练时教师与学生的输入可被精准配对与调用。
使用方法
数据集的使用方式简洁且高效。用户首先需从压缩包中分别提取学生图像与教师图像:学生图像通过解压`images/`目录下的分片压缩包获得,教师图像解压`teacher_images/`目录下的单个压缩包。随后,核心训练数据由`train.jsonl`文件提供,每条记录包含学生与教师图像的相对路径、含<image>标记的问题提示、标准答案以及包含原始问答内容的额外信息字段。研究人员可依据Vision-OPD框架的代码库,直接加载这些文件进行策略内自我蒸馏训练,从而显著提升多模态大语言模型对视觉细节的洞察能力。
背景与挑战
背景概述
Vision-OPD-6K数据集由中国科学院软件研究所和阿里巴巴达摩院的研究人员于2026年联合发布,旨在解决多模态大语言模型在精细视觉感知任务中的核心瓶颈——即模型在全图推理时难以捕捉局部细节信息。该数据集包含6,241个细粒度视觉问答样本,每个样本均包含带有边界框覆盖的完整图像(学生输入)与裁剪后的局部区域图像(教师输入),为区域到全局的自蒸馏框架提供了关键的训练数据。该工作不依赖外部教师模型、真实标签或推理时工具调用,仅通过模型自身的在线策略自蒸馏即可实现精细感知能力的迁移,在V* Bench、ZoomBench等基准测试中以4B和9B参数规模取得了媲美甚至超越GPT-5、Qwen3.5等更大规模模型的性能,显著推动了多模态系统在细粒度理解方向的研究进展。
当前挑战
该数据集所解决的领域挑战在于:现有多模态大语言模型在处理高分辨率图像或包含微小物体、密集文字的场景时,由于标准全图推理的分辨率限制和注意力分散问题,往往丢失关键局部视觉信息,导致细粒度问答任务表现不佳。在数据集构建过程中,研究者需精心设计采样策略以覆盖多样化的细粒度感知场景,并确保裁剪区域与全图输入的对齐一致性;同时,如何在不引入外部标注噪声的前提下,通过模型自身的在线策略蒸馏实现稳定可靠的政策迁移也是一项关键挑战。此外,数据集仅包含6K样本,如何在有限数据量下高效激发模型对局部细节的敏感性,并避免过拟合或灾难性遗忘,同样对自蒸溜训练的稳定性提出了较高要求。
常用场景
经典使用场景
Vision-OPD-6K数据集旨在服务于多模态大语言模型细粒度视觉感知能力的训练与评估。在经典使用场景中,研究人员利用该数据集构建基于区域到全局的自蒸馏框架,通过将模型自身具备的区域级感知优势转移至全图推理策略,从而在不依赖外部教师模型或标注信息的前提下,显著提升MLLM对图像细节的捕捉能力。数据集中每份样本包含带边界框标注的全图与学生输入,以及裁剪后的区域图像作为教师输入,两者协同驱动模型在自回归生成过程中学习更为精细的视觉理解。
解决学术问题
该数据集核心解决了多模态大语言模型在处理高分辨率图像和密集细节任务时感知能力不足的学术难题。传统方法常依赖外部工具或预标注信息来增强模型对细粒度区域的处理,存在推理效率低、泛化性弱等局限。Vision-OPD-6K通过引入在线策略自蒸馏机制,使模型能够在标准推理过程中自主捕获细节语义,从而在V* Bench、ZoomBench、HR Bench等多项基准上取得超越更大参数量模型的效果,为视觉语言模型在不增加计算开销条件下实现高效细粒度理解提供了新的范式。
实际应用
在实际应用层面,Vision-OPD-6K数据集推动的多模态模型在需要高精度视觉问答的场景中展现出广阔前景。例如,医疗影像分析中,模型可精准识别病灶区域细节;遥感图像解译中,能够自动标注微小目标;工业质检领域,可快速定位产品表面缺陷。此外,该数据集训练出的模型在无需外部工具辅助的情况下即可完成复杂视觉推理,极大地降低了部署成本,提升了实时响应能力,为智能安防、自动驾驶等对细节敏感的应用提供了可靠支撑。
数据集最近研究
最新研究方向
Vision-OPD-6K数据集聚焦于多模态大语言模型(MLLMs)的细粒度视觉感知能力提升,其核心创新在于提出了一种基于同策略自蒸馏的区域到全局知识迁移框架。该数据集由6.2K个精细视觉问答样本构成,每个样本包含带边界框叠加的全图(学生输入)和裁剪区域图像(教师输入),通过让模型自身的裁剪条件教师策略蒸馏其特权区域感知知识至全图条件学生策略,实现了无需外部教师模型、真值标签或推理时外部工具调用的高效训练。实验表明,仅4B参数的Vision-OPD模型在V* Bench、ZoomBench、HR Bench等多项细粒度视觉基准上超越了GPT-5.2、Gemini-3.1-Pro等更大或闭源模型及代理模型,以9B版本平均得分75.70%刷新了同参数量级SOTA。这一工作不仅为MLLMs在文本密集、高分辨率场景下的精准视觉推理提供了轻量级解决方案,也开辟了利用模型自身内部知识强化局部细节感知的新范式,对推动多模态系统从粗粒度语义理解向微观视觉证据挖掘的演进具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务