遇见数据集

FG-BMK

收藏
arXiv2026-06-17 更新2026-06-19 收录
数据链接:
官方服务:

资源简介:

FG-BMK是由东南大学、阿里巴巴集团等机构联合创建的大规模细粒度视觉评估基准,旨在系统评估大型视觉语言模型在细粒度图像任务上的能力。该数据集包含101万条问题和28万张图像,覆盖13个细粒度数据集,数据来源涵盖常见物体中心领域及遥感等专业领域。其构建过程通过数据收集、问题生成和质量验证确保可靠性,设计结合人类导向的对话式语义识别与机器导向的视觉特征判别双范式。该数据集主要应用于计算机视觉领域,用于诊断模型在细粒度识别中的视觉表示、语义对齐和知识瓶颈问题,推动更可靠模型的发展。

FG-BMK is a large-scale fine-grained visual evaluation benchmark jointly developed by Southeast University, Alibaba Group and other institutions. It aims to systematically evaluate the capabilities of large vision-language models (VLMs) on fine-grained image tasks. This dataset contains 1.01 million questions and 280,000 images, covering 13 fine-grained datasets, with data sources spanning both general object-centric domains and professional fields such as remote sensing. The reliability of FG-BMK is ensured through three key stages in its construction workflow: data collection, question generation and quality validation. Its design integrates two paradigms: human-oriented conversational semantic recognition and machine-oriented visual feature discrimination. Primarily applied in the field of computer vision, this benchmark is used to diagnose the visual representation, semantic alignment and knowledge bottleneck issues of models in fine-grained recognition, thereby promoting the development of more reliable models.

创建时间:
2026-06-17
原始信息汇总

FG-BMK 数据集详情

数据集概述

FG-BMK(Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis)是一个用于评估大型视觉语言模型(LVLMs)在细粒度图像任务上能力的综合基准。

核心规模

  • 问题数量:101万(1.01M)
  • 图像数量:28万(0.28M)
  • 数据来源:13个数据源
  • 诊断任务:5项

数据集组成

13个细粒度数据集,涵盖多个领域

领域 数据集
自然与生物 CUB-200, Stanford Dogs, iNat2021, Flowers-102, VegFru
工业与制造 FGVC Aircraft, Stanford Cars, Products-10K, Wine
日常生活与专业领域 DeepFashion, Food-101, SkinCon, MTARSI

评估范式

FG-BMK通过两种互补的评估范式探测细粒度能力:

  1. 面向人类(Human-Oriented) :对话级细粒度语义识别

    • 层次化粒度识别
    • 属性识别
    • 知识偏差评估
  2. 面向机器(Machine-Oriented) :特征级视觉判别性

    • 分类任务
    • 检索任务

关键发现

评估:当前LVLMs的细粒度识别能力不足

  • 精度随粒度细化而下降:以InternVL3在CUB-200上的表现为例,类别级准确率99.76%,属级降至90.75%,种级仅61.18%/62.48%
  • 落后于专用细粒度模型:在FGVC Aircraft上,LVLMs最高66.19%(短答案),专用模型达95.40%
  • 属性感知不均匀且薄弱:模式识别最高50.13%,形状识别最低仅29.30%

诊断:细粒度失败的根源

  • 在专业领域,语义理解是瓶颈而非视觉判别
  • 判别性不等于语义接地:线性探测与原图生成之间准确率差距显著(如BLIP3-o从89.92%降至73.65%)
  • 对齐策略可能削弱细粒度特征:LLaVA原始视觉特征比对齐后特征平均高3.39%
  • 知识偏差根植于训练数据覆盖和底层LLM

改进:有效的训练设计

  • 对比训练构建更好特征:对比训练的编码器(EVA-CLIP, DINOv2, InternVL)优于重建式(BEiT3)或生成式(Qwen)
  • 仅靠规模不足:DINOv2从B扩展到G,准确率仅提升0.9%
  • 混合通用与细粒度数据训练:SFT中按1:1比例混合可保持通用能力同时提升细粒度准确率

鲁棒性:扰动下的脆弱性

  • 细粒度特征特别脆弱:在白盒攻击下,CUB-200准确率从88.95%骤降至24.94%
  • 语言先验可覆盖视觉证据:误导性语言线索导致Qwen2.5-VL在CUB上真假判断准确率下降42.80%
搜集汇总
数据集介绍
FG-BMK 数据集图片
构建方式
在细粒度图像分析这一计算机视觉基础研究领域,现有的大规模视觉语言模型(LVLM)基准测试多聚焦于整体或任务特定能力,对细粒度任务的评估尚显不足。为填补这一空白,FG-BMK基准应运而生。该基准汇集了来自13个精细标注数据集的28万张图像,覆盖从常见物体中心领域到遥感、医疗等专业领域。其构建方式独具匠心,通过两套互补范式——面向人类对话的语义识别评估与面向机器特征的视觉判别性评估,系统性地构造了101万个问题。在数据策展环节,研究团队严格把控质量,从可靠来源筛选图像,并基于属性标签、类别标签和层级分类学信息,采用规则化模板生成真/假、多选、简答等多类型问题,同时精心设计近义负样本与干扰项以确保评估的细粒度区分要求。
特点
FG-BMK的突出特点在于其诊断性评估架构。不同于将细粒度能力简化为单一分类问题,该基准通过人类导向与机器导向双重范式,分别考察对话层面的细粒度语义理解与特征层面的视觉判别性。前者涵盖属性感知、层级粒度识别与知识偏差估计,后者则聚焦图像检索与识别两大核心视觉任务。这种设计使得FG-BMK能够精准诊断LVLM的失败根源——究竟源于视觉表征不足、视觉-语义对齐薄弱,还是细粒度知识匮乏。基准覆盖了从鸟类、花朵到飞机、遥感图像等多样化的领域,并纳入了层级分类学信息,能够检验模型在不同粒度下的识别退化趋势。此外,其包含的101万问题规模为统计显著性的诊断分析提供了坚实基础。
使用方法
使用FG-BMK时,研究者可沿其设计的渐进式诊断路径展开分析。首先,通过人类导向评估衡量模型在对话场景下对细微属性的感知能力、层级识别的退化规律及不同类别间知识偏差的分布。随后,借助机器导向评估提取LVLM的视觉特征,通过线性探测或近邻检索检验其细粒度类别可分性,从而定位瓶颈在于视觉判别力抑或语义映射能力。该基准支持对比分析不同训练范式(对比学习、生成式、重建式)对细粒度表征的影响,也能评估视觉扰动(噪声、模糊)与语言扰动(误导性提示)对模型鲁棒性的冲击。研究者更可结合基准提供的分析框架,探索数据规模、视觉编码器尺度、微调数据组成等训练设计因素对细粒度能力的改善效果。
背景与挑战
背景概述
在大型视觉-语言模型(LVLMs)蓬勃发展的浪潮中,尽管它们在多模态感知与推理方面展现了卓越能力,但对其在细粒度图像任务上的表现仍缺乏系统性认识。为填补这一空白,由东南大学、阿里巴巴集团、北京大学、哥本哈根大学等机构的研究人员于2026年联合提出了FG-BMK基准。该基准包含101万道问题与28万张图像,覆盖从常见物体到遥感等专业领域的多样化场景,通过人本导向与机器导向两种范式,共同评估LVLMs在对话层面的细粒度语义识别与特征层面的视觉判别能力。FG-BMK的创建为深入剖析LVLMs在细粒度视觉任务中的能力边界提供了重要工具,推动了相关领域的研究进展。
当前挑战
FG-BMK所应对的核心挑战在于,现有LVLMs在细粒度图像任务上表现欠佳,其失败原因往往交织于视觉表征不足、视觉-语义对齐薄弱、模态对齐偏差以及类别级知识匮乏等多个瓶颈。具体而言,模型在区分过细粒度类别时准确率骤降,在属性识别上表现不均,且在专业领域(如遥感、医学图像)中语义理解成为主要短板。此外,构建过程中面临数据采集的领域覆盖与质量保障难题,需从13个细粒度数据集中精心筛选图像,并设计任务特定的规则模板以生成多格式问题,同时确保负样本在视觉或语义上与正样本足够接近,以真正衡量模型的细粒度判别能力。
常用场景
经典使用场景
FG-BMK作为大规模细粒度图像评估基准,涵盖101万道问题和28万张图像,横跨普通物体中心领域与遥感、医学等专业领域。其核心使用场景在于系统性评估大型视觉语言模型在多层级语义理解上的表现,从属性感知、层级粒度识别到知识偏差估计,全面检验模型在细粒度视觉任务上的语义判别能力。研究者可通过该基准中的对话式问答任务,精准衡量模型在不同细粒度层级上的识别衰退情况,从而揭示当前模型在区分高度相似子类别时的性能边界。
衍生相关工作
FG-BMK衍生了多项具有影响力的学术工作。基于其诊断框架,研究者进一步探索了对齐数据粒度对视觉特征可判别性的影响机制,揭示了粗粒度图文对可能削弱细粒度语义锚定的关键发现。在训练策略层面,该基准催生了关于对比学习范式如何有效增强细粒度视觉区分性的系列研究,以及混合通用与细粒度指令数据以保持多模态综合能力同时提升细粒度识别性能的探索。此外,针对统一理解-生成模型中细粒度概念锚定问题的分析也为后续视觉生成与理解的协同进化研究开辟了新方向。
数据集最近研究
最新研究方向
当前大型视觉语言模型在细粒度图像任务上展现出显著的局限性。FG-BMK基准的构建揭示了这些模型在细粒度识别方面的深层瓶颈:尽管在粗粒度语义区分上表现优异,但面对高度相似的下属类别时性能急剧下滑,其视觉表征的精细判别能力远不及专用细粒度模型。研究进一步从视觉表征、语义对齐、模态融合和类别知识四个维度进行诊断性剖析,发现对比学习范式虽能有效增强特征判别性,但视觉-语言对齐过程中的粒度失配会损害这一能力;尤其在遥感等专业领域,语义理解成为比视觉判别更关键的瓶颈。该工作为发展更加可靠、具备粒度感知能力的多模态模型提供了系统性指导,强调了细粒度视觉理解作为评估多模态智能核心能力的重要价值。
相关研究论文
  • 1
    Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis东南大学·计算机科学与工程学院; 阿里巴巴集团; 北京大学·王选计算机技术研究所·多媒体信息处理国家重点实验室; 哥本哈根大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务