FG-BMK
收藏资源简介:
FG-BMK是由东南大学、阿里巴巴集团等机构联合创建的大规模细粒度视觉评估基准,旨在系统评估大型视觉语言模型在细粒度图像任务上的能力。该数据集包含101万条问题和28万张图像,覆盖13个细粒度数据集,数据来源涵盖常见物体中心领域及遥感等专业领域。其构建过程通过数据收集、问题生成和质量验证确保可靠性,设计结合人类导向的对话式语义识别与机器导向的视觉特征判别双范式。该数据集主要应用于计算机视觉领域,用于诊断模型在细粒度识别中的视觉表示、语义对齐和知识瓶颈问题,推动更可靠模型的发展。
FG-BMK is a large-scale fine-grained visual evaluation benchmark jointly developed by Southeast University, Alibaba Group and other institutions. It aims to systematically evaluate the capabilities of large vision-language models (VLMs) on fine-grained image tasks. This dataset contains 1.01 million questions and 280,000 images, covering 13 fine-grained datasets, with data sources spanning both general object-centric domains and professional fields such as remote sensing. The reliability of FG-BMK is ensured through three key stages in its construction workflow: data collection, question generation and quality validation. Its design integrates two paradigms: human-oriented conversational semantic recognition and machine-oriented visual feature discrimination. Primarily applied in the field of computer vision, this benchmark is used to diagnose the visual representation, semantic alignment and knowledge bottleneck issues of models in fine-grained recognition, thereby promoting the development of more reliable models.
FG-BMK 数据集详情
数据集概述
FG-BMK(Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis)是一个用于评估大型视觉语言模型(LVLMs)在细粒度图像任务上能力的综合基准。
核心规模
- 问题数量:101万(1.01M)
- 图像数量:28万(0.28M)
- 数据来源:13个数据源
- 诊断任务:5项
数据集组成
13个细粒度数据集,涵盖多个领域
| 领域 | 数据集 |
|---|---|
| 自然与生物 | CUB-200, Stanford Dogs, iNat2021, Flowers-102, VegFru |
| 工业与制造 | FGVC Aircraft, Stanford Cars, Products-10K, Wine |
| 日常生活与专业领域 | DeepFashion, Food-101, SkinCon, MTARSI |
评估范式
FG-BMK通过两种互补的评估范式探测细粒度能力:
-
面向人类(Human-Oriented) :对话级细粒度语义识别
- 层次化粒度识别
- 属性识别
- 知识偏差评估
-
面向机器(Machine-Oriented) :特征级视觉判别性
- 分类任务
- 检索任务
关键发现
评估:当前LVLMs的细粒度识别能力不足
- 精度随粒度细化而下降:以InternVL3在CUB-200上的表现为例,类别级准确率99.76%,属级降至90.75%,种级仅61.18%/62.48%
- 落后于专用细粒度模型:在FGVC Aircraft上,LVLMs最高66.19%(短答案),专用模型达95.40%
- 属性感知不均匀且薄弱:模式识别最高50.13%,形状识别最低仅29.30%
诊断:细粒度失败的根源
- 在专业领域,语义理解是瓶颈而非视觉判别
- 判别性不等于语义接地:线性探测与原图生成之间准确率差距显著(如BLIP3-o从89.92%降至73.65%)
- 对齐策略可能削弱细粒度特征:LLaVA原始视觉特征比对齐后特征平均高3.39%
- 知识偏差根植于训练数据覆盖和底层LLM
改进:有效的训练设计
- 对比训练构建更好特征:对比训练的编码器(EVA-CLIP, DINOv2, InternVL)优于重建式(BEiT3)或生成式(Qwen)
- 仅靠规模不足:DINOv2从B扩展到G,准确率仅提升0.9%
- 混合通用与细粒度数据训练:SFT中按1:1比例混合可保持通用能力同时提升细粒度准确率
鲁棒性:扰动下的脆弱性
- 细粒度特征特别脆弱:在白盒攻击下,CUB-200准确率从88.95%骤降至24.94%
- 语言先验可覆盖视觉证据:误导性语言线索导致Qwen2.5-VL在CUB上真假判断准确率下降42.80%

- 1Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis东南大学·计算机科学与工程学院; 阿里巴巴集团; 北京大学·王选计算机技术研究所·多媒体信息处理国家重点实验室; 哥本哈根大学 · 2026年



