PairTally
收藏资源简介:
PairTally是第一个专门设计用于测试细粒度类别内差异的计数基准数据集,包含681张高分辨率、受控的图像对,涵盖5个超类别(食品、娱乐、家居、办公和其他),54个对象类别和98个子类别
PairTally is the first counting benchmark dataset specifically designed to test fine-grained within-category differences. It contains 681 high-resolution, controlled image pairs, covering 5 super-categories (Food, Entertainment, Home, Office, and Others), 54 object categories, and 98 sub-categories.
PairTally 数据集概述
数据集基本信息
- 名称:PairTally
- 简介:首个专门设计用于测试细粒度类内区分的计数基准数据集
- 图像总数:681张高分辨率图像
- 对象类别:54个
- 子类别:98个
- 超类别:5个(食品、娱乐、家居、办公、其他)
- 类别间对:50对
- 类别内对:47对
数据集结构
PairTally/ ├── images/ # 681张高分辨率图像 ├── annotations/ │ ├── pairtally_annotations_simple.json │ └── image_metadata.json └── evaluation/ # 评估脚本和工具
属性分布
| 属性类型 | 占比 | 示例 |
|---|---|---|
| 颜色 | 43.5% | 黑白棋子 |
| 形状/纹理 | 42.5% | 螺旋形与笔管面 |
| 大小 | 14.1% | 大小弹珠 |
评估模型
数据集评估了10种最先进模型,涵盖三种计数范式:
- CountGD(多模态开放世界计数)
- DAVE(检测-验证范式)
- GeCo(少样本计数统一架构)
- LoCA(学习计数一切)
- FamNet(学习计数一切)
- LLMDET
- 视觉语言模型(Qwen2.5-VL、LLaMA-3.2、InternVL3、Ovis2)
主要性能结果
整体性能(所有对象计数)
- 最佳模型:CountGD(MAE:46.67)
- 最差模型:FamNet(MAE:75.83)
类别间与类别内性能
- 类别间MAE最佳:CountGD(39.78)
- 类别内MAE最佳:DAVE(46.75)
属性特定性能(类别内)
- 颜色MAE最佳:DAVE(63.44)
- 大小MAE最佳:CountGD(36.30)
- 纹理MAE最佳:DAVE(34.14)
关键发现
- 模型局限性:即使性能最佳的模型MAE也超过50,表明有显著改进空间
- 干扰物敏感性:大多数模型处理类别内对比类别间区分更困难
- 属性层次:颜色差异最易区分,大小差异最具挑战性
- VLM性能:大型视觉语言模型表现不如专门的计数方法
- 过度计数偏差:模型经常计数所有对象而非遵循特定提示
许可证
- 类型:CC BY 4.0
- 用途:学术研究
引用格式
bibtex @inproceedings{nguyen2025pairtally, title={Can Current AI Models Count What We Mean, Not What They See? A Benchmark and Systematic Evaluation}, author={Nguyen, Gia Khanh and Huang, Yifeng and Hoai, Minh}, booktitle={Digital Image Computing: Techniques and Applications (DICTA)}, year={2025} }
联系方式
Gia Khanh Nguyen
澳大利亚机器学习研究所
阿德莱德大学
邮箱:giakhanh.nguyen01@adelaide.edu.au




