CapArena-Auto
收藏资源简介:
CapArena-Auto 是一个用于详细图像描述的自动化评估基准,包含600张评估图像,并通过与三个基线模型的成对战斗来评估模型性能。最终得分由GPT4o-as-a-Judge计算。
CapArena-Auto is an automated evaluation benchmark for detailed image captioning. It comprises 600 evaluation images, and assesses model performance via pairwise head-to-head battles against three baseline models. The final scores are computed by GPT4o-as-a-Judge.
CapArena数据集概述
数据集基本信息
- 名称:CapArena
- 类型:图像描述生成(Image Captioning)基准测试数据集
- 关联论文:CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
- 发布状态:
- [x] CapArena-Auto使用指南
- [x] 论文结果复现代码和数据
- [ ] 其他资源
数据集组成
CapArena-Auto
- 用途:自动化详细图像描述评估基准
- 内容:
- 600张评估图像
- 3个基线模型的成对比较
- GPT4o作为评判标准
- 评估指标:
- Score_avg(平均得分)
- Score_gpt(GPT评分)
- Score_cog(Cog评分)
- Score_cpm(CPM评分)
- Length_Avg(平均长度)
CapArena人工标注结果
- 内容:
- 6523对人类标注的成对比较结果
- 包含多种描述指标的标注结果(如GPT-4o、LLaVA-OneVision等)
数据获取
使用指南
评估自定义模型
-
查看当前排行榜:
- 下载已评估模型结果
- 运行
python caparena_auto_scores.py
-
生成描述:
-
使用GPT4o评估:
- 配置OpenAI API密钥
- 运行
python caparena_auto_eval.py
-
查看分数:
- 运行
python caparena_auto_scores.py --new_model_name Model-Test
- 运行
复现论文结果
-
计算一致性:
- 运行
python caparena_metrics.py
- 运行
-
VLM-as-a-Judge:
- 运行
python vlm_as_a_judge.py
- 运行
致谢
- 感谢DOCCI提供的高质量人工标注工作
- 感谢所有参与CapArena数据集编译的标注人员
引用
bibtex @article{cheng2025caparena, title={CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era}, author={Cheng, Kanzhi and Song, Wenpo and Fan, Jiaxin and Ma, Zheng and Sun, Qiushi and Xu, Fangzhi and Yan, Chenyang and Chen, Nuo and Zhang, Jianbing and Chen, Jiajun}, journal={arXiv preprint arXiv:2503.12329}, year={2025} }




