OpenVLMRecords
收藏资源简介:
OpenVLM Records数据集包含由VLMEvalKit生成的所有评估记录,这些记录反映在OpenVLM Leaderboard上。记录文件按照特定的命名系统组织,每个文件包含特定多模态基准测试中MLLM的原始响应。数据集不直接提供分数或度量文件,但可以通过VLMEvalKit工具获取具体的性能数字。数据集支持中英文,适用于视觉问答任务,大小在1M到10M之间。
The OpenVLM Records dataset contains all evaluation records generated by VLMEvalKit, which are displayed on the OpenVLM Leaderboard. The record files are organized according to a specific naming convention, with each file holding the raw responses of Multimodal Large Language Models (MLLMs) for a specific multimodal benchmark. The dataset does not directly provide score or metric files, but specific performance figures can be obtained via the VLMEvalKit toolkit. This dataset supports both Chinese and English, is applicable to visual question answering tasks, and has a size ranging from 1M to 10M.
OpenVLM Records 数据集概述
基本信息
- 许可证:Apache-2.0
- 语言:英语、中文
- 任务类别:视觉问答
- 数据规模:1M<n<10M
数据组织与命名
- 命名系统:评估记录文件按照
mmeval/{VLM-A}/{VLM-A}_{BENCH-B}.xlsx的格式命名,其中VLM-A表示多模态大模型,BENCH-B表示多模态基准测试。 - 内容:记录文件包含
VLM-A在BENCH-B中每个问题的原始响应。
性能评估
- 获取性能指标:使用
vlmutil eval {BENCH-B} mmeval/{VLM-A}/{VLM-A}_{BENCH-B}.xlsx命令获取特定性能指标。 - 注意事项:某些基准测试在评估/计算指标时需要 GPT API,因此可能需要设置环境变量以进行 API 调用。
引用
- BibTeX: bib @misc{duan2024vlmevalkit, title={VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models}, author={Haodong Duan and Junming Yang and Yuxuan Qiao and Xinyu Fang and Lin Chen and Yuan Liu and Xiaoyi Dong and Yuhang Zang and Pan Zhang and Jiaqi Wang and Dahua Lin and Kai Chen}, year={2024}, eprint={2407.11691}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2407.11691}, }




