CSVQA
收藏资源简介:
中文STEM视觉问答(CSVQA)基准建立了一个严格的多模态评估框架,专门设计用于量化视觉语言模型中的科学推理能力。CSVQA包含1,378个专家标注的问题,每个问题平均长度适中,平衡了语言处理负载和推理深度。几乎每个问题都配有详细的解释,便于评估思维链推理和进行可解释的错误分析。
The Chinese STEM Visual Question Answering (CSVQA) benchmark establishes a rigorous multimodal evaluation framework specifically designed to quantify the scientific reasoning capabilities in vision-language models. CSVQA consists of 1,378 expert-annotated questions, each with a moderate average length that balances the language processing load and reasoning depth. Nearly every question is accompanied by detailed explanations, facilitating the evaluation of Chain-of-Thought reasoning and interpretable error analysis.
CSVQA: 中文多模态科学推理能力评估基准
数据集概述
- 全称:Chinese STEM Visual Question Answering (CSVQA)
- 目标:评估视觉语言模型(VLMs)的科学推理能力
- 特点:
- 覆盖多个STEM学科(生物、化学、数学、物理)
- 包含14种不同的视觉模态
- 基于真实场景的问题设计
- 需要领域专业知识进行推理
数据集统计
- 问题数量:1,378个专家标注问题
- 语言版本:中文和英文
- 附加信息:大多数问题配有详细解释
评估维度
- 学科分类:
- 生物学
- 化学
- 数学
- 物理学
- 问题类型:
- 视觉+问题(V+Q)
- 纯问题(Q)
- 描述+问题(C+Q)
排行榜表现
- 最佳开源模型:
- Qwen2.5-VL-72B (总体准确率38.5%)
- 最佳闭源模型:
- o1 (总体准确率49.6%)
数据格式
- 原始格式:TSV文件
- 处理工具:提供TSV转JSONL的转换脚本
- 图像存储:单独目录存储
评估流程
-
数据准备:
- 下载原始TSV文件
- 转换为JSONL格式
- 生成图像描述(可选)
-
模型评估:
- 支持开源和闭源模型
- 批量推理加速
- 支持三种问题类型
-
结果分析:
- 自动生成分析报告
- 支持结果汇总(XLSX格式)
引用信息
bibtex @misc{jian2025csvqachinesemultimodalbenchmark, title={CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs}, author={Ai Jian and Weijie Qiu and Xiaokun Wang and Peiyu Wang and Yunzhuo Hao and Jiangbo Pei and Yichen Wei and Yi Peng and Xuchen Song}, year={2025}, eprint={2505.24120}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2505.24120}, }




