CSVQA
收藏资源简介:
CSVQA是一个专门用于评估视觉语言模型(VLMs)科学推理能力的中文学科STEM多模态基准。它包含1,378个精心构建的问题-答案对,涵盖了STEM领域的多个学科,每个问题都需要领域知识、视觉证据的整合和高阶推理。与现有的多模态基准相比,CSVQA更强调现实世界的科学内容和复杂的推理。CSVQA数据集来源于中国高中STEM学科的公开教材和试卷,经过严格的筛选和注释,旨在为VLMs提供一个更具挑战性的评估框架。
CSVQA is a Chinese-language STEM multimodal benchmark specifically designed to evaluate the scientific reasoning capabilities of Vision-Language Models (VLMs). It comprises 1,378 carefully constructed question-answer pairs spanning multiple STEM disciplines, where each question requires the integration of domain knowledge, visual evidence, and high-order reasoning. Compared with existing multimodal benchmarks, CSVQA places greater emphasis on real-world scientific content and complex reasoning. Derived from publicly available high school STEM textbooks and examination papers in China, CSVQA has undergone rigorous screening and annotation, aiming to provide a more challenging evaluation framework for VLMs.
CSVQA 数据集概述
数据集基本信息
- 任务类别: 视觉问答、多选题
- 标签: 化学、生物、数学、物理、STEM教育、中文教育
- 规模: 10M < n < 100M
数据集简介
CSVQA(Chinese Science Visual Question Answering)是一个用于评估科学推理能力的多模态基准数据集,专注于中文科学视觉问答。该数据集填补了现有基准在科学语境评估上的不足,强调领域特定知识与视觉证据分析的结合。
数据集特点
- 问题数量: 1,378个精心构建的问答对
- 覆盖学科: 多样化的STEM学科
- 核心要求: 领域知识、视觉证据整合、高阶推理
数据集构成
| 项目 | 数量/比例 |
|---|---|
| 总问题数 | 1,378 |
| 图像类型 | 14 |
| 难度分布 (易:中:难) | 22.6% : 67.4% : 10.0% |
| 多选题 | 1,278 |
| 开放性问题 | 100 |
| 含解释的问题 | 81.1% |
| 问题中含图像 | 1,341 |
| 选项中含图像 | 37 |
| 平均问题长度 | 69.7 |
| 平均选项长度 | 12.1 |
| 平均解释长度 | 123.5 |
主要挑战
- 多学科覆盖: 需要跨学科知识和多样化的推理策略
- 视觉模态多样性: 包含14种不同的视觉模态
- 真实世界情境化: 基于真实STEM场景,要求超越模式识别的能力
排行榜表现
- 开源模型最佳表现: InternVL3-78B (37.4%总体准确率)
- 闭源模型最佳表现: o1 (49.6%总体准确率)
局限性
- 学科覆盖: 目前仅包含高中科学内容
- 数据分布分析: 仍在进行详细的学科和问题类型分布分析
- 标注噪声: 可能存在OCR识别错误或不完整解析
联系方式
- shawn0wang76031@gmail.com
- jianai@bupt.edu.cn




