遇见数据集

RodelaG/gsm8k-rendered-vlm

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

GSM8K-VL 数据集是一个多模态数学推理数据集,专为视觉语言模型评估而设计。每个示例包含四个关键部分:一个来自GSM8K的文本数学问题(question)、最终数值答案(answer)、清理后的链式思维推理过程(reasoning),以及渲染图像路径(image)。该数据集旨在支持控制实验,以比较纯文本和基于图像的推理行为。数据来源于GSM8K测试集,图像通过数字渲染生成,无额外视觉提示,仅包含问题文本。评估主要基于最终答案的精确匹配准确率,推理部分用于分析而非评分。数据集规模在1K到10K之间,适用于多模态和数学推理研究。

Rendered GSM8K-VL is a multimodal math-reasoning dataset for vision-language model evaluation. Each example includes a GSM8K word problem (question), the final numeric answer (answer), cleaned chain-of-thought reasoning (reasoning), and a rendered image path (image). The dataset is intended for controlled experiments comparing text-only and image-based reasoning behavior. It is derived from the GSM8K test split, with images rendered digitally to contain only the question text without visual cues. Evaluation focuses on exact match accuracy of the final answer, with reasoning provided for analysis. The dataset size is between 1K and 10K samples and supports multimodal and math-reasoning research.

提供机构:
RodelaG
搜集汇总
数据集介绍
RodelaG/gsm8k-rendered-vlm 数据集图片
构建方式
GSM8K-Rendered-VLM数据集以经典数学推理基准GSM8K的测试集为文本蓝本,通过将原始文字应用题转化为整洁的数字渲染图像,构建起多模态数学推理任务。具体而言,每条样本包含原始题目文本、经清理的链式思维推理过程、最终数值答案,以及由渲染引擎以固定参数(宽度672像素、字号22、边距40)生成的纯净文本图像。所有处理后的元数据整合于gsm8k_metadata_clean.csv文件中,图像统一存放于rendered_images目录,并按q0000.png至q1318.png的顺序命名,形成文本-图像-答案的三元组结构。
特点
该数据集的核心特性在于实现了文本数学推理与视觉语言模型评估之间的可控桥接。其图像渲染排除了模糊、压缩、旋转或背景噪声等视觉干扰,使得模型必须依赖对图像中纯文本的读取与数学推理能力,而非视觉线索。此外,数据集保留了完整的链式思维推理过程,为可解释性分析提供了依据,但官方评估严格以最终答案的精确匹配准确率为指标。约1300余条样本的规模,既适合快速验证,也便于开展消融实验。
使用方法
使用该数据集时,研究者首先需加载gsm8k_metadata_clean.csv文件读取样本的id、问题、答案、图像路径及推理过程。随后,将图像路径与rendered_images目录中的PNG文件对应,构建视觉输入。典型评估流程为:向视觉语言模型输入渲染图像,要求其输出数值答案,并与answer字段进行精确匹配对比获取准确率。推荐采用Pandas库进行元数据处理,并辅以缺失图像校验(预期缺失数为0)。该数据集特别适用于对比纯文本与图像模态下模型推理行为的差异实验。
背景与挑战
背景概述
在视觉语言模型(VLM)蓬勃发展的背景下,数学推理能力成为衡量模型智能水平的关键指标。GSM8K-Rendered-VLM(GSM8K-VL)数据集由Ghosh与Gupta于2025年创建,基于OpenAI经典的GSM8K文本数学推理基准,通过高质量渲染将1320道小学数学应用题转化为图像形式,旨在系统评估VLM在纯文本呈现条件下的数学推理表现。该数据集填补了多模态数学推理评估领域的空白,为控制实验提供了标准化的图像-答案配对资源,其设计理念强调了视觉编码与语言推理的解耦分析,对揭示VLM在符号理解与步骤推理中的局限性具有重要意义,已成为多模态领域模型评估的重要参考基准。
当前挑战
GSM8K-VL数据集面临的核心挑战在于双重维度。在领域问题层面,需解决VLM如何在不依赖图像中视觉线索(如图表、手写体)的前提下,仅凭文本渲染图像完成数学符号识别与逻辑推理,这与人类阅读题目后计算的方式存在本质差异。在构建过程中,面临渲染参数选择(如字体、分辨率)对模型性能影响的敏感性难题,需确保图像仅包含题面信息而避免引入额外噪声;同时,从GSM8K文本基准到图像模态的转换需保持语义完整性,并处理多步骤推理链的清洗与格式化,使图像版式标准化以消除潜在混淆变量,确保评估结果的可重复性与公平性。
常用场景
经典使用场景
在视觉语言模型的研究中,GSM8K-VL数据集被设计为一项关键评测基准,专门用于评估模型对数学推理问题的图像理解与数值预测能力。该数据集巧妙地将经典的GSM8K文字数学问题渲染为清晰无噪的图像,从而在保持原始文本推理逻辑的前提下,构建了文本与视觉模态之间的可控对照实验环境。研究者可借助这一资源,精确分析模型在面对纯文本输入与渲染图像输入时推理行为的差异,进而深入探究视觉外观对数学推理过程的影响。这一设计特别适用于对比实验,以揭示当前多模态模型在数值推理任务中是否真正利用了视觉信息,抑或仅仅依赖文本特征。
衍生相关工作
基于GSM8K-VL数据集,研究社区已催生了一系列经典的衍生工作。其中,最突出的是针对多模态大语言模型在数学推理任务上的对比分析方法,研究者利用该数据集揭示了不同视觉编码器与语言解码器组合对推理准确率的影响。此外,部分工作探索了如何利用该数据集进行视觉提示工程的优化,以提升模型在视觉数学推理场景中的表现。还有研究以此为基础,拓展了对抗性渲染图像下的鲁棒性测试,模拟真实世界中可能出现的视觉干扰。这些衍生工作共同构建了从基础评测到模型改进的完整研究链条,极大地丰富了视觉语言模型在数学推理领域的知识体系。
数据集最近研究
最新研究方向
近年来,随着多模态大语言模型的迅猛发展,数学推理能力评估成为衡量模型认知水平的关键指标。GSM8K-VL数据集通过将经典GSM8K文本数学问题渲染为纯文本图像,构建了一个控制变量下的多模态推理基准,为探究视觉语言模型在数学推理中的文本与图像处理差异提供了前沿实验平台。该数据集紧密关联当前热点——即多模态模型在符号推理任务中的“视觉干扰”与“语义理解”边界问题,其意义在于剥离了传统视觉线索,聚焦于模型对渲染文本的感知与推理对齐能力,为评估CLIP、LLaVA等模型的泛化鲁棒性及设计更严谨的多模态数学基准提供了关键研究工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务