遇见数据集

gsm8k-rendered-vlm

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

Rendered GSM8K-VL是一个用于评估视觉语言模型的多模态数学推理数据集。它基于GSM8K数学文字问题的测试集构建,将每个问题渲染为包含纯文本的图像。每个数据样本包括四个关键部分:原始GSM8K问题文本(question)、提取的最终数字答案(answer)、经过清理的思维链式推理过程(reasoning),以及渲染图像的文件路径(image)。数据集共包含1319个样本,图像命名规则为q0000.png至q1318.png。该数据集专门设计用于控制实验,以比较纯文本模型与基于图像的模型在数学推理任务上的表现差异。主要评估指标为最终数字答案的精确匹配准确率,仅使用answer字段进行评分,reasoning字段仅供分析和可解释性研究使用。渲染过程采用受控的清洁数字渲染,无模糊、压缩、旋转或背景噪声等视觉干扰,确保图像仅包含问题文本本身,不提供额外的视觉推理线索。

Rendered GSM8K-VL is a multimodal mathematical reasoning dataset designed for evaluating vision-language models. Built upon the test split of the GSM8K mathematical word problem dataset, it renders each problem into an image containing only plain text. Each data sample includes four core components: the original GSM8K question text (question), the extracted final numerical answer (answer), the cleaned chain-of-thought reasoning process (reasoning), and the file path of the rendered image (image). The dataset contains a total of 1,319 samples, with images named following the rule from q0000.png to q1318.png. This dataset is specifically designed for controlled experiments to compare the performance differences between plain-text models and image-based models on mathematical reasoning tasks. The primary evaluation metric is the exact match accuracy of the final numerical answer, with scoring conducted solely using the answer field; the reasoning field is only intended for analysis and interpretability research. The rendering process adopts controlled clean digital rendering, free from visual distractions such as blurring, compression, rotation, or background noise, ensuring that the image only contains the question text itself without providing any additional visual reasoning cues.

创建时间:
2026-05-26
原始信息汇总

数据集概述:GSM8K-VL(Rendered GSM8K-VL)

  • 数据集名称:GSM8K-VL(Rendered GSM8K-VL)
  • 许可协议:MIT
  • 任务类别:问答、视觉问答
  • 语言:英语
  • 标签:视觉语言、数学推理、GSM8K、多模态
  • 数据集大小:1,000 < 样本数 < 10,000

数据构成

  • 来源:源自 openai/gsm8k 数据集的 test 子集。
  • 图像渲染:使用 render_config.json 配置(宽度672 px、字号22、内边距40,无模糊、压缩、旋转或背景噪声),生成纯净的数字渲染图像。
  • 文件结构
    • rendered_images/:包含编号为 q0000.pngq1318.png 的渲染图像。
    • gsm8k_metadata_clean.csv官方推荐使用的规范元数据文件
    • gsm8k_metadata.csv:中间/原始风格元数据。
    • gsm8k_metadata_fixed.csv:中间路径标准化元数据。
    • render_config.json:渲染配置说明。
    • README.md:数据集卡片。

数据字段(来自 gsm8k_metadata_clean.csv

  • id(整型):与GSM8K测试顺序对齐的索引。
  • question(字符串):原始GSM8K问题文本。
  • answer(字符串/整型):从 #### ... 中提取的最终数值答案。
  • image(字符串):图像相对路径,如 rendered_images/q0000.png
  • reasoning(字符串):原始GSM8K逐步推理过程,已移除 <<...>> 格式工件。

任务定义

  • 输入:一张渲染后的GSM8K数学文字题图像(图像仅包含问题文本,无视觉推理线索)。
  • 输出:预测最终数值答案。

评估协议

  • 主要指标:最终数值答案的精确匹配准确率。
  • 评分依据:使用 answer 字段(最终答案),而非 reasoning 字段。
  • 推理字段用途reasoning 仅用于分析与可解释性研究,不参与官方评分。

使用示例(Pandas)

python import pandas as pd

df = pd.read_csv("gsm8k_metadata_clean.csv") print(df.columns.tolist()) print(df.iloc[0][["question", "answer", "image"]])

快速验证(检查图像完整性)

python import pandas as pd from pathlib import Path

df = pd.read_csv("gsm8k_metadata_clean.csv") missing = [img for img in df["image"] if not Path(img).exists()] print("Missing images:", len(missing)) print(missing[:10])

预期输出:Missing images: 0

引用建议

  • 使用本数据集时,请引用:
    1. GSM8K(Cobbe 等人,2021)
    2. 本工作(GSM8K-VL 数据集及相关实验;Ghosh & Gupta,2025)
搜集汇总
数据集介绍
gsm8k-rendered-vlm 数据集图片
构建方式
GSM8K-Rendered-VLM数据集以多模态数学推理评估为核心目标,基于OpenAI发布的GSM8K文本基准构建而成。其构建过程从GSM8K的测试集中提取问题文本、最终数值答案及清洗后的链式推理过程,并通过确定的渲染配置将这些文本转化为高分辨率图像。渲染参数严格受控,图像清晰且不含模糊、压缩或背景噪声等干扰因素,确保视觉输入仅作为文本的忠实呈现。最终,所有样本以规范的CSV元数据文件形式组织,其中包含与图像路径对应的索引、问题、答案及推理字段,形成了完整的评估数据集。
特点
该数据集的核心特质在于其为视觉语言模型提供了独特的数学推理评估基准。每个样本由渲染图像、原始问题文本和最终答案三元组构成,图像中仅包含问题文本而无视觉推理线索,从而隔离了文本语义理解与视觉处理能力的交互影响。数据集规模适中,包含1319个测试样本,支持与纯文本模型的直接对比实验。此外,元数据文件中保留了清洗后的链式推理过程,便于研究人员进行可解释性分析,而评估协议则严格限定于最终答案的精确匹配,确保了评测的客观性。
使用方法
使用该数据集时,推荐采用其规范的CSV元数据文件'gs8k_metadata_clean.csv'作为数据入口。用户可通过Pandas等库读取该文件,获取问题文本、答案及对应图像路径。在评估流程中,模型需基于输入的渲染图像预测最终数值答案,并通过精确匹配计算准确率。官方示例代码提供了快速验证图像是否存在的方法,确保了数据完整性。为提高可复现性,建议将渲染图像目录、元数据文件及渲染配置文件一同打包发布,并引用GSM8K原始研究与本数据集的工作。
背景与挑战
背景概述
GSM8K-Rendered-VLM(亦称GSM8K-VL)是由Ghosh与Gupta于2025年构建的多模态数学推理数据集,旨在评估视觉-语言模型在文本渲染图像上的推理能力。该数据集源自OpenAI于2021年发布的GSM8K数学应用题基准,通过将原始文本题目渲染为672像素宽、无噪声的干净图像,生成了1319个测试样本。核心研究问题在于探索视觉输入对数学推理性能的影响,从而为多模态语言模型在算术推理任务中的有效性提供可控实验基础。作为连接经典文本推理与视觉语言理解的桥梁,该数据集在评估模型跨模态泛化能力方面具有重要价值,尤其为比较纯文本与图像化推理行为提供了标准化基准,推动了对多模态推理机制的理解。
当前挑战
该数据集所解决的领域挑战是数学推理在多模态场景下的评估问题:传统GSM8K仅支持文本输入,无法衡量视觉语言模型对数学题干图像的理解能力;而当问题以渲染图像呈现时,模型需克服文本识别、布局解析与逻辑推理的耦合难题。构建过程中面临的挑战包括:确保渲染图像不含额外视觉线索(如公式排版、符号风格差异),从而避免模型依赖非语义特征;在保留GSM8K原始推理链的基础上,清洗格式伪影(如移除<<...>>标记),以保持推理内容的纯净性,同时避免引入无谓的视觉噪声或干扰因素,最终实现图像化输入与文本基准的严格对齐。
常用场景
经典使用场景
GSM8K-Rendered-VLM数据集,作为多模态数学推理领域的基准测试资源,其经典使用场景聚焦于评估视觉-语言模型(VLM)在文本渲染图像上的数学推理能力。通过将GSM8K的数学文字问题渲染为纯数字化图像(无视觉噪声),研究者得以在受控条件下对比模型在纯文本输入与图像输入下的推理表现。该数据集特别适合于探究多模态模型是否真正具备从视觉呈现的数学问题中提取、理解并推导数值答案的能力,从而揭示跨模态表示的推理瓶颈与对齐机制。
解决学术问题
在学术研究中,该数据集有效解决了多模态数学推理的可控评估难题。传统上,GSM8K仅支持文本模态的推理测试,而Rendered GSM8K-VL通过引入文本渲染图像,使得研究者能够分离视觉编码与数学推理的交互影响。它帮助学术界解答了核心问题:当前视觉-语言模型是否能够准确处理仅含文本信息的图像形式数学问题,而非依赖额外的视觉语义线索。这一设计推进了对多模态模型泛化边界、文本渲染鲁棒性及跨模态理解深度的系统性理解,为后续更复杂的多模态推理任务奠定了方法论基础。
衍生相关工作
该数据集的发布催生了一系列重要衍生工作。基准性研究包括基于GSM8K-VL构建的多模态数学推理排行榜,推动了VLM在数学任务上的标准化评测。相关经典工作涉及探索不同渲染参数(如字体、布局)对模型性能的影响分析,以及对比链式思维推理在文本与图像两种模态下的鲁棒性差异。此外,该数据集还被用于微调如LLaVA、BLIP-2等主流视觉-语言模型,以提升其数学文本高保真渲染场景下的推理能力,并启发了后续诸如MathVista等更综合的多模态数学基准的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务