遇见数据集

OpenMOSS-Team/GameQA-140K

收藏
Hugging Face2026-03-19 更新2026-02-07 收录
官方服务:

资源简介:

GameQA是一个大规模、多样化和具有挑战性的多模态推理数据集,旨在增强视觉语言模型(VLMs)的通用推理能力。该数据集通过创新的Code2Logic框架生成,利用游戏代码合成高质量的视觉语言链式思维(CoT)数据。数据集解决了多模态推理数据稀缺的问题,这对推进VLMs中的复杂多步推理至关重要。每个样本包括视觉游戏状态、针对性问题、原始分析、增强的逐步推理(`refinement`)和从游戏代码逻辑结构中得出的最终答案。数据集包含约140,000个问答对(126,760个训练样本,15,047个测试样本),涵盖30个独特游戏和158个不同任务,涉及多种认知技能。游戏类别包括3D空间感知与理解、模式识别与匹配、多步推理和战略规划。数据集格式为视觉问答(VQA),包括游戏状态图像、针对性问题、逐步推理和最终答案。问题类型包括多选题(通常7-8个选项)和填空题(如数字、坐标)。数据集对当前最先进的VLMs具有挑战性(测试集准确率<50%)。Code2Logic框架在初始设置后能以最小成本实现大规模生成。难度等级分为图像复杂度(简单、中等、困难)和任务复杂度(简单、中等、困难)。

GameQA is a large-scale, diverse, and challenging multimodal reasoning dataset designed to enhance the general reasoning capabilities of Vision Language Models (VLMs). Generated using the innovative Code2Logic framework, it leverages game code to synthesize high-quality visual-language Chain-of-Thought (CoT) data. The dataset addresses the scarcity of multimodal reasoning data, critical for advancing complex multi-step reasoning in VLMs. Each sample includes visual game state, targeted question, original analysis, augmented step-by-step reasoning (`refinement`) and final answer, derived from the logical structures inherent in game code. The dataset contains ~140,000 question-answer pairs (126,760 training, 15,047 testing), covering 30 unique games and 158 distinct tasks involving various cognitive skills. Game categories include 3D Spatial Perception and Understanding, Pattern Recognition and Matching, Multi-step Reasoning, and Strategic Planning. The format is Visual Question Answering (VQA), including game state image, targeted question, step-by-step reasoning, and final answer. Question types include multiple-choice (typically 7-8 options) and fill-in-the-blank (e.g., numbers, coordinates). The dataset is challenging for SOTA VLMs (<50% accuracy on test set). Code2Logic enables massive-scale generation with minimal cost after initial setup. Difficulty levels are divided into Plot Level (Image Complexity): Easy, Medium, Hard and QA Level (Task Complexity): Easy, Medium, Hard.

提供机构:
OpenMOSS-Team
搜集汇总
数据集介绍
OpenMOSS-Team/GameQA-140K 数据集图片
构建方式
GameQA-140K数据集由北京大学与腾讯微信AI等机构联合构建,基于创新的Code2Logic框架,通过游戏代码自动合成高质量的视觉语言链式推理数据。该框架将游戏逻辑内嵌于代码结构中,自动生成涵盖视觉游戏状态、针对性问题、原始分析与逐步推理过程的问答样本。构建过程覆盖30款独特游戏与158种不同任务,涉及3D空间感知、模式识别、多步推理及策略规划等认知技能,通过模拟游戏场景生成约14万对问答数据,确保数据集的多样性与逻辑一致性。
特点
该数据集具备显著的多模态推理挑战性,当前最先进的视觉语言模型在其测试集上的准确率不足50%。每个样本均包含游戏状态图像、目标问题、逐步推理链与最终答案,支持多选题与填空题两种形式。数据集引入难度分级机制,从图像复杂性与任务复杂性两个维度划分为易、中、难三个级别,有助于系统评估模型的推理能力。此外,Code2Logic框架使得数据生成具备高度可扩展性与低成本优势,为大规模合成高质量多模态推理数据提供了可行路径。
使用方法
该数据集以问答形式组织,适用于视觉语言模型的训练与评估。完整训练集数据存储于games_data.json文件,测试集为games_data_test.json,对应游戏图像分别打包于games_images.zip与games_images_test.zip中。用户可通过HuggingFace平台直接下载,或使用提供的预览文件GameQA-data_studio-preview.parquet快速查看300条样本。数据集支持视觉问答任务,用户可根据需要利用其中的逐步推理链进行链式思维微调,或直接以图像与问题作为输入评估模型的推理性能。
背景与挑战
背景概述
GameQA-140K是由北京大学与微信AI团队于2025年发布的大规模多模态推理数据集,旨在解决视觉语言模型(VLM)在复杂多步推理任务中泛化能力不足的问题。该数据集基于创新的Code2Logic框架,通过游戏代码合成高质量视觉语言链式思维数据,涵盖30种独特游戏与158项不同认知技能任务,涉及三维空间感知、模式识别、多步推理及战略规划等核心能力。其论文发表于ICLR 2026,已被多家顶尖机构如普林斯顿大学、新加坡国立大学及上海AI实验室广泛采用,显著推动了多模态推理领域的发展。
当前挑战
该数据集所解决的领域挑战在于当前VLM在需要多步逻辑推理的视觉问答任务中表现欠佳,例如在测试集上最先进模型准确率不足50%,凸显了通用推理能力的瓶颈。构建过程中面临的挑战包括:如何从游戏代码中自动提取逻辑结构并生成多样化的视觉状态与问题对,确保数据覆盖广泛认知技能;如何设计可扩展的合成管道以低成本产出高质量标注数据,同时维持不同任务难度分级的平衡性;以及如何构建包含多步骤思维链的精细推理路径,避免人工标注的主观性和高成本。
常用场景
经典使用场景
GameQA-140K 是一套专为视觉语言模型(VLM)设计的大规模多模态推理数据集,其经典使用场景聚焦于视觉问答(VQA)任务。该数据集通过创新的 Code2Logic 框架,将游戏代码的逻辑结构转化为包含图像、问题、逐步推理链和最终答案的高质量样本。研究者可利用该数据集训练或评估 VLM 在复杂多步推理任务上的能力,例如在 3D 空间感知、模式识别与匹配、多步逻辑推理以及战略规划等认知领域中进行测试。每个样本均提供图像状态与精细化思维链,使得模型不仅回答正确,还能展现可解释的推理过程,从而推动 VLM 从简单的感知匹配迈向更高阶的逻辑推理。
衍生相关工作
GameQA-140K 已催生多项具有影响力的衍生工作。上海人工智能实验室基于该数据集构建了 MMFineReason 数据集,其中 Puzzle/Game 类样本的 87.65% 来自 GameQA-140K。阿里巴巴与上海交通大学在 DeepVision-103K 数据集中也大规模使用了 GameQA-140K,视觉逻辑问题部分约一半源自该数据集。普林斯顿大学在 Vero 项目、新加坡国立大学在 Gym-V 平台、以及清华大学与字节跳动在 VisWorld-Eval 基准中均引用了该数据集。此外,ICLR 2026 接收的 ReaForest 论文与上海人工智能实验室的 MoTiF 工作均基于 Game-RL 合成代码进行空间规划任务的数据生成,充分证明了该数据集的生态价值与学术辐射力。
数据集最近研究
最新研究方向
GameQA-140K数据集聚焦于多模态视觉语言模型(VLM)的通用推理能力增强,通过创新的Code2Logic框架从游戏代码中合成高质量的可验证视觉-语言链式思维(CoT)数据,以解决多模态推理数据稀缺的瓶颈。该数据集涵盖30种独特游戏、158项认知任务,涉及3D空间感知、模式识别、多步推理与战略规划,显著提升了VLM在复杂逻辑问题上的表现。近期研究热点包括:北京大学与微信AI利用其数据合成代码在ICML 2026发表的ReaForest工作中进行2D/3D迷宫及推箱子空间规划任务;上海AI Lab在MoTiF项目中基于该数据构建超1.5万交错推理样本;普林斯顿大学在Vero项目、新加坡国立大学在Gym-V平台中直接应用该数据集。阿里与上海交大联合的DeepVision-103K数据集中约50%的视觉逻辑问题源自GameQA-140K,而上海AI Lab的MMFineReason数据集中谜题/游戏样本占比高达87.65%。此外,清华大学与字节跳动Seed在VisWorld-Eval中利用其推箱子代码合成训练数据,DeepWisdom与清华大学在其VR-Bench基准中融入类迷宫游戏以评估视频模型推理能力。该数据集对VLM在需要严谨逻辑与多步推导的复杂视觉推理场景中的突破性进展具有重要推动作用,其可扩展低成本生成范式为未来大规模推理数据构建奠定了新基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务