遇见数据集

visual-reasoning-benchmark-results

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

Visual Reasoning Benchmark Suite v3.3 是一个综合性视觉推理基准测试数据集,包含2005个任务,涵盖12个等权重的Track。数据集旨在系统评估模型在多种视觉推理任务上的能力。数据内容包括12类任务:图形补全(394题)、空间生成(56题)、迷宫(分初级、中级、高级,各64题)、数独推理(78题)、数织推理(150题,含45简单/60中等/45困难)、七巧板推理(150题,含45简单/60中等/45困难)、棋盘游戏推理(300题)、火柴棒推理(300题)、正交投影推理(90题)以及数学视觉推理(295题)。其中,数织和七巧板是v3.3版本新增的任务,七巧板题目的生成经过严格流程,确保唯一性和复杂度。数据以文件形式组织,包含题目图、答案图、掩码和几何信息等。评估体系采用12类等权重评分,主排名使用“Macro Overall”分数,同时提供“Micro Overall”作为辅助指标,具体任务有定制评估方法。数据集配套完整代码工具链,支持使用视觉模型进行题目生成、结果评估和性能报告,主要用于评测和比较不同模型在复杂视觉推理任务上的综合性能。

Visual Reasoning Benchmark Suite v3.3 is a comprehensive visual reasoning benchmark dataset containing 2005 tasks spanning 12 equally-weighted tracks. It aims to systematically evaluate the capabilities of models across diverse visual reasoning tasks. The dataset includes 12 categories of tasks: 1. Shape Completion (394 tasks) 2. Spatial Generation (56 tasks) 3. Maze (divided into primary, intermediate and advanced levels, with 64 tasks per level) 4. Sudoku Reasoning (78 tasks) 5. Nonogram Reasoning (150 tasks, including 45 easy, 60 medium and 45 hard instances) 6. Tangram Reasoning (150 tasks, including 45 easy, 60 medium and 45 hard instances) 7. Board Game Reasoning (300 tasks) 8. Matchstick Puzzle Reasoning (300 tasks) 9. Orthographic Projection Reasoning (90 tasks) 10. Mathematical Visual Reasoning (295 tasks) Among them, Nonogram and Tangram are newly added tasks in version v3.3. The generation of Tangram tasks follows a strict workflow to ensure their uniqueness and complexity. The data is organized in file format, containing problem images, answer images, masks, geometric information and other relevant contents. The evaluation system adopts equally-weighted scoring for the 12 categories. The "Macro Overall" score is used for the main ranking, while "Micro Overall" is provided as a supplementary metric, with customized evaluation methods for specific tasks. The dataset is accompanied by a complete code toolchain that supports task generation, result evaluation and performance reporting using visual models. It is primarily designed to evaluate and compare the comprehensive performance of different models on complex visual reasoning tasks.

创建时间:
2026-07-08
原始信息汇总

数据集概述

Visual Reasoning Benchmark Suite v3.3 是一个多任务视觉推理基准测试集,包含 2005 个任务,覆盖 12 个 Track。该版本以用户最新上传的 visual_reasoning_benchmark_suite_v3_修改 为基础,保持原有 3283 个数据文件字节级不变,并新增了 Nonogram(数织)和 Tangram(七巧板)两类任务。

任务与数量

任务名称 数量
figure_completion 394
spatial_generation 56
maze_beginner 64
maze_intermediate 64
maze_advanced 64
sudoku_reasoning 78
nonogram_reasoning 150
tangram_reasoning 150
board_game_reasoning 300
matchstick_reasoning 300
orthographic_reasoning 90
math_visual_reasoning 295
总计 2005

评分规则

  • 正式主排名:Macro Overall,计算公式为 12 个 Track 平均分之和除以 12。每个 Track 权重相同(各占约 8.33%),题量不影响权重。
  • 保留指标:Micro Overall,仅作为诊断参考,不用于正式排名。

目录结构

visual_reasoning_benchmark_suite_v3_3_equal_weight_2005/ ├── datasets/ │ ├── civil_service/ │ ├── maze/ │ ├── sudoku/ │ ├── nonogram/ │ ├── tangram/ │ ├── board_game/ │ ├── matchsticks/ │ ├── orthographic/ │ └── mathematical_proof/ ├── code/ │ ├── benchmark.py │ ├── generate_all.py │ ├── evaluate_all.py │ ├── validate_all.py │ ├── report_all.py │ ├── tools/ │ │ ├── build_nonogram_benchmark.py │ │ └── build_tangram_benchmark.py │ ├── evaluators/ │ │ ├── nonogram.py │ │ └── tangram.py │ └── report/ └── validation_summary.json

安装与使用

  • 环境要求:Python 3.10+。
  • 基本命令
    • 查看全部任务:python benchmark.py list
    • 验证全部任务:python benchmark.py validate --tasks all
    • 生成奖励任务(Nonogram/Tangram):使用 python benchmark.py build-nonogrampython benchmark.py build-tangram,支持自定义随机种子和候选池倍数。
    • 生成模型输出:指定 provider、model、run-name,支持按任务限制数量(--limit-per-task)和并发数(--workers),支持断点续跑。
    • 评估结果:python benchmark.py evaluate,指定 judge-model、passes 和 workers。
    • 生成报告:python benchmark.py report,指定 runs 和 judge-model,输出排行榜、雷达图等。

评估方法

  • Nonogram 评估:优先程序化读取黑白格,不确定时回退 GPT-5.5 网格转录,并由 Python 验证行列约束。主要指标包括 Exact Solve Rate、Cell Accuracy、Row Constraint Accuracy、Column Constraint Accuracy。
  • Tangram 评估:混合评估流程:
    1. 计算机视觉计算目标覆盖率、IoU、越界、下方残留和颜色拼板数量。
    2. 明确的满分/零分样本直接程序判定。
    3. 边界样本回退 GPT-5.5,判断是否使用全部七块、保持形状、无重叠、无越界并完整填满目标。
    4. 非唯一解,其他合法拼法也可满分。

输出文件

报告生成后输出:

  • leaderboard.md
  • leaderboard.csv
  • raw_scores.csv
  • score_audit.json
  • overall_bar.png
  • radar_chart.png
搜集汇总
数据集介绍
visual-reasoning-benchmark-results 数据集图片
构建方式
该数据集基于视觉推理基准套件v3.3版本构建,以用户最新上传的visual_reasoning_benchmark_suite_v3_修改版为唯一基础,确保原有3283个数据文件字节级不变。在此基础上,新增了Nonogram(数织)与Tangram(七巧板)各150题,分别按45 Easy、60 Medium、45 Hard的难度分布生成。Nonogram题目通过随机种子控制生成过程,Tangram则采用随机拼合标准七块、去重、计算复杂度后筛选的流程。最终形成涵盖12个Track、总计2005题的多模态视觉推理数据集。
特点
数据集最显著的特点在于其等权评分机制:12个Track在Macro Overall主排名中各占1/12权重,题量差异不影响类间公平性。任务类型极为多样,涵盖图形补全、空间生成、迷宫、数独、数织、七巧板、棋盘博弈、火柴棍、正投影及数学视觉推理等,全面评估模型的多维视觉推理能力。同时保留Micro Overall作为诊断指标,支持断点续跑、雷达图与排行榜生成,便于深入分析模型在各子任务上的表现。
使用方法
数据集的使用围绕统一命令行工具benchmark.py展开。用户可通过pip安装依赖并配置API Key后,执行list查看全部任务,validate验证数据完整性。生成阶段支持指定模型(如GPT Image 2、Gemini)和任务类型,通过--limit-per-task控制每类题量,--dry-run进行预演。评估时采用混合策略:Nonogram优先程序化校验网格约束,Tangram结合CV与GPT-5.5回退判定。最终通过report命令输出12维雷达图、排行榜及详细评分文件,支持单模型与多模型对比分析。
背景与挑战
背景概述
Visual Reasoning Benchmark Suite v3.3 是由研究机构于2024年构建的一个综合性视觉推理评测数据集,旨在系统评估人工智能模型在多样化视觉推理任务上的表现。该数据集整合了12个轨道(Track),涵盖图形补全、空间生成、迷宫、数独、数织、七巧板、棋盘游戏推理、火柴棒推理、正射推理及数学视觉推理等任务,共计2005道题目,每个轨道以等权方式参与总体评分。该基准的提出填补了现有视觉推理评测中任务单一、维度不足的空白,为多模态大模型在复杂推理能力上的横向对比提供了标准化平台,对推动视觉语言模型在逻辑推理、空间认知与问题解决等核心能力的发展具有重要影响力。
当前挑战
数据集所解决的领域挑战在于视觉推理评测的碎片化与不均衡性,现有基准往往聚焦单一任务类型,难以全面反映模型的综合推理能力,而本数据集通过12个等权轨道确保了评测的广度与公平性。在构建过程中,主要挑战包括:如何设计并生成高质量的数织与七巧板题目,前者需保证行列约束的严密性,后者需确保拼合唯一连通、无孔洞且复杂度可量化;如何实现跨任务的统一生成与评估框架,避免不同任务间的评测指标不一致;以及如何通过程序化验证与AI辅助评估相结合,在保证评估效率的同时,处理非唯一解等边缘情况。
常用场景
经典使用场景
在视觉推理与多模态智能评估的学术疆域中,visual-reasoning-benchmark-results 数据集以其宏大规模与精密设计,成为衡量模型空间认知与逻辑演绎能力的黄金标尺。该数据集涵盖图形补全、迷宫寻径、数独推理、非ogram数织、七巧板拼合、棋盘推演、火柴棍变换、正投影重建及数学可视化推理等12个截然不同的任务轨道,总计2005道题目。研究者们常将其作为多维度能力探测的基准,通过分析模型在各轨道上的表现差异,深入剖析其在空间关系理解、约束满足求解、组合创造及符号推理上的内在机制与瓶颈。其等权重的宏观总分设计,使得每一类推理能力都获得同等重视,为对比不同架构(如纯视觉Transformer与多模态大语言模型)在视觉推理上的综合实力提供了公平而严谨的竞技平台。
实际应用
在实际工业场景中,该数据集所测试的视觉推理能力直接关系到自动化设计辅助、智能教育评测与增强现实交互等领域的落地效能。例如,非ogram与七巧板任务中蕴含的约束求解与形状匹配技术,可迁移至机器人抓取规划中的工件装配验证;迷宫与棋盘任务则可用于游戏AI的实时决策逻辑评估;而数学可视化推理则与计算机辅助教学中的自适应诊断系统紧密相连。通过部署该基准对候选模型进行12维度剖析,开发者能够迅速定位模型在空间组合或序列推理上的短板,从而针对性地优化训练数据配比或架构设计。此外,其模块化的代码管道支持断点续跑与一键生成,降低了工程集成门槛,使得从学术原型到工业级质检系统的技术桥接变得高效而可控。
衍生相关工作
作为视觉推理领域的综合性测试床,该数据集催生了一系列富有启发性的衍生研究与工具链。基于其非ogram与七巧板任务,研究者开发了混合评估框架,融合图像处理与大型语言模型回退策略,率先实现了程序化几何特征(如轮廓凹角、紧致度与方向多样性)与语义评判的协同工作,为后续基准的自动化评估树立了范式。围绕其训练-验证-评估的闭环Pipeline,社区衍生出多种子模型——包括专为约束满足问题设计的神经扩散模型,以及针对拼合任务优化的图神经网络。此外,其雷达图与排行榜机制被广泛借鉴,用于构建跨语言、跨模态的通用能力图景,如近期出现的多任务视觉语言理解基准皆沿袭了其等权聚合与难度分层的设计哲学,使之不仅是一个数据集,更成为推动视觉推理科学量化的方法论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务