MoonTideF/GridTallyBench
收藏资源简介:
GridTallyBench是一个合成的棋盘图像集合,旨在测试和基准测试多模态大型语言模型(MLLMs)在视觉模式识别和计数任务中的表现。该数据集提供了一个受控环境,用于评估模型在基本视觉任务上的性能,特别适用于评估MLLM计数和描述简单几何图案的能力。数据集包含960张图像,每张图像都附有元数据,如块大小、网格大小、起始颜色和图像数据。
GridTallyBench is a collection of synthetic checkerboard images designed to test and benchmark Multi-modal Large Language Models (MLLMs) on tasks involving visual pattern recognition and counting. This dataset offers a controlled environment for evaluating model performance on basic visual tasks, particularly useful for assessing an MLLMs ability to count and describe simple geometric patterns. The dataset consists of 960 images, each accompanied by metadata including block size, grid size, starting color, and image data.
GridTallyBench 数据集概述
概述
GridTallyBench 是一个合成棋盘图像数据集,旨在测试和基准化多模态大语言模型(MLLMs)在视觉模式识别和计数任务中的表现。该数据集提供了一个受控环境,用于评估模型在基本视觉任务中的性能,特别是评估 MLLM 对简单几何模式进行计数和描述的能力。
数据集详情
- 名称: GridTallyBench
- 版本: 1.0.0
- 任务: 图像分类和对象计数
- 大小: 960 张图像
- 格式: Parquet 文件,包含图像数据和元数据
- 许可证: MIT
内容
数据集包含以下变化的棋盘图像:
- 块大小: 1x1 到 24x24 像素
- 网格大小: 1x1 到 20x20 块
- 起始颜色: 黑色优先和白色优先模式
每张图像都附带以下元数据:
block_pixel: 每个方块的像素大小(1 到 24)grid_size: 每行/列的方块数量(1 到 20)first_block: 左上角方块的颜色(black 或 white)image: PNG 图像的二进制数据
使用场景
该数据集特别适用于:
- 测试 MLLM 在图像中计数对象的能力
- 评估模式识别能力
- 评估简单场景中的颜色区分能力
- 在受控的合成图像上基准化性能
数据集创建
该数据集使用自定义 Python 脚本生成。图像为合成图像,不包含任何现实世界内容或个人信息。
限制
- 数据集仅限于黑色和白色
- 图像为合成图像,可能不代表现实世界的复杂性
- 最大图像尺寸为 480x480 像素(20x20 网格,24x24 像素块)




