BabyVision
收藏资源简介:
BabyVision是一个基准测试,揭示了AI视觉的初级阶段。它提供了两个评估轨道:多模态语言模型评估和生成评估,涵盖细粒度区分、视觉跟踪、空间感知和视觉模式识别四个视觉推理类别。
BabyVision is a benchmark that reveals the early stage of AI vision. It offers two evaluation tracks: multimodal language model evaluation and generative evaluation, covering four visual reasoning categories including fine-grained discrimination, visual tracking, spatial perception, and visual pattern recognition.
BabyVision 数据集概述
数据集简介
BabyVision 是一个用于评估多模态大语言模型(MLLM)和图像生成模型在视觉推理任务上性能的基准测试数据集。该基准旨在揭示当前先进人工智能在解决幼儿能轻松完成的视觉任务方面存在的不足。
核心评估内容
数据集提供两个独立的评估轨道:
- MLLM 评估 (
babyvision_eval/): 评估多模态语言模型在视觉推理任务上的表现。 - 生成模型评估 (
babyvision_gen_eval/): 评估图像生成模型在视觉推理任务上的表现。
视觉推理任务类别
两个评估轨道均涵盖以下四个视觉推理类别:
- 细粒度辨别: 寻找不同/相同元素、阴影、图案。
- 视觉追踪: 解决迷宫、连线、地铁图。
- 空间感知: 3D视图、立方体展开、纸张折叠、积木计数。
- 视觉模式识别: 模式补全任务。
数据与文件结构
数据集仓库主要包含以下内容:
- 数据文件 (
data/):babyvision_data.zip: MLLM 评估数据。babyvision_gen_data.zip: 生成模型评估数据。mllm_results.zip: MLLM 评估结果示例。
- 评估包:
babyvision_eval/: 包含 MLLM 评估的主要推理脚本 (evaluate_model.py)、分数计算脚本 (compute_score.py) 及详细文档。babyvision_gen_eval/: 包含生成模型评估的图像生成推理、基于LLM的评估及结果汇总脚本。
评估方法
MLLM 评估
- 输入: 包含图像的视觉推理问题。
- 输出: 模型需以
oxed{答案}格式提供答案。 - 评判: 由LLM评判器将模型输出与标准答案进行比较。
- 指标: 整体准确率、任务类型准确率、子类型准确率。
生成模型评估
- 输入: 带有标注说明的视觉谜题。
- 输出: 标注后的图像(需用圆圈、线条、箭头等标记答案)。
- 评判: 由LLM比较生成图像与标准答案图像。
- 指标: 整体准确率,以及多轮评估的平均值和标准差。
配置与使用
评估通过环境变量进行配置,主要变量包括 MODEL_API_KEY、JUDGE_API_KEY、OPENROUTER_API_KEY、MODEL_NAME 等。具体使用流程详见各评估包内的 README.md 文档。
评分指标
两个轨道均计算以下指标:
- 整体准确率:
正确任务数 / 总任务数。 - 类型准确率: 按任务类别划分的准确率。
- 子类型准确率: 更详细的分类准确率。
- 均值与标准差: 多次评估通过的统计结果。
引用信息
若使用此基准,请引用: bibtex @article{babyvision2026, title={BabyVision: Visual Reasoning Beyond Language}, year={2026} }
许可信息
本项目发布仅供研究使用。




