遇见数据集

M3GIA

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是一个基于认知驱动的多语言和多模态基准,旨在评估大规模多语言模型(MLLMs)的一般智力能力,其理论基础是卡特尔-霍恩-卡罗尔(Cattell-Horn-Carroll)的智力模型。该数据集揭示了MLLMs与人类智力在各个认知领域之间的性能差异,并为理解MLLMs的认知结构提供了洞见。该数据集涉及480名参与者,他们回答了1,800个问题,这些问题被分为六个子问卷,按语言分类。任务旨在通过认知评估,对多语言和多模态大型语言模型(MLLMs)的一般智力能力进行评价。

This dataset is a cognition-driven multilingual and multimodal benchmark developed to assess the general intelligence capabilities of large multilingual models (MLLMs), with its theoretical foundation rooted in the Cattell-Horn-Carroll (CHC) model of intelligence. This benchmark reveals the performance gaps between MLLMs and human intelligence across diverse cognitive domains, and provides critical insights into deciphering the cognitive architecture of MLLMs. It encompasses 480 participants who responded to 1,800 questions, which are grouped into six language-categorized sub-questionnaires. The tasks herein aim to evaluate the general intelligence capabilities of multilingual and multimodal large language models (MLLMs) via standardized cognitive assessments.

搜集汇总
数据集介绍
构建方式
M3GIA的构建根植于经典的Cattell-Horn-Carroll(CHC)智力理论,旨在从认知科学视角评估多模态大语言模型(MLLMs)的通用智能。研究团队基于CHC模型,识别出流体推理(Gf)、理解-知识(Gc)、视觉加工(Gv)、读写能力(Grw)和数量知识(Gq)五个核心认知因子,并据此设计了五类宽泛问题簇,每类进一步细分为2至4种窄化题型,共计18个子任务。数据集包含1,800道多项选择题,其中1,200道为视觉问答形式,超过半数题目从零开始精心设计,其余源自互联网。为确保多语言覆盖,题目涵盖英语、中文、法语、西班牙语、葡萄牙语和韩语六种语言,且所有与文化背景相关的数据均从母语资源采集,避免英语中心偏见。
特点
M3GIA的独特之处在于其认知驱动的理论框架与多模态多语言设计的深度融合。不同于传统任务导向的基准,该数据集以CHC模型为基石,系统解构MLLMs的认知结构,而非仅关注表面任务表现。其五因子模型与斯坦福-比奈智力测验(SB5)高度契合,确保了评估的心理学效度。数据集不仅涵盖抽象认知测试,还融入真实世界问题,如商标识别、空间推理和漫画理解,从而全面衡量模型在非受控环境中的能力迁移。此外,通过收集480名人类参与者的数据,M3GIA揭示了MLLMs在英语中接近人类智能下限,但在其他语言中表现显著不足,并发现了与人类认知一致的“赢家通吃”现象。
使用方法
M3GIA采用零样本评估范式,无需模型在数据集上进行微调或少样本学习。用户需将多模态输入(图像与文本)与多项选择题结合,通过提示工程优化模型响应。评估指标包括各认知因子的准确率以及基于验证性因子分析(CFA)计算的通用智能准确率(GIA),后者可量化模型与人类认知结构的相似性。数据集按语言划分为六个子问卷,每个子问卷包含300道题目,便于跨语言比较。研究者可参照论文中的标准化流程,使用NVIDIA A800 GPU等硬件运行评估,并通过与人类基线(每语言80名参与者)对比,深入分析模型在流体智力与晶体智力上的差异。
背景与挑战
背景概述
随着多模态大语言模型在复杂任务中展现出卓越能力,如何科学评估其是否趋近人类智能成为研究焦点。现有基准多聚焦于任务层面的准确性评估,缺乏对模型底层认知能力的系统性度量。2024年,由西湖大学、阿里巴巴集团及中国科学院等机构联合提出的M3GIA基准应运而生,旨在填补这一空白。该基准基于国际公认的卡特尔-霍恩-卡罗尔(CHC)智力模型,首次将认知科学框架引入多模态模型评估,从流体推理、理解-知识、视觉加工、读写能力及数量知识五个核心认知维度构建评测体系。M3GIA涵盖英、中、法、西、葡、韩六种语言,包含1800道精心设计的选择题,其中过半题目为原创,且多语言数据均取自本土文化背景以避免英语中心偏差。该基准通过对24个前沿模型及480名人类参与者的对比实验,揭示了当前最先进模型仅在英语上触及人类智能下限,为多模态模型认知能力的跨语言评估开辟了新路径。
当前挑战
M3GIA面临的挑战主要体现在两个层面。在领域问题层面,现有基准如MMBench、MME等虽涵盖多任务能力,但维度选择缺乏理论支撑,容易沦为训练目标而非洞察工具。M3GIA需解决的核心挑战是:如何突破任务导向的评估范式,从认知科学视角构建可解释、有理论根基的通用智能度量体系。在构建过程中,挑战更为具体:首先,需从CHC模型的16种广泛认知能力中筛选出适用于当前多模态模型的五大因子,并设计与之对应的18种细分题型,确保每个认知维度能被多角度充分评估。其次,多语言评测要求各语言版本在题目数量、结构及分布上保持一致,同时避免简单翻译带来的文化偏差,需从各语言本土资源中采集文化背景数据。此外,1.2万道视觉问答题目中,630道需人工标注,1170道需从互联网收集并验证,确保答案的准确性与文化适应性。最终,还需通过验证性因子分析构建跨语言的人类认知基线,使模型间的比较具有统计学意义。
常用场景
经典使用场景
在认知科学与人工智能的交叉领域,M3GIA作为首个基于Cattell-Horn-Carroll(CHC)智力理论构建的多语言多模态通用智能能力基准,其经典使用场景在于系统性地评估多模态大语言模型(MLLMs)的认知架构。该基准通过精心设计的1,800道涵盖流体推理、理解性知识、视觉处理、读写能力和定量知识五大认知因子的题目,以多选题形式考察模型在常识、视觉空间、理解、数学和推理五个维度的表现,从而揭示模型在类似人类智力结构中的优势与短板。
实际应用
在实际应用中,M3GIA为多语言多模态模型的开发与优化提供了认知导向的评估工具。企业和研究机构可利用该基准检测模型在不同语言环境下的认知一致性,识别模型在视觉推理、数学思维等关键能力上的不足,从而有针对性地改进训练数据、模型架构或多语言对齐策略。此外,该基准还可用于筛选具备更强通用智能能力的模型,服务于需要跨文化、多语言交互的智能系统,如全球化客服、教育辅助和内容生成平台。
衍生相关工作
M3GIA的提出催生了一系列以认知科学为导向的模型评估与改进工作。其五因子认知模型启发了后续研究者在MLLMs中引入更完整的CHC理论框架,如探索听觉处理和工作记忆等因子的评估。基于该基准发现的“赢家通吃”现象,相关研究开始聚焦于模型通用智能因子的涌现机制,并尝试通过合成推理数据增强流体推理能力。此外,多语言评估的设计范式也被借鉴到其他跨文化认知基准的构建中,推动了非英语中心主义的评估方法论发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务