遇见数据集

GAMUT

收藏
github2026-07-25 更新2026-07-28 收录
官方服务:

资源简介:

GAMUT(Grounded Assessment of Multimodal Factuality)是一个多模态日常深度研究基准,采用两级元规则框架,用于评估开放式长文本生成。它包含1,813个基于真实可穿戴图像的图像接地问题,涵盖10个不同领域,问题复杂,需要多步骤信息收集和多段落答案合成。数据集通过多轮人类+LLM注释过程构建,每个规则都有引用的网络证据支持并由专家注释者验证。

GAMUT (Grounded Assessment of Multimodal Factuality) is a multimodal benchmark for in-depth daily research that adopts a two-level meta-rule framework to evaluate open-ended long-text generation. It comprises 1,813 image-grounded questions based on real wearable images, spanning 10 distinct domains. These questions are complex, requiring multi-step information gathering and multi-paragraph answer synthesis. The dataset is constructed via a multi-round human-LLM collaborative annotation pipeline, where each rule is supported by cited web-based evidence and validated by expert annotators.

创建时间:
2026-07-16
原始信息汇总

GAMUT 数据集概述

GAMUT(Grounded Assessment of Multimodal Factuality)是一个多模态日常深度研究基准,同时提供两级元评分标准框架,用于评估开放式的长文本生成。

核心特点

两级元评分标准框架

  • 解决基于评分标准的评估中结构性与可靠性之间的冲突
  • 结构化元评分标准:用于编写评分标准,描述完整答案所需内容(如开放式有效替代项集合、有序流程)
  • 扁平化二元检查项:将结构化元评分标准机械编译为扁平二元检查项,供评判模型逐项评分
  • 该方法使评判模型(LLM)在评分时具有更高可靠性和更低方差

日常深度研究基准

  • 1,813 个基于图像的问题,覆盖 10 个不同领域,基于真实可穿戴设备图像数据
  • 问题复杂且贴近真实世界,需要多步信息收集和多段落答案合成
  • 问题与评分标准通过多轮人工+LLM 标注流程构建,每条评分标准附带引用网络证据并经专家标注者验证

挑战性与区分度

  • 评估了 14 个专有和开源模型,最佳模型(Gemini 3.1 Pro)仅达到 58.7%,基准远未饱和
  • 模型得分分布广泛且差距明显,排名对评判模型选择具有鲁棒性(Gemini 和 Claude 评判结果排名一致)

数据集字段

字段 类型 描述
session_id 字符串 唯一标识,也是关联 CRAG-MM 图像数据的连接键
question 字符串 关于图像的问题
rubrics 结构体 两级元评分标准(包含关键答案、有价值答案、上下文以及来源片段)

数据获取与使用

数据集地址

  • HuggingFace:facebook/GAMUT(https://huggingface.co/datasets/facebook/GAMUT)

图像获取

  • 图像数据不直接分发,需通过 download_images.py 脚本从 CRAG-MM 重建
  • 使用时需提供联系信息(URL 或邮箱)以满足 Wikimedia Commons 的用户代理策略

评估工具

  • 提供基于评分标准的评估框架(LLM-as-judge),兼容 OpenAI 兼容 API
  • 支持对 OpenAI、vLLM、SGLang、TGI、Together 等后端进行模型响应评分

许可协议

  • GAMUT 数据集采用 CC-by-NC 许可,仅限基准测试目的
  • 第三方内容受其自身许可约束
搜集汇总
数据集介绍
GAMUT 数据集图片
构建方式
GAMUT数据集的构建基于多轮人机协作的标注流程。研究人员首先从真实可穿戴设备采集的图像中提炼出1,813个复杂问题,覆盖十个不同领域。每个问题均配以结构化元评估准则,该准则由人工专家与大型语言模型协同编写,并附有经过验证的网络来源证据。元评估准则进一步通过机械性编译转化为扁平的二进制检查列表,从而在保留答案所需的结构化描述能力的同时,确保评分过程的一致性与低方差特性。这一设计有效解决了开放生成任务中结构描述与可靠评分之间的固有矛盾。
特点
GAMUT数据集的核心特点在于其独特的双层元评估准则框架与日常深度研究基准的双重属性。该框架通过结构化的元评估准则完整刻画理想答案所需的各个方面,包括关键成分、有序流程与上下文信息,同时利用机械编译出的二进制检查列表实现高效一致的自动化评分。作为基准,它包含大量基于真实可穿戴图像的多步骤、多段落合成问题,对现有模型构成显著挑战——即使最佳模型Gemini 3.1 Pro也仅达到58.7%的准确率,且模型间得分差距显著,排序结果对不同评估器具有鲁棒性。
使用方法
使用GAMUT数据集首先需要从CRAG-MM数据集中重建图像,通过运行download_images.py脚本并指定输出目录与联系人信息,脚本会自动下载并组织图像文件。评估过程则依赖于evaluation/evaluate.py启动的评估框架,该框架支持通过OpenAI兼容API调用任意评判模型(如GPT-4o),对模型生成的回答依据编译后的二进制检查列表进行逐一评分。用户只需提供模型回答的JSONL文件,即可获得定量评估结果,整个流程从图像重建到评分均保持高效与自动化。
背景与挑战
背景概述
GAMUT(Grounded Assessment of Multimodal Factuality)是一个由Facebook研究团队于2026年提出的多模态日常深度研究基准,旨在评估开放生成式任务中长文本输出的事实完整性与质量。该数据集由Xilun Chen、Zhaleh Feizollahi、Ross Goodwin等多位学者合作构建,核心研究问题在于如何对涉及多步骤信息聚合与跨域知识综合的开放生成答案进行结构化、可重复且可靠的评估。基于1,813个源自真实可穿戴设备图像的多模态问题,覆盖十大领域,GAMUT通过双层元评分标准框架,将复杂评分标准转化为平面二元检查列表,从而显著提升了大语言模型评估者的一致性。该基准在14个开源与闭源模型上的评测显示,最佳模型Gemini 3.1 Pro仅达58.7%的准确率,表明其具有区分度与挑战性,已在多模态事实评估领域产生重要影响。
当前挑战
GAMUT所解决的领域核心挑战在于开放生成式评估的结构化与一致性难题。传统评分要求针对开放答案设计详细标准,但答案常包含开放集合中的有效替代项(如配料)或需严格排序的过程(如步骤),而大语言模型评估者更擅长对扁平二元检查项进行低方差打分,两者存在固有张力。构建GAMUT时面临的困难包括:如何从真实世界图像中提炼出需要多步信息检索与段落合成的复杂问题;如何通过多轮人机协作标注流程,为每个问题生成附有引用网络证据、经专家验证的元评分标准;以及如何从CRAG-MM数据集中可靠恢复图像,应对外部图片链接可能失效导致的资源获取不完整问题。
常用场景
经典使用场景
在开放域长文本生成评估领域,GAMUT数据集以其独特的双层元评分框架脱颖而出,为多模态事实性评估提供了系统化解决方案。该数据集包含1813个基于可穿戴设备真实图像的跨领域问题,覆盖从日常生活到专业知识的十个领域。研究者利用其精心设计的结构化元评分(涵盖答案关键性、价值性和上下文维度)与扁平化二进制检查清单的耦合机制,能够对模型生成的开放式长回答进行精确、可重复的评分。这一设计尤其适用于需要综合多步信息收集与多段落答案合成的复杂场景,成为衡量大型语言模型在多模态真实世界问答中表现的标准工具。
衍生相关工作
GAMUT的发布催生了多项具有影响力的衍生研究。其双层评分框架启发了针对评估语言模型可靠性的新范式,推动了一系列关于结构化评分自动化与LLM评判者一致性分析的工作。研究者基于GAMUT的元评分概念,设计了面向对话系统、摘要生成和报告撰写等不同任务的领域特定评分模板库。此外,该数据集对多模态事实性的强调促进了视觉-语言联合推理的基准测试改进,例如将图像级证据检索引入评估流程的扩展版本。GAMUT还作为核心评测套件被集成到多个开源模型对比榜单中,其排行榜结果成为检验新一代多模态语言模型综合能力的参考标准。
数据集最近研究
最新研究方向
在开放生成评估领域,GAMUT基准的提出标志着从传统二元事实性检测迈向结构化的多模态长文本完整性评估的前沿突破。该方法巧妙化解了开放生成任务中结构化描述与扁平化评分之间的矛盾,通过两层级元评分体系,将复杂答案的组成要素机械编译为单一二进制检查项,显著提升了LLM作为评判者的稳定性和判别能力。涵盖1813个图像驱动问题的基准测试显示,即使最先进的模型也仅达到58.7%的正确率,揭示了当前模型在多步推理和跨模态事实整合上的深层局限。该工作不仅为穿戴式设备生成的复杂真实场景问题提供了系统评估框架,更通过可复现的评分过程推动了生成模型在信息完整性与事实一致性方面的研究,对提升多模态智能体的可信度具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务