遇见数据集

Gamut (Grounded Assessment of Multimodal Factuality)

收藏
arXiv2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

Gamut是由Meta AI创建的多模态事实完整性基准数据集,旨在评估开放生成模型在长文本回答中的事实完备性。该数据集包含1,813个基于真实可穿戴设备图像的日常深度研究问题,覆盖10个领域,每个问题均配有经过专家验证的、基于证据的结构化元评分标准。数据来源于CRAG-MM图像集,通过结合前沿大语言模型与人类专家多轮标注构建,确保了问题的真实性和评分的可靠性。该数据集主要应用于评估大模型在知识寻求任务中的事实召回能力,解决现有方法仅关注事实精确性而忽略完整性的局限,为多模态和纯文本生成系统提供了严谨的评估框架。

Gamut is a multimodal factual integrity benchmark dataset developed by Meta AI, which aims to evaluate the factual completeness of open-ended generative models in long-form text responses. This dataset contains 1,813 in-depth daily research questions based on real wearable device images, covering 10 domains, and each question is paired with expert-validated, evidence-based structured meta-rating criteria. Derived from the CRAG-MM image collection, the dataset is constructed by combining state-of-the-art large language models with multi-round human expert annotations, ensuring the authenticity of the questions and the reliability of the scoring standards. It is mainly applied to evaluate the factual recall capability of large models in knowledge-seeking tasks, addressing the limitation that existing methods only focus on factual accuracy while neglecting completeness, and providing a rigorous evaluation framework for multimodal and plain-text generation systems.

提供机构:
Meta AI
创建时间:
2026-07-22
原始信息汇总

GAMUT🌈: 两级元评分规则用于评估开放式生成

GAMUT(Grounded Assessment of Multimodal Factuality)是一个多模态日常深度研究基准,以及一个用于评估开放式长篇生成内容的两级元评分规则框架。

核心框架:两级元评分规则

  • 结构化元评分规则(左侧):用于制定评分标准,描述一个完整答案所需的内容。
  • 扁平化二元检查清单(右侧):将结构化元评分规则机械编译为扁平化的二元检查项,供评判模型逐项评分。
  • 该设计解决了基于评分规则评估中的矛盾:描述完整答案需要结构化,但LLM评判者在处理扁平化、二元检查项时更为可靠且方差更低。

基准数据集

  • 1,813个基于图像的问题,涵盖10个不同领域。
  • 问题均基于真实可穿戴设备拍摄的图像,需要多步骤信息收集和多段落答案合成。
  • 问题和评分规则通过多轮人类+LLM标注流程构建,每条评分规则均有引用的网络证据支持,并由专家标注者验证。

挑战性与区分度

  • 评估了14个专有和开源模型,最佳模型(Gemini 3.1 Pro)仅达到**58.7%**的得分,远未饱和。
  • 模型间得分分布广泛且差距大,排名对不同评判模型(Gemini和Claude评判者得出相同排名)具有鲁棒性。

数据集字段

字段 类型 描述
session_id string 唯一ID,也是与CRAG-MM中图像的连接键
question string 关于图像的问题
rubrics struct 两级元评分规则(答案关键/有价值/上下文,以及来源片段)

工具与使用

  • 下载图像download_images.py脚本可从CRAG-MM重建每个示例的图像。
  • 评估evaluation/目录提供基于评分规则的评估框架(LLM作为评判者,通过OpenAI兼容API),对模型响应进行评分。
  • 图像不在此仓库中重新分发,需运行下载脚本从CRAG-MM获取。

论文与资源

  • 论文: https://arxiv.org/abs/2607.19322
  • 数据集: https://huggingface.co/datasets/facebook/GAMUT

许可证

GAMUT数据集采用CC-by-NC许可证,仅用于基准测试目的。第三方内容受其自身许可证约束。

搜集汇总
数据集介绍
Gamut (Grounded Assessment of Multimodal Factuality) 数据集图片
构建方式
Gamut数据集的构建过程分为两个紧密衔接的阶段:首先,基于CRAG-MM中的真实可穿戴设备图像,通过前沿多模态大模型生成候选问题,再由多位专家进行多轮审核、修订与筛选,确保每个问题都依赖图像且符合自然信息寻求行为,最终生成1,813个涵盖10个领域的高质量日常深度研究问题。随后,针对每个问题,利用大模型结合网络搜索收集证据,构建结构化元评价标准,并机械地将其编译为扁平化的二元检查清单,所有标准均经过专家人工验证,确保可靠性。
特点
Gamut的核心特点在于其创新的双层元评价标准框架,能够超越传统的独立事实检查,精准捕捉开放式生成内容中事实完整性的复杂结构。该框架支持多种知识类型,包括简单知识、严格列表、灵活列表(含覆盖阈值)、有序过程和关系,并区分关键、有价值与背景三个重要性层级。数据集问题高度多样,涵盖植物、食物、车辆等真实场景,平均每个问题包含15.2个二元检查项,其中98%的问题需要至少一种结构化组件,确保了评价的精细度和区分度。
使用方法
使用Gamut时,研究人员向待评估模型提供图像和对应问题,模型生成自由形式的回答。随后,利用大语言模型作为裁判,依据每个问题对应的二元检查清单,对回答进行独立评分。评分机制区分了符合、部分符合、缺失和矛盾四种情况,并对矛盾给予更重的惩罚。最终,通过加权平均各重要性层级得分(关键占60%,有价值占30%,背景占10%)计算Gamut总分。数据集还提供了纯文本变体,可用于隔离视觉感知能力对评估结果的影响。
背景与挑战
背景概述
Gamut(Grounded Assessment of Multimodal Factuality)基准数据集由Meta AI团队于2026年7月发布,主要研究人员包括Xilun Chen、Zhaleh Feizollahi等。该数据集聚焦于长文本生成中事实完整性的评估,弥补了现有事实性评测仅关注精确性而忽略召回率的不足。Gamut开创性地提出了双层元评分标准框架,通过结构化的元评分标准捕获开放集合、有序过程及重要性层级,并将其机械编译为二值检查清单,从而实现可靠自动评分。数据集包含1,813个基于可穿戴设备真实图像的日常深度研究问题,覆盖10个领域,每个问题均配有人工验证的评分标准。Gamut的出现推动了事实性评估从独立布尔检查向结构化、可排序的知识完整性评测跃迁。
当前挑战
Gamut所解决的核心领域问题是长文本生成中事实完整性的量化评估,传统方法将事实性简化为独立布尔事实检查,无法处理开放集合、顺序过程及事实间关系等复杂结构。在构建过程中,数据集面临双重挑战:其一是问题创建需确保图像依赖性与非引导性,要求问题仅凭视觉线索即可提出,避免预设专业知识;其二是评分标准构建需融合前沿大模型的海量提案与人类专家的多轮验证,元评分标准需精确组织所需事实的结构与重要性,并机械转换为二值检查清单以维持评分可靠性。最终评估显示,最强模型Gemini 3.1 Pro的Gamut得分仅为58.7%,揭示了当前模型在事实完整性方面的显著空白。
常用场景
经典使用场景
在长文本生成的事实性评估领域,Gamut 数据集被广泛用于评测模型输出的**事实完备性**,而非仅关注传统的精确率。其经典使用场景聚焦于“日常深度研究”任务,即模拟用户佩戴智能眼镜时,对眼前物体提出的自然、开放性问题。这些问题的解答需依赖多步骤的跨来源检索,并生成多段落的长文本回应。研究者通过该数据集评估模型是否涵盖了一个理想答案应具备的所有关键信息,包括必要的实体识别、有序过程描述、开放式集合的充分覆盖以及事实间的正确关系,从而全面衡量模型在知识生成中的回忆率与结构忠实度。
实际应用
在实际应用中,Gamut 为**智能眼镜与可穿戴助理**系统提供了关键的质量评估基准。例如,用户佩戴增强现实眼镜观看一件物体(如一辆汽车、一种植物或一件菜肴)时,助理需根据视觉输入生成详尽、准确的背景知识解答。Gamut 通过模拟此类真实场景中的多模态查询,使开发者能够系统性地比较不同模型在日常生活场景下(如购物、烹饪、园艺、维修等)的知识检索与综合回应能力。该框架还可用于自动化客服系统、教育辅导工具及专家问答平台的性能验证,确保模型输出的信息不仅正确,更全面覆盖用户所需的内容维度,避免因信息遗漏导致的理解偏差。
衍生相关工作
Gamut 的发布催生了一系列围绕**结构化事实完备性评估**的经典工作。其双层元评分标准框架被后续研究借鉴,用以构建更复杂的评测体系,例如将事件顺序(Zheng et al., 2025)和重要性加权回忆(Wanner et al., 2025)融入传统原子事实列表中。同时,该基准直接启发了 FACTS Multimodal(Cheng et al., 2025)等同类数据集的构建,这些工作在此基础上进一步区分了必须事实与辅助事实的层级。此外,Gamut 所定义的“日常深度研究”任务设定,也被 WiRe (Ruan et al., 2025) 和 MMDeepResearch-Bench (Huang et al., 2026) 采纳并扩展至学术报告级问答,推动了多模态深度研究智能体评测领域的整体发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务