遇见数据集

GAMUT

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

GAMUT(Grounded Assessment of Multimodal Factuality)是一个多模态的日常深度研究基准,也是一个用于评估开放式、长文本生成的两级元量规框架。该数据集旨在解决基于量规的评价中的一个核心矛盾:评估开放式生成需要结构化的标准(因为完整答案通常不能分解为独立且必需的事实,例如答案可能来自开放的有效选项池,或者描述顺序重要的过程),但大语言模型评委在评分扁平、二元的检查项时更为可靠且方差更低。GAMUT通过两级量规解决了这个问题:首先,一个结构化的元量规用于制定评分标准(即完整答案所需的内容),然后该元量规被机械地编译成扁平化的二元检查项,供评委逐一评分。数据集包含1,813个基于真实可穿戴设备图像的问题,涵盖10个不同的领域。这些问题复杂且贴近现实世界,需要进行多步骤的信息收集和多段落的答案综合。问题和量规通过多轮人类与大语言模型协作的标注过程构建,每个量规都有引用的网络证据支持,并经过专家标注者的验证。该基准具有挑战性和区分性,评估的14个专有和开源模型中,最佳模型(Gemini 3.1 Pro)的得分仅为58.7%,表明基准远未饱和,且不同模型间得分差距显著,排名对不同评委模型的选择具有鲁棒性。数据集字段包括:`session_id`(唯一标识符,也是连接CRAG-MM数据集中图像的键)、`question`(关于图像的问题)和`rubrics`(包含答案关键/有价值/上下文信息及来源片段的两级元量规结构)。数据集提供两个测试分割:主多模态基准的`test`集(1,813个示例,每个问题基于一张图像)和用于评估无图像输入模型的纯文本变体`test_text_only`集(1,806个示例,字段相同)。请注意,图像本身不包含在此数据集中,需要通过`session_id`从CRAG-MM数据集中获取。该数据集采用CC-BY-NC-4.0许可证,主要用于基准测试。

GAMUT (Grounded Assessment of Multimodal Factuality) is a multimodal, daily-depth research benchmark and a two-level meta-rubric framework for evaluating open-ended, long-form generation. The dataset aims to address a core tension in rubric-based evaluation: assessing open-ended generation requires structured criteria (as complete answers often cannot be broken into independent, necessary facts, e.g., answers may come from an open pool of valid options or describe processes where order matters), but large language model judges are more reliable and lower-variance when scoring flat, binary checklist items. GAMUT resolves this via a two-level rubric: first, a structured meta-rubric for defining scoring criteria (i.e., what content is needed for a complete answer), which is then mechanically compiled into flattened binary checklist items for judges to score individually. The dataset contains 1,813 questions based on real wearable device images, covering 10 distinct domains. These questions are complex and grounded in the real world, requiring multi-step information gathering and multi-paragraph answer synthesis. Questions and rubrics are constructed through a multi-round human-LLM collaborative annotation process, with each rubric supported by cited web evidence and validated by expert annotators. The benchmark is challenging and discriminative, with the best-performing model (Gemini 3.1 Pro) scoring only 58.7% among 14 evaluated proprietary and open-source models, indicating that the benchmark is far from saturated, and score gaps between models are significant, with rankings robust to the choice of judge model. Dataset fields include: `session_id` (a unique identifier, also a key to link images from the CRAG-MM dataset), `question` (a question about the image), and `rubrics` (a two-level meta-rubric structure containing key/valuable/contextual information for the answer and source snippets). The dataset provides two test splits: the `test` set for the main multimodal benchmark (1,813 examples, each question based on one image) and a text-only variant `test_text_only` for evaluating models without image input (1,806 examples, same fields). Note that the images themselves are not included in this dataset and must be obtained via `session_id` from the CRAG-MM dataset. The dataset is licensed under CC-BY-NC-4.0 and is primarily intended for benchmarking.

提供机构:
AI at Meta
创建时间:
2026-07-21
原始信息汇总

数据集概述

GAMUT(Grounded Assessment of Multimodal Factuality) 是一个多模态日常深度研究基准,旨在评估开放式的长文本生成任务。该数据集由Meta(Facebook)发布,采用 CC-BY-NC 4.0 许可证。

核心特征

  • 双重元评分框架:解决基于评分的评估中的结构性与评分可靠性之间的张力。
    • 结构化的元评分:描述完整答案所需的标准。
    • 扁平的二元检查:将元评分机械编译成一系列独立的二元检查项,使评估更稳定、方差更低。
  • 日常深度研究基准
    • 1,813 个基于图像的问答示例,覆盖 10 个不同领域。
    • 问题复杂,需多步信息收集和多段落答案合成。
    • 经过多轮人工与LLM协同标注,每项评分均有引用的网络证据支持,并由专家验证。

任务与语言

  • 任务类别:视觉问答(visual-question-answering)、问答(question-answering)
  • 语言:英语(en)

数据集规模

  • 规模:1K < n < 10K

数据集字段

字段 类型 描述
session_id 字符串 唯一ID,也是关联CRAG-MM中图像的键
question 字符串 关于图像的问题
rubrics 结构体 双重元评分(包括“答案关键”、“有价值”、“上下文”),附带来源片段

数据分割

  • test(1,813 个示例):主要的多模态基准,每个问题与一张图像关联。
  • test_text_only(1,806 个示例):纯文本变体,用于评估无图像输入的模型,字段相同。

图像来源

  • 图像不包含在本数据集中,通过 session_id 引用 CRAG-MM 数据集。
  • 图像下载脚本及评估工具链位于配套的 GitHub 仓库:https://github.com/facebookresearch/GAMUT

许可证

  • 数据集采用 CC-BY-NC 4.0 许可证,仅用于基准测试目的。
  • 第三方内容受其自身许可证约束。

参考文献

bibtex @misc{chen2026gamut, title={Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: {GAMUT}, a Benchmark for Factual Completeness}, author={Xilun Chen and Zhaleh Feizollahi and Ross Goodwin and Seungwhan Moon and Scott Yih and Pinar Donmez and Babak Damavandi and Luna Dong}, year={2026}, eprint={2607.19322}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2607.19322}, }

搜集汇总
数据集介绍
GAMUT 数据集图片
构建方式
GAMUT数据集构建过程中巧妙融合了人工标注与大语言模型的协同力量,所有1,813个测试样本均来源于真实可穿戴设备所捕捉的日常影像。每一道图文问答都历经多轮人机协作式注解流程:先由标注员与LLM共同设计问题的双层元评估准则,再为其搜集并核对来自互联网的引用证据,最后由领域专家逐条审验准则与证据的准确性,确保每一份评估标准均有据可查、清晰可溯。
特点
该数据集的核心创新在于其提出的双层元评估框架,巧妙化解了开放生成任务中结构化评估与二元评分之间长期存在的张力。上层结构化的元评估准则描述了完备回答所应具备的复杂要素(如开放性备选池或有序流程),下层则通过机械编译将这些结构化准则转化为一系列彼此独立的二元检查项,从而在保留评估描述力度的同时,充分发挥了大语言模型裁判在扁平化评分上的高度一致性与低方差优势。
使用方法
使用者可通过HuggingFace的datasets库直接加载GAMUT的多模态版本(split='test')或纯文本版本(split='test_text_only'),每一条记录包含问题、对应图像会话标识符及一套完整的双层元评估准则。由于图像文件存储于CRAG-MM数据集中,用户需运行官方配套仓库提供的下载脚本将其还原。评估时,模型生成的回答将逐条对照编译后的二元检查项,由LLM裁判逐一评判,最终获得可横向比较的事实完备性得分。
背景与挑战
背景概述
随着多模态大语言模型的迅猛发展,如何对开放式的长文本生成进行忠实且全面的评估已成为一项核心挑战。传统评估方法多依赖单一指标或简化的正确性判断,难以捕捉真实世界中复杂问题所需的组合式知识与过程性推理。为此,Facebook AI研究团队于2026年提出了GAMUT(Grounded Assessment of Multimodal Factuality)数据集,由Xilun Chen、Zhaleh Feizollahi等研究人员主导开发,旨在构建一个面向日常深度研究的评估基准。该数据集包含1,813个基于可穿戴设备真实拍摄图像的复杂问题,覆盖十个领域,要求模型进行多步骤信息整合和多段落答案合成,并以双层元评分标准框架作为评估依据,显著提升了评估的结构化与可靠性。GAMUT的出现填补了多模态事实性长文生成评估的空白,对推动模型在真实复杂场景下的能力评测具有重要影响力。
当前挑战
GAMUT所解决的领域挑战在于开放式生成长文本的事实完整性评估难以兼顾结构描述的完整性与评分的一致可靠性。传统评分标准在面对开放答案池和有序过程时,往往因依赖独立事实的分解而丢失整体逻辑,而平面化的二元检查虽然评分稳定,却无法刻画复杂答案的结构要求。构建过程中面临的挑战包括:如何从真实可穿戴图像中提炼出既有深度又具有广泛覆盖性的日常研究问题;如何在多轮人机协作标注中确保评分标准有引用的网络证据支撑,并经专家验证;以及如何通过机械编译机制将具有层次结构的元评分标准转化为适用LLM评判的平面二元清单,从而在保持评估质量的同时降低评分方差。这些挑战的克服使得GAMUT成为当前最具区分度的多模态深度研究评估基准。
常用场景
经典使用场景
GAMUT作为多模态、长文本事实性评估的标杆数据集,其经典使用场景聚焦于评估视觉问答与开放生成系统的深度研究能力。通过整合可穿戴设备拍摄的真实世界图像与复杂推理问题,该数据集迫使模型在理解视觉线索的同时进行多步信息检索与跨段落答案合成。使用者借助其独创的双层元准则框架——先以结构化元准则定义完整答案应涵盖的维度(如关键子项、有序步骤、上下文证据),再机械编译为扁平二元检查列表——可精准评判模型输出的事实完备性。这一设计尤其适用于检验大型语言模型与视觉语言模型在应对现实世界开放性问题时的结构化推理与长文本生成水平。
实际应用
实际应用中,GAMUT为深度搜索助手、智能问答系统及多模态内容审核工具的性能验证提供了严苛测试床。例如,在可穿戴设备驱动的日常任务中,模型需基于用户拍摄的图像解答诸如“这道菜的制作关键步骤是什么”或“这个场景中哪些元素违反了安全规范”等开放式问题,并生成包含证据引用的多段落回答。开发者可利用该数据集系统性地诊断模型在各领域(如医疗、法律、生活百科)的多步推理、证据整合与上下文对齐能力。此外,其文本仅变体(test_text_only)支持对纯语言模型的评估,使之可灵活适配不同模态的工程场景。
衍生相关工作
GAMUT的提出催生了若干值得关注的衍生工作。其双层元准则框架启发了新一代鲁棒性评估体系的设计,例如将元准则自动扩展为可微分的梯度信号,以端到端优化生成模型的事实完备性。此外,研究者基于该数据集构建了面向长文本生成的细粒度错误分析体系,推动了解释性评估工具的发展。数据集中可穿戴图像与CRAG-MM的关联也为多模态检索增强生成开辟了新方向——后续工作尝试利用该数据的跨模态对齐特性,训练能动态调用外部知识源的复合系统。伴随社区对其实例级元准则的深入挖掘,领域内开始涌现出自适应准则生成、多法官协同评判等创新方法,进一步扩展了结构化评估的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务