GAMUT
收藏资源简介:
GAMUT(Grounded Assessment of Multimodal Factuality)是一个多模态日常深度研究基准,采用两级元规则框架,用于评估开放式长文本生成。它包含1,813个基于真实可穿戴图像的图像接地问题,涵盖10个不同领域,问题复杂,需要多步骤信息收集和多段落答案合成。数据集通过多轮人类+LLM注释过程构建,每个规则都有引用的网络证据支持并由专家注释者验证。
GAMUT (Grounded Assessment of Multimodal Factuality) is a multimodal benchmark for in-depth daily research that adopts a two-level meta-rule framework to evaluate open-ended long-text generation. It comprises 1,813 image-grounded questions based on real wearable images, spanning 10 distinct domains. These questions are complex, requiring multi-step information gathering and multi-paragraph answer synthesis. The dataset is constructed via a multi-round human-LLM collaborative annotation pipeline, where each rule is supported by cited web-based evidence and validated by expert annotators.
GAMUT 数据集概述
GAMUT(Grounded Assessment of Multimodal Factuality)是一个多模态日常深度研究基准,同时提供两级元评分标准框架,用于评估开放式的长文本生成。
核心特点
两级元评分标准框架
- 解决基于评分标准的评估中结构性与可靠性之间的冲突
- 结构化元评分标准:用于编写评分标准,描述完整答案所需内容(如开放式有效替代项集合、有序流程)
- 扁平化二元检查项:将结构化元评分标准机械编译为扁平二元检查项,供评判模型逐项评分
- 该方法使评判模型(LLM)在评分时具有更高可靠性和更低方差
日常深度研究基准
- 1,813 个基于图像的问题,覆盖 10 个不同领域,基于真实可穿戴设备图像数据
- 问题复杂且贴近真实世界,需要多步信息收集和多段落答案合成
- 问题与评分标准通过多轮人工+LLM 标注流程构建,每条评分标准附带引用网络证据并经专家标注者验证
挑战性与区分度
- 评估了 14 个专有和开源模型,最佳模型(Gemini 3.1 Pro)仅达到 58.7%,基准远未饱和
- 模型得分分布广泛且差距明显,排名对评判模型选择具有鲁棒性(Gemini 和 Claude 评判结果排名一致)
数据集字段
| 字段 | 类型 | 描述 |
|---|---|---|
session_id |
字符串 | 唯一标识,也是关联 CRAG-MM 图像数据的连接键 |
question |
字符串 | 关于图像的问题 |
rubrics |
结构体 | 两级元评分标准(包含关键答案、有价值答案、上下文以及来源片段) |
数据获取与使用
数据集地址
- HuggingFace:
facebook/GAMUT(https://huggingface.co/datasets/facebook/GAMUT)
图像获取
- 图像数据不直接分发,需通过
download_images.py脚本从 CRAG-MM 重建 - 使用时需提供联系信息(URL 或邮箱)以满足 Wikimedia Commons 的用户代理策略
评估工具
- 提供基于评分标准的评估框架(LLM-as-judge),兼容 OpenAI 兼容 API
- 支持对 OpenAI、vLLM、SGLang、TGI、Together 等后端进行模型响应评分
许可协议
- GAMUT 数据集采用 CC-by-NC 许可,仅限基准测试目的
- 第三方内容受其自身许可约束





