MM-BRIGHT
收藏资源简介:
MM-BRIGHT是第一个用于推理密集型检索的多模态基准测试,包含2,803个查询和超过250万个文档,涵盖29个不同的技术领域。它评估了四种多模态复杂性递增的检索任务,包括文本到文本检索、多模态查询到文本文档、多模态查询到相关图像以及多模态查询到多模态文档。
MM-BRIGHT is the first multimodal benchmark for dense retrieval reasoning. It encompasses 2,803 queries and over 2.5 million documents, spanning 29 distinct technical domains. It evaluates four retrieval tasks with increasing multimodal complexity, including text-to-text retrieval, multimodal query to text documents, multimodal query to relevant images, and multimodal query to multimodal documents.
MM-BRIGHT 数据集概述
数据集基本信息
- 数据集名称:MM-BRIGHT (Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval)
- 核心定位:首个用于推理密集型检索的多模态基准测试。
- 核心问题:针对包含图像(如图表、示意图、截图)的真实世界查询,这些查询需要密集推理才能找到相关文档。
- 数据来源:真实世界的 Stack Exchange 问答数据。
- 许可证:CC-BY-4.0。
数据集规模与构成
- 总查询数:2,803。
- 总文档数:超过 250 万。
- 涵盖领域:29 个不同的技术领域。
- 图像类型:照片、图表、示意图、截图、科学图表。
检索任务
数据集包含四个多模态复杂性递增的检索任务:
| 任务 | 查询模态 | 目标模态 | 描述 |
|---|---|---|---|
| 任务 1 | 文本 | 文本 | 文本到文本检索(基线) |
| 任务 2 | 文本 + 图像 | 文本 | 多模态查询 → 文本文档 |
| 任务 3 | 文本 + 图像 | 图像 | 多模态查询 → 相关图像 |
| 任务 4 | 文本 + 图像 | 文本 + 图像 | 多模态查询 → 多模态文档 |
领域分类与统计
数据集涵盖 29 个领域,分为四类:
STEM 与生命科学 (9个领域)
| 领域 | 查询数 | 文档数 | 平均图像数/查询 |
|---|---|---|---|
| Academia | 26 | 60,050 | 1.77 |
| Bioacoustics | 41 | 29,812 | 2.17 |
| Bioinformatics | 90 | 45,545 | 1.62 |
| Biology | 99 | 89,435 | 2.96 |
| Chemistry | 65 | 36,043 | 2.54 |
| Earth Science | 85 | 73,451 | 2.15 |
| Math | 45 | 151,867 | 2.64 |
| Medical Sciences | 55 | 240,844 | 1.85 |
| Physics | 100 | 338,291 | 2.45 |
软件与技术系统 (8个领域)
| 领域 | 查询数 | 文档数 | 平均图像数/查询 |
|---|---|---|---|
| Apple | 14 | 29,285 | 2.14 |
| Ask Ubuntu | 35 | 90,198 | 2.09 |
| Bitcoin | 64 | 29,595 | 1.48 |
| Crypto | 74 | 24,054 | 1.50 |
| GIS | 44 | 20,705 | 2.98 |
| Quantum Computing | 88 | 127,009 | 1.84 |
| Robotics | 30 | 11,185 | 2.33 |
| Salesforce | 10 | 8,890 | 2.50 |
社会科学与人文科学 (6个领域)
| 领域 | 查询数 | 文档数 | 平均图像数/查询 |
|---|---|---|---|
| Christianity | 30 | 37,875 | 1.47 |
| Economics | 31 | 18,431 | 1.84 |
| Islam | 27 | 14,079 | 1.33 |
| Law | 30 | 26,142 | 1.23 |
| Philosophy | 50 | 137,860 | 1.58 |
| Psychology | 87 | 328,520 | 1.67 |
应用领域 (6个领域)
| 领域 | 查询数 | 文档数 | 平均图像数/查询 |
|---|---|---|---|
| Aviation | 125 | 203,938 | 2.41 |
| Gaming | 26 | 68,321 | 1.85 |
| PM | 50 | 93,376 | 1.56 |
| Quant | 34 | 64,044 | 1.38 |
| Sustainability | 62 | 32,365 | 1.61 |
| Travel | 68 | 68,063 | 1.84 |
性能基准
任务 1:文本到文本检索 (nDCG@10)
表现最佳的模型是 DiVeR,平均 nDCG@10 为 32.2。BM25 基线为 8.5。
任务 2:多模态到文本检索 (nDCG@10)
表现最佳的模型是 Nomic,平均 nDCG@10 为 27.6。
关键发现:即使是最先进的多模态模型在 MM-BRIGHT 上也表现不佳。最佳多模态模型 (Nomic-Vision: 27.6) 的表现低于最佳纯文本模型 (DiVeR: 32.2)。
数据获取与使用
- 托管平台:Hugging Face Datasets (https://huggingface.co/datasets/mm-bright/MM-BRIGHT)。
- 加载方式:使用
datasets库的load_dataset函数。 - 可用数据分割:
documents:加载文档。examples:加载查询(用于任务 1/2)。examples_multimodal:加载多模态查询(用于任务 3/4)。
- 加载示例:可按特定领域(如
"academia")加载数据。
评估代码
项目提供完整的评估代码,用于运行四个任务及批量实验。主要脚本包括 run_task1.py、run_task2.py、run_task3.py、run_task4.py 和批量实验运行器 run_experiments.py。
与现有基准对比
| 基准测试 | 查询数 | 领域数 | 模态 | 推理 | 多任务 |
|---|---|---|---|---|---|
| BRIGHT | 1,384 | 12 | 文本 | ✅ | ✅ |
| RAR-b | 45,745 | 17 | 文本 | ✅ | ❌ |
| WebQA | 7,540 | 开放域 | 图像→文本 | ❌ | ❌ |
| UNIIR | 190K | 10 | 混合 | ❌ | ✅ |
| ViDoRe | 3,810 | 10 | 文本→图像 | ❌ | ❌ |
| MMEB | 36K | 36 | 混合 | ❌ | ✅ |
| MM-BRIGHT | 2,803 | 29 | 混合 | ✅ | ✅ |
致谢
MM-BRIGHT 基于 BRIGHT 基准测试构建,并将其扩展到多模态领域。




