M-LongDoc
收藏资源简介:
M-LongDoc是一个具有挑战性的基准测试,旨在评估大型多模态模型在超长文档理解方面的能力,特别是针对包含交错文本、图表和表格的现实世界文档。与现有主要关注短文档或抽取式问答的文档理解基准不同,M-LongDoc包含851个样本,文档平均超过200页,要求模型生成开放式的深入答案,而不是简单地提取短片段。该基准涵盖多样化的现实世界领域,包括学术论文、财务报告和产品手册,并评估模型是否能够在长多模态文档中对不同证据类型(如文本、图表和表格)进行推理。
M-LongDoc is a challenging benchmark designed to evaluate the capabilities of large multimodal models in ultra-long document understanding, particularly for real-world documents that contain interleaved text, figures, and tables. Unlike existing document understanding benchmarks that primarily focus on short documents or extractive question answering, M-LongDoc consists of 851 samples, with each document averaging over 200 pages, and requires models to generate open-ended in-depth answers rather than simply extracting short segments. This benchmark covers diverse real-world domains including academic papers, financial reports, and product manuals, and evaluates whether models can perform reasoning across different evidence types (e.g., text, figures, and tables) within long multimodal documents.
数据集概述:M-LongDoc
M-LongDoc 是一个用于评估多模态大模型在超长文档理解任务上表现的基准测试集,并提出了一个检索感知的调优框架。该论文已被 EMNLP 2025 接收。
核心特点
- 任务定位:专注于超长、真实世界的多模态文档理解,文档平均超过 200 页,包含交错排列的文本、图表和表格。
- 问题类型:包含 851 个经过验证的测试样本,要求模型生成开放式、深度的答案,而非简单的文本片段提取。
- 领域覆盖:涵盖学术论文、财务报告和产品手册三个真实世界的领域。
- 评估维度:评估模型在不同证据类型(文本、图形、表格)上的推理能力。
数据集统计
- 平均文档长度:210.8 页/每文档,平均包含约 120,988 个文本 tokens。
- 平均元素数量:每文档平均包含 161.1 个图形对象和 71.8 个表格对象。
- 评估可靠性:自动化评估框架与人类评判的皮尔逊相关系数高达 88.9%。
数据集结构
- 数据划分:
- 测试集(已验证):851 个问题,来源为 180 份文档(学术 60、金融 60、产品 60)。
- 训练集:10,070 个问答对,来源为 300 份文档。
- 数据格式:
- 文档:以 JSONL 格式存储,每行代表一页(
MultimodalPage),包含提取的文本、基 64 编码的页面图像,以及通过 YOLO 检测到的表格/图形子图像。 - 问题:以 JSONL 格式存储(
MultimodalSample),包含问题文本、证据页码、类别(texts,figures or diagrams or charts,tables)和来源文档路径。
- 文档:以 JSONL 格式存储,每行代表一页(
- 标注文件:包含 851 个人类验证过的问题列表,以及多个质量检查表格。
关键结果
- 检索效果对比(MRR):ColPali 方法在所有类别上表现出最优的检索性能,整体 MRR 达到 67.4%。
- 问答正确率(1-5分制):
- 在 851 个测试问题上,闭源模型如 GPT-4o、Claude 3.5 Sonnet 和 Gemini 1.5 Pro 表现最佳,整体得分分别为 4.49、4.51 和 4.51。
- 开源模型中,Pixtral-12B 表现最好,整体得分为 4.22。
- 经微调的 Qwen2-VL-7B 模型在文本、图形、表格上的得分分别为 4.31、4.00 和 3.77,整体得分为 4.02。





