MMDocIR-Challenge
收藏资源简介:
MMDocIR数据集是为2025年Web会议中的多模态信息检索挑战(MIRC)设计的,属于多模态文档检索挑战赛道。该数据集包含313个文档的20,395页截图,每页包含OCR文本和视觉语言模型(VLM)生成的文本。数据集的主要文件包括`MMDocIR_gt_remove.jsonl`(包含问题及其相关信息)、`MMDocIR_doc_passages.parquet`(包含文档页面的截图和文本信息)、`page_images.rar`(包含所有文档页面的截图)和`MMDocIR_doc_passages.json`(包含所有相关页面的信息)。数据集用于评估多模态检索模型的性能。
The MMDocIR dataset was developed for the Multimodal Information Retrieval Challenge (MIRC) at TheWebConf 2025, falling under the multimodal document retrieval challenge track. This dataset comprises 20,395 page screenshots spanning 313 documents, where each page includes OCR text and text generated by a vision-language model (VLM). The core files of the dataset include `MMDocIR_gt_remove.jsonl` (containing questions and their associated information), `MMDocIR_doc_passages.parquet` (containing screenshot and text information of document pages), `page_images.rar` (containing screenshots of all document pages) and `MMDocIR_doc_passages.json` (containing information of all relevant pages). This dataset is used to evaluate the performance of multimodal retrieval models.
MMDocIR Challenge
许可
- Apache-2.0
数据集描述
- 用于2025年Web Conference的多模态信息检索挑战(MIRC)下的多模态文档检索挑战轨道。
提交指南
- 根据相关性分数降序返回给定文档内的前10个段落id。如果文档包含少于10页,则返回所有页面。检索范围是每个文档内(平均65.1页),而不是全局段落语料库(总计20395页)。
数据集结构
-
MMDocIR_gt_remove.jsonl- 包含所有问题和相关信息。
- 字段:
question_id(字符串),question(字符串),doc_name(字符串),domain(字符串),num_of_pages(整数),passage_id(列表)。
-
MMDocIR_doc_passages.parquet- 包含313个文档的20395个文档页面截图。
- 字段:
doc_name(字符串),domain(字符串),passage_id(字符串),image_path(字符串),image_binary(JPEG图像二进制),ocr_text(字符串),vlm_text(字符串)。
-
page_images.rar- 包含313个文档的20395个文档页面截图。
-
MMDocIR_doc_passages.json- 包含313个文档的所有相关页面信息。
- 字段:
page(整数),image_path(字符串),ocr_text(字符串),vlm_text(字符串)。
引用信息
@misc{dong2025mmdocirbenchmarkingmultimodalretrieval, title={MMDocIR: Benchmarking Multi-Modal Retrieval for Long Documents}, author={Kuicai Dong and Yujing Chang and Xin Deik Goh and Dexun Li and Ruiming Tang and Yong Liu}, year={2025}, eprint={2501.08828}, archivePrefix={arXiv}, primaryClass={cs.IR}, url={https://arxiv.org/abs/2501.08828}, }




