遇见数据集

lightonai/colpali-train-fine-tuning

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是为使用PyLate进行检索微调而重新格式化vidore/colpali_train_set数据集,包含英语查询、文档元数据和硬负例分配。图像单独存储在lightonai/colpali-train-images数据集中。硬负例的挖掘方法基于Nomic Embed Multimodal:使用密集检索模型为每个查询检索附近的文档页面,然后通过正例感知过滤去除可能错误的负例。数据集采用三表格式:queries(包含query_id和query列,表示查询文本和整数ID)、documents(包含document_id和image_filename列,将文档ID映射到伴生图像数据集)和scores(包含query_id、document_ids和scores列,为每个查询提供候选文档和对齐的相关性分数)。在scores的每一行中,第一个文档是正例,其余文档是挖掘的硬负例,document_ids和scores长度相同且位置匹配。可用分割包括arxiv_qa、tatdqa、docvqa、pdf和infographic_vqa。

This dataset reformats vidore/colpali_train_set for retrieval fine-tuning with PyLate. It contains English queries, document metadata, and hard-negative assignments. Images are stored separately in lightonai/colpali-train-images. Hard negatives were mined following the method described for Nomic Embed Multimodal: a dense retrieval model retrieves nearby document pages for each query, then positive-aware filtering removes likely false negatives. The dataset follows the three-table format used for PyLate fine-tuning: queries (with query_id and query columns for query text keyed by an integer ID), documents (with document_id and image_filename columns mapping document IDs to the companion image dataset), and scores (with query_id, document_ids, and scores columns providing candidate documents and aligned relevance scores for each query). In each scores row, the first document is the positive and the remaining documents are mined hard negatives, with document_ids and scores having the same length and matching positions. Available splits are arxiv_qa, tatdqa, docvqa, pdf, and infographic_vqa.

提供机构:
lightonai
搜集汇总
数据集介绍
lightonai/colpali-train-fine-tuning 数据集图片
构建方式
ColPali Train Fine-Tuning数据集为视觉文档检索任务量身打造,其构建方式基于对vidore/colpali_train_set的精心重构,并通过PyLate框架优化了微调流程。数据以三表结构组织,包括查询(queries)、文档(documents)和分数(scores)三个配置。其中,分数表采用了硬负样本挖掘技术,依据Nomic Embed Multimodal提出的方法,利用密集检索模型为每个查询检索邻近文档页面,再通过正例感知过滤剔除可能的假负例,从而确保负样本的高质量与区分度。数据集涵盖arxiv_qa、tatdqa、docvqa、pdf及infographic_vqa五个子集,文档图像则独立存储于配套的图片数据集中。
特点
该数据集的显著特点在于其专为多模态检索微调而设计,融合了文本查询与文档图像信息。每个分数表中的首条文档均为正例,其余为挖掘得到的硬负样本,且document_ids与scores列表长度相等、位置一一对应,为模型提供了精准的监督信号。数据集由英文查询构成,支持视觉文档检索与特征提取任务,其结构简洁清晰,便于集成到PyLate等训练框架中。此外,多领域子集的划分使其在学术论文、表格问答、文档视觉问答等多样化场景下均具备良好的泛化能力。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载各配置项,例如以'docvqa'为子集分别加载queries、documents和scores。文档图像需通过document_id关联image_filename,再与lightonai/colpali-train-images数据集中的图像文件进行匹配。若适配PyLate的KDProcessing流程,需将查询文本列名由'query'重命名为'text',或设计相应的多模态输入变换。数据源于学术数据集与合成数据的结合,使用前应审查上游数据的许可证条款,确保符合分发与商业用途的相关规定。
背景与挑战
背景概述
ColPali Train Fine-Tuning数据集由LightOn AI团队于2024年创建,旨在为视觉文档检索领域提供高效的微调资源。该数据集基于ColPali模型,该模型通过视觉语言模型实现了文档检索的范式革新,打破了传统文本嵌入方法对复杂文档结构理解的局限。数据集整合了arXiv QA、TAT-DQA、DocVQA等多个学术基准和合成数据,覆盖科学论文、表格、信息图表等多种文档类型,为多模态检索研究提供了标准化训练框架。其提出不仅推动了视觉文档检索技术的发展,还为后续研究如Synthetic DocVQA等提供了重要基础,在工业级文档理解和检索系统中展现了显著潜力。
当前挑战
当前领域面临的核心挑战在于如何有效处理文档中视觉与文本信息的深度融合,以及克服传统检索模型难以捕捉布局、图表等非文本线索的局限。数据集构建过程中,研究人员需应对多源异构文档的标准化难题,包括不同文档格式、质量差异带来的对齐难度,以及从学术基准和合成数据中提取可靠正负样本的复杂性。此外,硬负样本挖掘方案的优化——如采用密集检索模型结合阳性感知过滤来剔除假阴性——对训练效果至关重要。这些挑战共同制约着多模态检索模型在真实场景中的泛化能力与鲁棒性。
常用场景
经典使用场景
在视觉文档检索领域,ColPali微调训练数据集为多模态检索模型的训练提供了坚实的基础设施。该数据集整合了来自arXiv问答、TAT-DQA、DocVQA、PDF文档以及信息图表VQA等多个学术子集的查询与文档图像对,并精心设计了文档标识符与图像文件名之间的映射关系。研究者可以轻松地将查询文本与对应的文档图像配对,从而训练能够同时理解文本与视觉布局的多模态检索模型。数据集的查询配置包含了超过十万条经过精心挑选的英文查询语句,配合文档配置中的图像路径信息,使得基于ColBERT架构的视觉-语言模型能够在多样化的文档类型上完成联合嵌入学习,最终实现对复杂文档页面的高效检索。
解决学术问题
该数据集的核心学术贡献在于解决了多模态文档检索领域中训练数据稀缺且格式不统一的问题。传统文档检索模型往往局限于纯文本处理,难以捕捉表格、图表、多栏布局等视觉元素的语义信息。ColPali数据集通过提供统一的三表格式——查询表、文档表与评分表——并引入基于密集检索模型的硬负样本挖掘策略,有效增强了模型对正负样本的区分能力。在学术研究中,该数据集推动了对视觉语言模型在信息检索场景下属性的深入探索,如针对不同文档类型(科学论文、商业表格、信息图表)的检索鲁棒性评估。它还为跨模态特征对齐的研究提供了标准化基准,促进了多模态嵌入空间构建理论的演进。
衍生相关工作
基于ColPali数据集,学术界与工业界孕育了多项引人瞩目的衍生工作。原生的ColPali模型本身凭借其将视觉语言模型与晚期交互架构相结合的设计,开创了文档检索的新范式,其论文在arXiv上获得广泛引用。在此基础上,研究者进一步发展出ColPali的轻量化变体,通过知识蒸馏和模型剪枝技术使其能够在移动设备上实时运行。另一项重要工作是将其与检索增强生成系统融合,形成了能够处理复杂文档的多模态RAG管道。同时,该数据集的硬负样本挖掘方法被借鉴并扩展到多语言文档检索任务中,衍生出面向日文、中文等不同语种的专用训练资源。还有一些工作探索了将该数据集预训练模型迁移到特定领域,如药物专利文档检索和建筑图纸检索,均取得了显著效果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务