遇见数据集

lightonai/llamaindex-vdr-fine-tuning

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

LlamaIndex VDR Fine-Tuning数据集是一个多语言视觉文档检索数据集,专为使用PyLate进行检索模型微调而设计。它基于llamaindex/vdr-multilingual-train数据集重新格式化,包含德语、英语、西班牙语、法语和意大利语的查询文本、文档元数据以及硬负例。数据集结构分为三个部分:queries表存储查询ID和查询文本;documents表存储文档ID和对应的图像文件名(图像存储在独立的lightonai/llamaindex-vdr-images数据集中);scores表存储每个查询的候选文档ID列表和相关性分数列表,其中第一个文档为正例(分数为1.0),其余为挖掘的硬负例(分数为0.0)。每种语言都有训练和测试分割,训练分割包含硬负例,测试分割仅含正例。硬负例使用voyage-3模型以0.75的相似度阈值挖掘。数据集适用于多模态检索任务,需结合图像数据集使用。

The LlamaIndex VDR Fine-Tuning dataset is a multilingual visual document retrieval dataset designed for retrieval fine-tuning with PyLate. It reformats the llamaindex/vdr-multilingual-train dataset, containing queries in German, English, Spanish, French, and Italian, along with document metadata and hard negatives. The dataset structure consists of three components: the queries table with query IDs and query texts; the documents table with document IDs and corresponding image filenames (images are stored separately in the lightonai/llamaindex-vdr-images dataset); and the scores table with lists of candidate document IDs and relevance scores for each query, where the first document is the positive (score 1.0) and the remaining are mined hard negatives (score 0.0). Each language has train and test splits, with train splits including hard negatives and test splits containing only positives. Hard negatives are mined using voyage-3 with a similarity threshold of 0.75. The dataset is suited for multimodal retrieval tasks and requires integration with the image dataset.

提供机构:
lightonai
搜集汇总
数据集介绍
lightonai/llamaindex-vdr-fine-tuning 数据集图片
构建方式
该数据集是基于llamaindex/vdr-multilingual-train源数据重新格式化而来,专为使用PyLate框架进行检索微调而设计。数据构建过程中,利用voyage-3模型以0.75的固定相似度阈值挖掘难负样本。数据集遵循PyLate微调所需的三表结构,包含queries、documents和scores三个配置:queries表存储查询文本及其整数ID;documents表将文档ID与对应的图像文件名关联;scores表则记录每个查询的候选文档列表及对齐的相关性分数,其中首个文档为正样本,其余为挖掘得到的难负样本,分数以二元相关性标签表示。
使用方法
用户可通过datasets库加载数据集的queries、documents和scores三个配置,并指定相应语言的训练或测试划分。为获取完整的图像数据,需额外加载lightonai/llamaindex-vdr-images数据集,并将documents中的image_filename字段与图像数据集中的对应字段进行连接。当适配PyLate的KDProcessing工具时,需将queries中的query列重命名为text,或提供相应的转换逻辑以兼容多模态输入管道。数据集采用Apache 2.0许可证,所有数据均可在许可范围内自由使用。
背景与挑战
背景概述
视觉文档检索(Visual Document Retrieval, VDR)是信息检索与多模态学习交叉领域的重要研究方向,旨在从包含图像和文本的文档集合中高效定位与用户查询相关的条目。LlamaIndex VDR Fine-Tuning数据集由LightOn AI与LlamaIndex团队于近年联合构建,核心研究问题聚焦于如何利用硬负样本挖掘和多语言数据增强视觉文档检索模型的表征学习能力。该数据集重新格式化了llamaindex/vdr-multilingual-train,适配PyLate和ColBERT等检索微调框架,覆盖德语、英语、西班牙语、法语和意大利语五种语言,包含逾50万份文档和超28万条查询及其对应的相关性评分。其发布为多模态、多语言检索模型的训练与评估提供了标准化基准,推动了视觉与文本跨模态对齐技术的发展,对构建更鲁棒的检索系统具有重要实践意义。
当前挑战
该数据集主要解决的领域挑战是视觉文档检索中的多语言对齐与细粒度相关性判断。传统检索系统常受限于单语言或单一模态,难以有效处理包含图像与文本的复杂文档,且缺乏高质量的跨语言硬负样本。在构建过程中,首要挑战在于从大规模多语言语料中挖掘可靠的硬负样本,源数据集采用voyage-3模型并设定固定的0.75相似度阈值,但此阈值对语言差异和图像内容变化的鲁棒性仍需验证。其次,将图像、文本与相关性评分整合为统一的训练格式时,需解决多源数据的一致性问题,确保不同语言子集的样本均衡性与可比较性。此外,测试集仅包含单一正样本而无负样本,限制了模型在真实场景下区分近似负例能力的评估。
常用场景
经典使用场景
在视觉文档检索与多模态信息处理的交叉领域,LlamaIndex VDR Fine-Tuning数据集为研究者提供了面向多语言场景的细粒度微调资源。该数据集最经典的使用场景在于训练基于PyLate框架的稠密检索模型,通过其精心设计的文档、查询与评分三表结构,结合硬负例挖掘策略,能够高效地优化检索模型在德语、英语、西班牙语、法语和意大利语五种语言上的排序能力。这种配置天然适用于需要跨语言对齐视觉信息与文本查询的应用场景,例如在电商平台的国际化商品目录检索或跨语言知识库问答系统中,利用多模态嵌入提升检索精度与鲁棒性。
解决学术问题
该数据集的核心贡献在于解决了多语言视觉文档检索中标注数据稀缺与负例质量不足的学术难题。通过整合原始数据集中使用voyage-3模型挖掘的硬负例,并明确每个查询的正例与零分负例配对,它为信息检索领域的对比学习范式提供了标准化训练基准。研究者得以系统性地探究多模态特征融合策略(如视觉与文本嵌入的协同优化)、跨语言迁移学习中的域适应问题,以及稠密检索模型在强噪声环境下的抗干扰能力。这些探索推动了视觉文档检索从单语言简单匹配向复杂多语言场景的学术前沿演进。
实际应用
在实际应用中,该数据集支撑着企业级文档管理系统的智能化升级,尤其适用于需要多语言与多模态协同检索的场景。例如,跨国律师事务所可借助基于此数据集微调的模型,在海量扫描合同中快速定位特定条款的视觉段落;国际博物馆的数字化典藏系统则能通过图像与多语言元数据的联合检索,实现跨文化展品的精准发现。此外,在开放域图像问答任务中,该数据集助力构建的检索增强生成流水线,能够有效衔接视觉定位与语言推理,显著提升对发票、票据等结构化文档的解析效率。
数据集最近研究
最新研究方向
当前,视觉文档检索领域正经历从单模态向多模态融合的深刻范式转变。llamaindex-vdr-fine-tuning 数据集的出现,恰逢其时地回应了多语言、多模态检索场景下细粒度对齐的迫切需求。该数据集通过整合德、英、西、法、意五种语言的查询与文档,并利用 voyage-3 模型进行硬负样本挖掘,为训练具备跨语言理解能力的多模态检索器提供了高质量的训练样本。其前沿研究热点聚焦于利用 PyLate 框架与 ColBERT 架构,结合图像与文本的联合特征,在视觉文档检索任务中实现高效的查询-文档匹配。这一工作不仅推动了文档理解领域对视觉与语义信息深度融合的探索,也为构建真正意义上的多语言通用检索系统奠定了坚实的数据基础,对跨境信息检索、多语言知识库构建等实际应用具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务