遇见数据集

antoineedy/vidore_v3_test_hr_mteb_format

收藏
Hugging Face2025-12-19 更新2025-12-20 收录
官方服务:

资源简介:

Vidore3HrRetrieval是一个多语言文档检索数据集,属于MTEB(大规模文本嵌入基准)的一部分。该数据集包含欧盟发布的高分辨率报告,专门设计用于复杂文档理解任务。原始查询为英文,后被翻译成法语、德语、意大利语、葡萄牙语和西班牙语。数据集支持视觉文档检索、图像到文本和文本到图像等多种任务类型,包含语料库(corpus)、查询相关文档(qrels)和查询(queries)三个主要部分,每种语言都有独立配置。统计显示数据集包含8568个测试样本,涉及237551个字符,平均查询长度124.5字符,平均每查询有5.44个相关文档。

Vidore3HrRetrieval is a multilingual document retrieval dataset part of the MTEB (Massive Text Embedding Benchmark). It contains high-resolution reports released by the European Union, designed for complex-document understanding tasks. Original queries were created in English and then translated to French, German, Italian, Portuguese and Spanish. The dataset supports various task types including visual-document retrieval, image-to-text and text-to-image, consisting of three main components: corpus, qrels (query relevant documents) and queries, with separate configurations for each language. Statistics show the dataset contains 8,568 test samples with 237,551 characters, average query length of 124.5 characters, and average 5.44 relevant documents per query.

提供机构:
antoineedy
搜集汇总
数据集介绍
antoineedy/vidore_v3_test_hr_mteb_format 数据集图片
构建方式
在视觉文档检索领域,多语言与复杂文档理解是评估嵌入模型性能的关键挑战。antoineedy/vidore_v3_test_hr_mteb_format数据集源自ViDoRe V3项目,其构建方式基于欧盟发布的官方报告语料库,旨在模拟企业级复杂文档检索场景。原始查询以英文创建,随后通过专业翻译流程被准确转换为法语、德语、意大利语、葡萄牙语和西班牙语,形成了六种语言的对齐测试集。每个语言子集均包含三个核心组件:以图像形式呈现的文档语料库(corpus)、文本形式的查询语句(queries)以及标注查询与文档相关性的相关性判断(qrels),从而构建了一个完整的文本到图像检索评估框架。
特点
该数据集最显著的特点在于其多语言覆盖与视觉文档检索的深度融合。它提供了英语、法语、德语、意大利语、葡萄牙语和西班牙语六种语言的平行测试集,每种语言包含318条查询和1110个文档图像,总计超过8500个样本。文档图像具有高分辨率特性,平均宽度约1666像素、高度约2276像素,确保了复杂版面信息的完整性。每个查询平均关联5.4个相关文档,且相关文档分布呈现多样性,最高可达30个,这为评估模型在细粒度检索任务中的表现提供了丰富挑战。数据集的统计信息表明,其查询文本长度适中(平均约125字符),兼顾了语义复杂性与检索粒度。
使用方法
该数据集已无缝集成至Massive Text Embedding Benchmark(MTEB)评估框架,使用者可通过简洁的Python接口直接调用。推荐的使用方式为通过mteb库加载任务:首先调用mteb.get_task("Vidore3HrRetrieval")获取评估任务,再实例化MTEB评估器并传入待评估的嵌入模型,最后通过evaluator.run(model)执行完整的检索性能测试。该流程自动处理数据加载、评估指标计算与结果汇总,极大降低了多语言视觉文档检索任务的评估门槛。研究者亦可直接通过Hugging Face Datasets库加载各语言子集的原始数据,开展自定义实验。
背景与挑战
背景概述
在视觉文档检索领域,多语言与复杂文档理解任务的融合正成为推动技术演进的关键方向。由Quentin Macé、Antonio Loison等研究人员于2025年创建的ViDoRe V3测试集(HR子集),依托欧洲联盟官方报告构建,旨在评估模型在跨语言复杂文档场景下的图文检索能力。该数据集以Massive Text Embedding Benchmark(MTEB)为框架,覆盖英语、法语、德语、意大利语、葡萄牙语和西班牙语六种语言,包含1110个文档图像与318个查询,每个查询平均关联约5.4个相关文档。其发布显著填补了多模态嵌入基准在多语种、高分辨率文档检索领域的空白,为评估企业级检索系统提供了标准化测试平台。
当前挑战
该数据集面临的核心挑战聚焦于两个层面。在领域问题层面,视觉文档检索需同时处理文本语义理解与图像布局分析,而多语言环境进一步加剧了跨语言语义对齐的难度,现有模型常难以准确捕捉欧盟报告中专业术语与复杂排版的关联。在构建过程中,原始查询仅以英语创建,其余五种语言依赖机器翻译,可能引入语义偏差或文化语境缺失;此外,文档图像分辨率高(平均宽度1666像素、高度2276像素),对模型的处理效率与显存消耗构成严峻考验,且不同语言子集间查询文本长度差异(如英语平均107字符,法语平均133字符)增加了评估的复杂性。
常用场景
经典使用场景
在视觉文档检索这一前沿领域,antoineedy/vidore_v3_test_hr_mteb_format数据集被广泛用于评估与训练跨模态检索模型。该数据集以欧盟发布的复杂报告为语料库,将文本查询与对应的文档图像进行关联,为图像到文本(image-to-text)及文本到图像(text-to-image)的检索任务提供了标准化的测试基准。其经典使用场景在于衡量嵌入模型在多语言、多模态环境下的检索精度,通过查询与文档图像间的相关性排序,验证模型对图文语义对齐的捕捉能力。
实际应用
在实际应用中,该数据集直接服务于企业级文档检索系统的构建与优化。例如,跨国机构需要从海量的多语言政策报告或技术文档中快速定位相关页面,数据集提供的多语言查询与图像配对可模拟真实搜索场景,用于训练和筛选高效的检索模型。此外,在数字图书馆、法律文书检索及合规审查等领域,该数据集助力实现基于图像内容的精准问答,显著提升信息获取效率,减少人工翻阅成本。
衍生相关工作
该数据集衍生了多项具有影响力的经典工作,其中最引人注目的是ViDoRe V3系列的发布,其通过构建多语言、多模态的检索评估体系,推动了企业级检索技术的迭代。此外,数据集作为MMTEB(Massive Multilingual Text Embedding Benchmark)的重要组成部分,为大规模多语言文本嵌入模型的评测提供了视觉检索子任务,催生了如MTEB等基准框架的扩展。相关研究还利用该数据集探索了图文联合嵌入的跨语言迁移机制,衍生出针对复杂文档理解的检索增强生成(RAG)方法,进一步丰富了多模态信息检索的理论与实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务