遇见数据集

wiki-image-vectors

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集包含来自 Wikipedia(enwiki)的图像向量嵌入,使用 google/siglip2-base-patch16-384 模型生成。数据集以 parquet 格式存储,包含两个配置:metadata(元数据)和 vectors(向量)。向量配置中的 parquet 文件包含 title(或 titles)列和 emb 列,其中 emb 为浮点型向量,已归一化。数据集规模在 10 万到 100 万之间,支持多语言(约 109 种语言)文本查询,可应用于图像语义搜索、文本到图像检索以及相似图像查找等任务。

This dataset contains image vector embeddings from Wikipedia (enwiki), generated using the google/siglip2-base-patch16-384 model. The dataset is stored in parquet format with two configurations: metadata and vectors. The parquet files in the vectors configuration include a title (or titles) column and an emb column, where emb contains normalized float vectors. The dataset size ranges from 100,000 to 1,000,000, supports multilingual text queries (about 109 languages), and can be applied to tasks such as image semantic search, text-to-image retrieval, and similar image search.

创建时间:
2026-09-10
原始信息汇总

数据集概述

基本信息

  • 数据集名称:wiki-image-vectors
  • 数据集地址:https://huggingface.co/datasets/derenrich/wiki-image-vectors
  • 语言:英语(en)
  • 标签:wikipedia、enwiki
  • 规模类别:100K < n < 1M

数据集内容

  • 使用 google/siglip2-base-patch16-384 模型生成的维基百科图像向量嵌入(Vector embeddings)。
  • 数据来源于英语维基百科及维基共享资源(Commons)图像。

配置结构

数据集包含两个配置:

  • metadata:数据文件位于 metadata/*.parquet
  • vectors:数据文件位于 vectors/*.parquet

数据结构

  • 向量文件包含列:标题列(titletitles)与嵌入列(emb)。

使用用途

  • 支持对维基百科/共享资源图像嵌入进行语义搜索。
  • 支持文本查询搜索(text search)与相似图像检索(similar image search)。
  • 支持约 109 种语言的搜索。

使用示例

  • 检查点模型:google/siglip2-base-patch16-384
  • 数据仓库:derenrich/wiki-image-vectors
  • 向量文件:vectors/enwiki_siglip2_b384_0000.parquet
  • 示例查询包括:
    • "aerial view of a city at night"
    • "medieval manuscript illumination"
    • "coat of arms with a lion"
    • "steam locomotive"

应用交互

  • 可通过文本输入进行搜索。
  • 可点击图像查找视觉相似的图像。
  • 支持从 Hugging Face Hub 自动下载向量文件,或通过环境变量 VECTORS 指定本地路径。
搜集汇总
数据集介绍
wiki-image-vectors 数据集图片
构建方式
该数据集立足于维基百科庞大的多媒体资源生态,采用google/siglip2-base-patch16-384这一视觉-语言联合嵌入模型,对维基共享资源与英文维基百科中的图像进行向量化表征。构建过程以图像文件为基本单元,通过预训练模型提取每幅图像的高维语义嵌入,并将所得向量与对应的文件标题等元数据以Parquet列式格式分别存储,形成vectors与metadata两个配置。整个流程依托自动化推理管线完成,兼顾了大规模语料处理的效率与嵌入表示的语义一致性。
特点
数据集的核心特质在于其跨模态语义检索能力与规模适中的覆盖范围,向量总量介于十万至百万量级之间,专为英语维基百科及其共享资源库中的图像而设计。每条记录不仅包含归一化后的稠密嵌入向量,还保留了可追溯至原始文件页面的标题信息,便于定位与展示。嵌入维度与SigLIP 2基础模型保持一致,使文本查询与图像向量能够在同一语义空间内直接比对,从而支撑以自然语言描述检索视觉内容的应用场景。
使用方法
在使用层面,该数据集支持两种互补的检索范式:文本到图像的语义搜索与图像到图像的相似性发现。用户可加载Parquet文件中的向量矩阵并施行归一化,随后借助SigLIP 2的文本编码器将查询语句映射为向量,通过内积运算排序得到最相关的图像条目。数据集亦提供了完整的Gradio交互示例,整合了向量加载、文本编码、相似度计算与缩略图渲染等环节,可直接从Hugging Face Hub拉取数据并启动本地演示,为研究者与开发者提供了开箱即用的语义检索体验。
背景与挑战
背景概述
维基百科作为全球最大的开放知识库,其图像资源蕴含着丰富的跨模态语义信息,然而长期以来缺乏系统化的视觉嵌入表示。wiki-image-vectors数据集于近年构建,依托Google SigLIP 2视觉-语言模型,对英文维基百科及共享资源中的图像进行稠密向量化编码,形成十万至百万量级的图像嵌入集合。该数据集由独立研究者维护,旨在为多语言语义图像检索、跨模态对齐及视觉相似性分析提供标准化基准,其核心研究问题在于如何将维基百科的海量异构图像映射至统一的语义空间,并支持百余种语言的文本查询,对开放域图像检索与多模态知识组织具有奠基性意义。
当前挑战
该数据集所应对的领域问题在于维基百科图像检索长期受限于文本元数据而非视觉内容本身,用户难以通过自然语言描述直接定位目标图像。在构建过程中,面临多重挑战:维基百科图像涵盖插图、照片、地图、手稿等极度异构的视觉类别,模型需在统一嵌入空间中保持语义判别力;多语言查询要求嵌入空间具备跨语言对齐能力,而现有视觉-语言模型对低资源语言的覆盖有限;此外,图像标题的规范化处理、缩略图链接的容错生成以及大规模向量的高效存储与索引,均对数据管线的鲁棒性构成考验。这些挑战共同界定了该数据集在开放域多模态检索研究中的技术边界。
常用场景
经典使用场景
在跨模态检索研究领域,图文语义对齐始终是核心命题。wiki-image-vectors数据集以谷歌SigLIP 2模型为编码器,将维基百科及共享资源中的海量图像映射至统一向量空间,其最经典的使用场景在于构建语义图像搜索引擎。研究者可借助文本查询直接检索语义匹配的维基图像,或输入一幅图像以获取视觉相似的近邻结果,从而在百万量级的图像库中实现高效、精准的跨模态检索。该数据集亦常被用于评估视觉语言模型在开放域图像理解任务中的表征质量与泛化能力。
解决学术问题
该数据集有效回应了图像检索与跨模态表征学习中的若干关键学术问题。传统图像检索依赖人工标注的关键词或类别标签,难以捕捉深层语义关联,而该数据集通过预训练视觉语言模型生成的稠密向量,为研究语义相似度度量、跨语言图文对齐以及零样本检索等议题提供了标准化基准。其意义在于,研究者得以在统一框架下比较不同视觉编码器的嵌入质量,并探究大规模图像向量索引的构建策略,进而推动多模态信息检索理论的发展与实证检验。
衍生相关工作
围绕该数据集,学术界与开源社区衍生了一系列经典工作。基于SigLIP 2嵌入的语义搜索演示应用展示了文本到图像与图像到图像的交互式检索范式,启发了后续多模态检索系统的设计。部分研究以此为基础,探索跨语言零样本图像分类与图文匹配的迁移能力;亦有工作将其作为评估基准,对比CLIP、OpenCLIP等模型的嵌入空间特性。此外,该数据集还促进了维基媒体生态中图像推荐、重复检测与知识图谱补全等下游任务的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务