wiki-image-vectors
收藏资源简介:
该数据集包含来自 Wikipedia(enwiki)的图像向量嵌入,使用 google/siglip2-base-patch16-384 模型生成。数据集以 parquet 格式存储,包含两个配置:metadata(元数据)和 vectors(向量)。向量配置中的 parquet 文件包含 title(或 titles)列和 emb 列,其中 emb 为浮点型向量,已归一化。数据集规模在 10 万到 100 万之间,支持多语言(约 109 种语言)文本查询,可应用于图像语义搜索、文本到图像检索以及相似图像查找等任务。
This dataset contains image vector embeddings from Wikipedia (enwiki), generated using the google/siglip2-base-patch16-384 model. The dataset is stored in parquet format with two configurations: metadata and vectors. The parquet files in the vectors configuration include a title (or titles) column and an emb column, where emb contains normalized float vectors. The dataset size ranges from 100,000 to 1,000,000, supports multilingual text queries (about 109 languages), and can be applied to tasks such as image semantic search, text-to-image retrieval, and similar image search.
数据集概述
基本信息
- 数据集名称:wiki-image-vectors
- 数据集地址:https://huggingface.co/datasets/derenrich/wiki-image-vectors
- 语言:英语(en)
- 标签:wikipedia、enwiki
- 规模类别:100K < n < 1M
数据集内容
- 使用
google/siglip2-base-patch16-384模型生成的维基百科图像向量嵌入(Vector embeddings)。 - 数据来源于英语维基百科及维基共享资源(Commons)图像。
配置结构
数据集包含两个配置:
- metadata:数据文件位于
metadata/*.parquet - vectors:数据文件位于
vectors/*.parquet
数据结构
- 向量文件包含列:标题列(
title或titles)与嵌入列(emb)。
使用用途
- 支持对维基百科/共享资源图像嵌入进行语义搜索。
- 支持文本查询搜索(text search)与相似图像检索(similar image search)。
- 支持约 109 种语言的搜索。
使用示例
- 检查点模型:
google/siglip2-base-patch16-384 - 数据仓库:
derenrich/wiki-image-vectors - 向量文件:
vectors/enwiki_siglip2_b384_0000.parquet - 示例查询包括:
- "aerial view of a city at night"
- "medieval manuscript illumination"
- "coat of arms with a lion"
- "steam locomotive"
应用交互
- 可通过文本输入进行搜索。
- 可点击图像查找视觉相似的图像。
- 支持从 Hugging Face Hub 自动下载向量文件,或通过环境变量
VECTORS指定本地路径。




