遇见数据集

plasma

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

Plasma 是一个预构建图索引数据集,专为 GPU 上的布局感知近似最近邻搜索(ANNS)研究而设计。该数据集来源于同名论文,旨在分离图索引拓扑与内存布局的影响,使研究人员无需重新构建昂贵的图索引即可评估不同布局和重排序策略的效果。数据集由邻接列表和顶点重排序映射组成,仅包含图结构(整数),不包含任何原始向量。覆盖了12个数据集,包括经典基准(SIFT1M、GIST1M、DEEP1M/10M/40M/50M)和现代嵌入(Yandex T2I1M、OpenAI1M、Wikipedia1M/10M、BioASQ1M/10M、C4 5M),维度从96到1536,度量使用L2距离或内积。索引类型包括CAGRA、NSG、NN-Descent、DiskANN和NSSG,重排序方法包括GOrder、RCM、Hub Sort、Degree Sort、HubCluster和Random。总文件数430个,总大小约173 GiB。文件格式为ASCII邻接列表(.adjlist)和映射(.txt),以及一个二进制200-NN图文件(sift_200nn.knng)。使用本数据集需要用户从原始提供者获取对应向量,并按映射文件重排序后与图结合进行搜索。该数据集许可为CC BY 4.0(仅图结构),原始向量需遵守各自来源的许可。适用于GPU上ANNS算法比较、内存布局影响分析、图重排序效果评估等研究。

Plasma is a pre-built graph index dataset designed for layout-aware approximate nearest neighbor search (ANNS) research on GPU. Derived from the paper of the same name, it aims to decouple the effects of graph index topology and memory layout, allowing researchers to evaluate different layout and reordering strategies without rebuilding expensive graph indices. The dataset consists of adjacency lists and vertex reordering mappings, containing only graph structure (integers) without any original vectors. It covers 12 datasets, including classic benchmarks (SIFT1M, GIST1M, DEEP1M/10M/40M/50M) and modern embeddings (Yandex T2I1M, OpenAI1M, Wikipedia1M/10M, BioASQ1M/10M, C4 5M), with dimensions ranging from 96 to 1536 and metrics using L2 distance or inner product. Index types include CAGRA, NSG, NN-Descent, DiskANN, and NSSG; reordering methods include GOrder, RCM, Hub Sort, Degree Sort, HubCluster, and Random. Total files: 430, total size: approximately 173 GiB. File formats are ASCII adjacency lists (.adjlist) and mappings (.txt), plus a binary 200-NN graph file (sift_200nn.knng). Users need to obtain the corresponding vectors from the original providers, reorder them according to the mapping files, and combine them with the graph for search. The dataset is licensed under CC BY 4.0 (graph structure only); original vectors must comply with their respective sources. Suitable for GPU-based ANNS algorithm comparison, memory layout impact analysis, and graph reordering effect evaluation.

创建时间:
2026-08-22
原始信息汇总

Plasma 数据集详情

数据集概述

Plasma 是一个用于 GPU 上布局感知的近似最近邻搜索(ANNS)的预构建图索引数据集,由东京大学和欧姆龙SINIC X公司联合发布。该数据集是论文《Plasma: A Layout-Aware Benchmark Reveals Memory Layout Matters for Graph-based ANNS on GPU》的配套产物,旨在隔离图索引拓扑结构与内存布局对GPU上基于图的近似最近邻搜索性能的影响。该数据集仅包含图结构(邻接表和顶点重排序映射),不包含任何原始向量数据。

数据集内容

该数据集包含多种图索引类型和多种图重排序方法生成的预构建索引文件。

图索引类型

索引类型 说明
cagra NVIDIA CAGRA 构建的 k-NN 图
nsg Navigating Spreading-out Graph
nndescent NN-Descent k-NN 图
diskann DiskANN / Vamana 图
nssg Navigating Satellite System Graph(论文之外额外提供的)

图重排序方法

方法 说明
gorder GOrder 方法
rcm RCM(Reverse Cuthill–McKee)方法
hubsort Hub Sort 方法
indegree, outdegree 度数排序方法
hubcluster, random 额外基线方法

覆盖的数据集

数据集覆盖了论文中基准测试的12个数据集,总计430个文件,约173.33 GiB。

数据集 维度 度量方式 索引类型 文件数 大小
sift-128-euclidean 128 L2 cagra, nsg, nssg, nndescent, diskann 60 6.78 GiB
gist-960-euclidean 960 L2 cagra, nsg, nssg, nndescent, diskann 54 4.71 GiB
deep1m-96-euclidean 96 L2 cagra, nsg, nssg, nndescent, diskann 54 5.32 GiB
deep10m 96 L2 cagra, nsg, nndescent, diskann 18 22.10 GiB
t2i1m-200 200 L2 / IP cagra, nsg, nssg, nndescent, diskann 52 5.54 GiB
openai1m-1536-euclidean 1536 L2 cagra, nsg, nndescent, diskann 53 5.21 GiB
wikipedia1m-768-ip 768 IP cagra, nsg, nndescent, diskann 46 4.47 GiB
wikipedia10m-768-ip 768 IP nndescent 11 14.95 GiB
bioasq1m-1024-ip 1024 IP cagra, nsg, nndescent, diskann 46 4.56 GiB
bioasq10m-1024-ip 1024 IP nndescent 11 15.11 GiB
c45m-1536-ip 1536 IP nndescent 11 7.34 GiB
sift_200nn.knng 128 L2 200-NN 基准真值图 1 0.75 GiB
第一阶段小计 417 96.84 GiB
deep40m-96-euclidean 🚧 96 L2 cagra, nndescent 12 66.68 GiB
deep50m-96-euclidean 🚧 † 96 L2 nsg 1 9.81 GiB
总计 430 173.33 GiB

🚧 表示上传仍在进行中;† 表示deep50m是论文中未报告的额外规模测试点。

文件命名规则

文件名格式为:<索引类型>_K<度数>_<数据集>_<度量方式>[_reordered_<方法>][_mapping].<扩展名>

示例:

  • cagra_K32_deep1m-96-euclidean_l2.adjlist — 基础图
  • cagra_K32_deep1m-96-euclidean_l2_reordered_gorder_mapping.txt — Gorder 重排序映射
  • diskann_K32_bioasq1m-1024-ip_ip_reordered_gorder.adjlist — 重排序后的图
  • diskann_K32_bioasq1m-1024-ip_ip_mapping_gorder.txt — Gorder 重排序映射

文件格式说明

*.adjlist — 邻接表(ASCII格式)

<N> <K> # 头部:顶点数量、出度 <顶点ID> <邻居1> ... <邻居K> ... # N行,顶点ID从0开始递增

*_mapping*.txt — 顶点重排序映射(ASCII格式)

<N> # 头部:顶点数量 <原始ID> <新ID> ... # N行,原始ID从0开始递增

映射关系为 原始 → 新,即 reordered_graph[m[u]] == { m[w] : w in original_graph[u] }

sift_200nn.knng — 二进制k-NN图

使用TEXMEX ivecs 格式存储,小端int32,每个查询点一条记录,文件大小为 1,000,000 * (4 + 200*4) = 804,000,000 字节,用作SIFT1M的召回率评估基准真值。

数据来源与版权

该数据集不包含任何原始向量数据,所有文件仅包含整数(图邻接表和顶点ID重排序)。使用这些索引时,需要自行从原始数据提供商处获取向量数据,并遵守各原始数据集的许可条款:

数据集 原始来源 许可
SIFT1M / GIST1M INRIA / TEXMEX 公有领域 / CC0 等效
DEEP (deep1m, deep10m, deep40m, deep50m) Yandex Research CC BY 4.0
Yandex Text-to-Image (t2i1m) Yandex Research CC BY 4.0
OpenAI Embed. (openai1m) Big ANN Benchmarks 集合 WikiText 为 CC BY-SA 3.0,OpenAI 条款适用
Wikipedia (wikipedia1m, wikipedia10m) VectorDBBench (Zilliz) Wikipedia 文本为 CC BY-SA,Cohere 条款适用
BioASQ (bioasq1m, bioasq10m) VectorDBBench (Zilliz) BioASQ 自有条款,OpenAI 条款适用
C4 (c45m) VectorDBBench (Zilliz) / AllenAI C4 为 ODC-BY,Common Crawl 条款和 Cohere 条款适用

许可信息

本数据集仓库的内容(邻接表和重排序映射)以 CC BY 4.0 许可发布,作者为:

  • Yutaro Oguri — 东京大学
  • Mai Nishimura — 欧姆龙SINIC X公司
  • Yusuke Matsui — 东京大学

此许可仅涵盖计算的图结构,不授予任何原始语料库的权利。

引用信息

Yutaro Oguri, Mai Nishimura, Yusuke Matsui. Plasma: A Layout-Aware Benchmark Reveals Memory Layout Matters for Graph-based ANNS on GPU. The 2nd Workshop on Vector Databases (VecDB) at Very Large Data Bases (VLDB), 2026.

bibtex @inproceedings{oguri2026plasma, author = {Yutaro Oguri and Mai Nishimura and Yusuke Matsui}, title = {Plasma: A Layout-Aware Benchmark Reveals Memory Layout Matters for Graph-based ANNS on GPU}, booktitle = {The 2nd Workshop on Vector Databases (VecDB) at Very Large Data Bases (VLDB)}, year = {2026}, url = {https://openreview.net/forum?id=tF70hyyM6V}, eprint = {2508.15436}, archivePrefix = {arXiv} }

搜集汇总
数据集介绍
plasma 数据集图片
构建方式
Plasma数据集由OMRON SINIC X与东京大学联合构建,旨在解耦图索引拓扑结构与内存布局对GPU上近似最近邻搜索(ANNS)性能的影响。该数据集不包含任何原始向量,仅提供预构建的图索引结构,即邻接表与顶点重排映射。构建过程涵盖多种经典与现代索引类型,包括CAGRA、NSG、NN-Descent、DiskANN及额外的NSSG,并针对十二个基准数据集(如SIFT、GIST、Deep、Yandex T2I、OpenAI、Wikipedia、BioASQ、C4)生成图结构。同时,提供了七种顶点重排方法(如GOrder、RCM、Hub Sort等)的映射文件,以便研究者独立评估布局优化效果。所有文件均为整数格式,采用ASCII或二进制存储,并附有清晰的命名规则,便于检索与使用。
特点
Plasma数据集的核心特点在于其专注于图索引结构与内存布局的分离研究,填补了现有基准仅关注算法性能而忽视硬件层面影响的空白。数据集规模庞大,总计包含430个文件,体积达173 GiB,覆盖从百万级到数千万级的数据点。其图索引由不同算法构建,且提供了丰富的重排排列,使得研究者能够系统性地分析顶点重排对GPU缓存命中率、DRAM带宽利用率以及查询吞吐量(QPS)的影响。此外,数据集严格遵循版权法规,不重新分发任何原始嵌入向量,确保合规性,同时通过详细的文档和下载工具,支持按需获取特定索引或重排文件,降低了使用门槛。
使用方法
使用Plasma数据集时,研究者需自行从原始数据源获取对应的基础向量,并确保其顺序与邻接表中的顶点ID一致。随后,可加载邻接表(.adjlist)和重排映射(.txt)文件,通过提供的Python代码示例进行数据处理:应用映射对向量进行重排,并相应调整邻接表,以匹配重排序后的图结构。之后,可将重排后的向量与图结构输入到自定义的图搜索算法(如束搜索或贪心最佳优先搜索)中,进行性能评测。数据集支持通过Hugging Face CLI工具按模式筛选下载,例如仅获取基础图或特定重排方法的文件,以节省带宽和存储。完整的基准测试框架可在官方代码仓库中获取,便于复现论文中的实验。
背景与挑战
背景概述
Plasma数据集由东京大学与欧姆龙SINIC X公司的研究者于2025年创建,旨在系统研究GPU上基于图的近似最近邻搜索(ANNS)中图索引拓扑与内存布局的独立影响。该数据集提供了多种经典与现代嵌入向量集上预构建的图索引(如CAGRA、NSG、DiskANN等)及顶点重排映射,覆盖SIFT、GIST、Deep、Yandex T2I、OpenAI、Wikipedia、BioASQ及C4等广泛数据集,总计超过400个文件,规模达173GB。其核心研究问题在于通过解耦图拓扑与内存布局,揭示并量化内存布局对搜索性能的显著影响,论文显示仅顶点重排即可在维持相同召回率下提升多达80%的每秒查询数(QPS)。作为统一的评估框架,Plasma填补了该领域缺乏布局感知基准的空白,为GPU上的图索引设计提供了关键参考。
当前挑战
Plasma数据集所解决的领域挑战在于GPU上的图索引性能瓶颈,即传统ANNS研究多聚焦于图拓扑优化而忽视内存布局的影响,导致实际硬件利用率低下,尽管图构建成本高昂。其构建过程中面临多重困难:首先,构建单个大规模图索引需数小时GPU计算,多个数据集和索引类型使得总构建开销巨大,并受限于计算预算;其次,需要确保不同索引在相同顶点顺序下可比性,且必须严格遵循原始数据集的许可证,仅发布图结构而不包含任何向量数据,增加了数据获取与合规的复杂性;此外,文件命名和格式的多样性要求保证一致性与易用性,以便研究者能顺利复现和扩展实验。
常用场景
经典使用场景
Plasma数据集专为图基近似最近邻搜索(ANNS)在GPU上的内存布局优化研究而设计,其经典使用场景聚焦于解耦图索引拓扑与内存布局对检索性能的影响。研究者可利用预构建的邻接表和顶点重排映射,在不重复构建昂贵图索引的前提下,系统评估不同重排策略(如GOrder、RCM、Hub Sort等)对GPU缓存命中率、内存带宽利用率和查询吞吐量的影响。该数据集覆盖SIFT、GIST、Deep等经典基准,以及OpenAI、Cohere等现代嵌入,支持跨数据集、跨索引类型(CAGRA、NSG、DiskANN等)的复现实验,成为验证内存布局优化理论的关键实验床。
实际应用
在实际应用中,Plasma数据集为高性能向量检索库(如Milvus、Faiss)和数据库系统提供了优化指南。开发者可利用这些预构建图直接测试不同内存布局策略对生产环境检索延迟和吞吐量的影响,无需从零生成大规模图索引,显著降低调优成本。例如,在推荐系统、图像检索或RAG(检索增强生成)管线中,通过应用Plasma提供的重排映射,可有效提升GPU资源利用率,降低缓存未命中率,从而加速在线服务响应。此外,该数据集支持对新硬件平台(如不同型号的GPU)进行性能预评估,帮助云服务商和硬件厂商在设计向量数据库时,将内存布局纳入考量,实现成本效益更优的部署方案。
衍生相关工作
Plasma的发布催生了多个前沿研究方向。其一,基于其图结构,研究者开发了更先进的重排算法,如将图神经网络与分区技术结合以自动学习最优顶点排列,超越传统启发式方法。其二,该数据集成为评估新兴图索引(如基于子图划分或层级导航结构)的标准平台,如NSSG索引的提出即受其启发。其三,Plasma促进了GPU硬件感知检索的跨学科研究,融合体系结构模拟器(如GPU性能模型)与ANNS算法,衍生出对内存压力模型和功耗优化的探索。此外,其预构建图也被用于训练学习型索引,例如利用图拓扑作为监督信号来预测查询路由。这些工作共同推动了向量数据库从“算法主导”向“软硬件协同设计”的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务