plasma
收藏资源简介:
Plasma 是一个预构建图索引数据集,专为 GPU 上的布局感知近似最近邻搜索(ANNS)研究而设计。该数据集来源于同名论文,旨在分离图索引拓扑与内存布局的影响,使研究人员无需重新构建昂贵的图索引即可评估不同布局和重排序策略的效果。数据集由邻接列表和顶点重排序映射组成,仅包含图结构(整数),不包含任何原始向量。覆盖了12个数据集,包括经典基准(SIFT1M、GIST1M、DEEP1M/10M/40M/50M)和现代嵌入(Yandex T2I1M、OpenAI1M、Wikipedia1M/10M、BioASQ1M/10M、C4 5M),维度从96到1536,度量使用L2距离或内积。索引类型包括CAGRA、NSG、NN-Descent、DiskANN和NSSG,重排序方法包括GOrder、RCM、Hub Sort、Degree Sort、HubCluster和Random。总文件数430个,总大小约173 GiB。文件格式为ASCII邻接列表(.adjlist)和映射(.txt),以及一个二进制200-NN图文件(sift_200nn.knng)。使用本数据集需要用户从原始提供者获取对应向量,并按映射文件重排序后与图结合进行搜索。该数据集许可为CC BY 4.0(仅图结构),原始向量需遵守各自来源的许可。适用于GPU上ANNS算法比较、内存布局影响分析、图重排序效果评估等研究。
Plasma is a pre-built graph index dataset designed for layout-aware approximate nearest neighbor search (ANNS) research on GPU. Derived from the paper of the same name, it aims to decouple the effects of graph index topology and memory layout, allowing researchers to evaluate different layout and reordering strategies without rebuilding expensive graph indices. The dataset consists of adjacency lists and vertex reordering mappings, containing only graph structure (integers) without any original vectors. It covers 12 datasets, including classic benchmarks (SIFT1M, GIST1M, DEEP1M/10M/40M/50M) and modern embeddings (Yandex T2I1M, OpenAI1M, Wikipedia1M/10M, BioASQ1M/10M, C4 5M), with dimensions ranging from 96 to 1536 and metrics using L2 distance or inner product. Index types include CAGRA, NSG, NN-Descent, DiskANN, and NSSG; reordering methods include GOrder, RCM, Hub Sort, Degree Sort, HubCluster, and Random. Total files: 430, total size: approximately 173 GiB. File formats are ASCII adjacency lists (.adjlist) and mappings (.txt), plus a binary 200-NN graph file (sift_200nn.knng). Users need to obtain the corresponding vectors from the original providers, reorder them according to the mapping files, and combine them with the graph for search. The dataset is licensed under CC BY 4.0 (graph structure only); original vectors must comply with their respective sources. Suitable for GPU-based ANNS algorithm comparison, memory layout impact analysis, and graph reordering effect evaluation.
Plasma 数据集详情
数据集概述
Plasma 是一个用于 GPU 上布局感知的近似最近邻搜索(ANNS)的预构建图索引数据集,由东京大学和欧姆龙SINIC X公司联合发布。该数据集是论文《Plasma: A Layout-Aware Benchmark Reveals Memory Layout Matters for Graph-based ANNS on GPU》的配套产物,旨在隔离图索引拓扑结构与内存布局对GPU上基于图的近似最近邻搜索性能的影响。该数据集仅包含图结构(邻接表和顶点重排序映射),不包含任何原始向量数据。
数据集内容
该数据集包含多种图索引类型和多种图重排序方法生成的预构建索引文件。
图索引类型
| 索引类型 | 说明 |
|---|---|
cagra |
NVIDIA CAGRA 构建的 k-NN 图 |
nsg |
Navigating Spreading-out Graph |
nndescent |
NN-Descent k-NN 图 |
diskann |
DiskANN / Vamana 图 |
nssg |
Navigating Satellite System Graph(论文之外额外提供的) |
图重排序方法
| 方法 | 说明 |
|---|---|
gorder |
GOrder 方法 |
rcm |
RCM(Reverse Cuthill–McKee)方法 |
hubsort |
Hub Sort 方法 |
indegree, outdegree |
度数排序方法 |
hubcluster, random |
额外基线方法 |
覆盖的数据集
数据集覆盖了论文中基准测试的12个数据集,总计430个文件,约173.33 GiB。
| 数据集 | 维度 | 度量方式 | 索引类型 | 文件数 | 大小 |
|---|---|---|---|---|---|
sift-128-euclidean |
128 | L2 | cagra, nsg, nssg, nndescent, diskann | 60 | 6.78 GiB |
gist-960-euclidean |
960 | L2 | cagra, nsg, nssg, nndescent, diskann | 54 | 4.71 GiB |
deep1m-96-euclidean |
96 | L2 | cagra, nsg, nssg, nndescent, diskann | 54 | 5.32 GiB |
deep10m |
96 | L2 | cagra, nsg, nndescent, diskann | 18 | 22.10 GiB |
t2i1m-200 |
200 | L2 / IP | cagra, nsg, nssg, nndescent, diskann | 52 | 5.54 GiB |
openai1m-1536-euclidean |
1536 | L2 | cagra, nsg, nndescent, diskann | 53 | 5.21 GiB |
wikipedia1m-768-ip |
768 | IP | cagra, nsg, nndescent, diskann | 46 | 4.47 GiB |
wikipedia10m-768-ip |
768 | IP | nndescent | 11 | 14.95 GiB |
bioasq1m-1024-ip |
1024 | IP | cagra, nsg, nndescent, diskann | 46 | 4.56 GiB |
bioasq10m-1024-ip |
1024 | IP | nndescent | 11 | 15.11 GiB |
c45m-1536-ip |
1536 | IP | nndescent | 11 | 7.34 GiB |
sift_200nn.knng |
128 | L2 | 200-NN 基准真值图 | 1 | 0.75 GiB |
| 第一阶段小计 | 417 | 96.84 GiB | |||
deep40m-96-euclidean 🚧 |
96 | L2 | cagra, nndescent | 12 | 66.68 GiB |
deep50m-96-euclidean 🚧 † |
96 | L2 | nsg | 1 | 9.81 GiB |
| 总计 | 430 | 173.33 GiB |
🚧 表示上传仍在进行中;† 表示
deep50m是论文中未报告的额外规模测试点。
文件命名规则
文件名格式为:<索引类型>_K<度数>_<数据集>_<度量方式>[_reordered_<方法>][_mapping].<扩展名>
示例:
cagra_K32_deep1m-96-euclidean_l2.adjlist— 基础图cagra_K32_deep1m-96-euclidean_l2_reordered_gorder_mapping.txt— Gorder 重排序映射diskann_K32_bioasq1m-1024-ip_ip_reordered_gorder.adjlist— 重排序后的图diskann_K32_bioasq1m-1024-ip_ip_mapping_gorder.txt— Gorder 重排序映射
文件格式说明
*.adjlist — 邻接表(ASCII格式)
<N> <K> # 头部:顶点数量、出度 <顶点ID> <邻居1> ... <邻居K> ... # N行,顶点ID从0开始递增
*_mapping*.txt — 顶点重排序映射(ASCII格式)
<N> # 头部:顶点数量 <原始ID> <新ID> ... # N行,原始ID从0开始递增
映射关系为 原始 → 新,即 reordered_graph[m[u]] == { m[w] : w in original_graph[u] }。
sift_200nn.knng — 二进制k-NN图
使用TEXMEX ivecs 格式存储,小端int32,每个查询点一条记录,文件大小为 1,000,000 * (4 + 200*4) = 804,000,000 字节,用作SIFT1M的召回率评估基准真值。
数据来源与版权
该数据集不包含任何原始向量数据,所有文件仅包含整数(图邻接表和顶点ID重排序)。使用这些索引时,需要自行从原始数据提供商处获取向量数据,并遵守各原始数据集的许可条款:
| 数据集 | 原始来源 | 许可 |
|---|---|---|
| SIFT1M / GIST1M | INRIA / TEXMEX | 公有领域 / CC0 等效 |
| DEEP (deep1m, deep10m, deep40m, deep50m) | Yandex Research | CC BY 4.0 |
| Yandex Text-to-Image (t2i1m) | Yandex Research | CC BY 4.0 |
| OpenAI Embed. (openai1m) | Big ANN Benchmarks 集合 | WikiText 为 CC BY-SA 3.0,OpenAI 条款适用 |
| Wikipedia (wikipedia1m, wikipedia10m) | VectorDBBench (Zilliz) | Wikipedia 文本为 CC BY-SA,Cohere 条款适用 |
| BioASQ (bioasq1m, bioasq10m) | VectorDBBench (Zilliz) | BioASQ 自有条款,OpenAI 条款适用 |
| C4 (c45m) | VectorDBBench (Zilliz) / AllenAI | C4 为 ODC-BY,Common Crawl 条款和 Cohere 条款适用 |
许可信息
本数据集仓库的内容(邻接表和重排序映射)以 CC BY 4.0 许可发布,作者为:
- Yutaro Oguri — 东京大学
- Mai Nishimura — 欧姆龙SINIC X公司
- Yusuke Matsui — 东京大学
此许可仅涵盖计算的图结构,不授予任何原始语料库的权利。
引用信息
Yutaro Oguri, Mai Nishimura, Yusuke Matsui. Plasma: A Layout-Aware Benchmark Reveals Memory Layout Matters for Graph-based ANNS on GPU. The 2nd Workshop on Vector Databases (VecDB) at Very Large Data Bases (VLDB), 2026.
bibtex @inproceedings{oguri2026plasma, author = {Yutaro Oguri and Mai Nishimura and Yusuke Matsui}, title = {Plasma: A Layout-Aware Benchmark Reveals Memory Layout Matters for Graph-based ANNS on GPU}, booktitle = {The 2nd Workshop on Vector Databases (VecDB) at Very Large Data Bases (VLDB)}, year = {2026}, url = {https://openreview.net/forum?id=tF70hyyM6V}, eprint = {2508.15436}, archivePrefix = {arXiv} }




