遇见数据集

deep-100m-batch-update-eval

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

deep-100m-batch-update-eval是一个专门用于评估向量数据库批量更新性能的基准测试数据集。该数据集基于deep-100m-static-search-eval静态数据集构建,包含1亿个96维的float32向量,使用L2距离度量。数据集的初始状态包含前8000万个向量,标记为集合A。所有向量的更新顺序通过一个种子为42的排列预先定义。数据集提供了三种典型的更新工作负载轨迹:insert-20从初始状态开始,分20个批次(每批100万向量)插入剩余的2000万向量;delete-20从完整的1亿向量状态开始,分20个批次删除相同的2000万向量;mixed-replace-100则在100轮更新中保持8000万活动向量,每轮循环删除一个100万向量的切片并插入新的向量,其中前20轮使用后2000万向量源,后续轮次使用前8000万向量源。数据集包含初始的HNSW索引、重新排列的向量源文件、以紧凑格式描述的批量更新操作文件、以及通过过滤静态源真值生成的地面真值标签。该数据集适用于向量索引系统在动态数据环境下的插入、删除和混合替换操作的性能评估与基准测试。

deep-100m-batch-update-eval is a benchmark dataset specifically designed for evaluating the batch update performance of vector databases. It is built upon the deep-100m-static-search-eval static dataset, containing 100 million 96-dimensional float32 vectors using L2 distance metric. The initial state of the dataset includes the first 80 million vectors, labeled as set A. The update order for all vectors is predefined by a permutation with seed 42. The dataset provides three typical update workload trajectories: insert-20 starts from the initial state and inserts the remaining 20 million vectors in 20 batches (1 million vectors per batch); delete-20 starts from the full 100 million vector state and deletes the same 20 million vectors in 20 batches; mixed-replace-100 maintains 80 million active vectors over 100 update rounds, with each round cyclically deleting one slice of 1 million vectors and inserting new vectors, where the first 20 rounds use the latter 20 million vector source and subsequent rounds use the former 80 million vector source. The dataset includes the initial HNSW index, reordered vector source files, batch update operation files described in a compact format, and ground truth labels generated by filtering the static source ground truth. It is suitable for performance evaluation and benchmarking of vector index systems in dynamic data environments for insertion, deletion, and mixed replacement operations.

创建时间:
2026-07-20
原始信息汇总

数据集概述

  • 数据集名称: deep-100m-batch-update-eval
  • 生成来源: 源自 deep-100m-static-search-eval
  • 向量数量: 1亿
  • 维度: 96
  • 数据类型: float32
  • 距离度量: L2
  • 初始更新索引: 8000万个向量,外部标签等于 A = P[0:80M]
  • 更新顺序: 由种子42生成的源ID排列文件 update_order.u32,覆盖源ID [0, 100M)
  • 插入向量来源: 文件 base_permuted.fbin,其中第 j 行等于 base.fbin[P[j]]

更新轨迹(Traces)

  1. insert-20

    • 从初始集合 A 开始,分20批插入 P[80M:100M],每批100万个向量。
  2. delete-20

    • 从静态的1亿向量状态开始,分20批删除 P[80M:100M],每批100万个向量。
  3. mixed-replace-100

    • 保持8000万个活跃向量,进行100轮操作;每轮删除一个循环的100万源ID切片,并插入 base_permuted.fbin 中的行范围:
      • 第1-20批使用行范围 80M:100M
      • 第21-100批使用行范围 0:80M
      • 插入的外部ID:前20轮使用现有 P[80M:100M] 标签,后续轮次使用新标签范围 [100,000,000, 180,000,000)
  • 批处理JSON文件使用紧凑描述符(rangeu32_sliceu32_cyclic_slice),而非内联百万ID数组。插入 external_ids 字段表示用户可见的源ID,插入 vector_refs 字段为重新排序的插入源中的行范围,需从 base_permuted.fbin 读取。

地面真值(Ground Truth)

  • 检查点地面真值通过按源距离顺序过滤静态源地面真值及检查点所有者映射生成。
  • 文件仅在每个查询从静态源GT深度保留至少10个活跃候选时,才提供精确的前10结果。
  • 若检查点无法为所有查询提供前10结果,则写入对应的 .invalid.json 标记文件(而非填充)。

文件列表

  • workload.json: 工作负载合约
  • static-workload-reference.json: 不可变的静态搜索评估参考
  • source_manifest.json: 生成清单
  • update_order.u32: 种子42源ID排列文件
  • initial/index_80m_m32_efc500: 基于 base[A] 构建的HNSW索引,标签为 A
  • groundtruth/active_80m.bin: 初始8000万检查点地面真值,或 active_80m.invalid.json
  • initial/layout-sidecar/index_80m_m32_efc500.*: 初始HNSW索引的可选运行时布局侧车
  • initial/pq/pq_m<M>.*: 初始8000万PQ工件,按 initial/index_80m_m32_efc500 内部ID重新排序
  • initial_pq_manifest.json: 源静态PQ文件及重新排序的初始PQ工件验证样本
  • base_permuted.fbin: 重新排序的插入向量源,在插入 vector_refs 为行范围时存在
  • reordered_insert_manifest.json: base_permuted.fbin 的源、公式、大小及样本检查清单
  • traces/*/trace.json: 轨迹元数据
  • traces/*/batches/*.json: 紧凑批处理描述符
  • traces/*/groundtruth/*: 检查点地面真值或无效标记
  • checksums.sha256: 生成包文件的校验和

其他说明

  • 静态PQ码本和元数据被重复使用。
  • initial/pq/pq_m<M>.pqcodes 仅包含8000万行,并按初始HNSW内部ID排序,可直接与 initial/index_80m_m32_efc500 配合使用。
搜集汇总
数据集介绍
deep-100m-batch-update-eval 数据集图片
构建方式
本数据集基于深度100M静态搜索评估基准构建,专注于批更新场景下的向量索引性能评估。初始索引包含8000万个向量,其外部标签取自原始数据集的前8000万条记录。更新顺序通过种子为42的排列算法对全部1亿个源ID进行随机重排生成。插入向量来源为经重排的基底文件`base_permuted.fbin`,其中第j行对应原始基底文件的第P[j]行,以确保数据分布的一致性。三种批更新轨迹分别模拟了增量插入、批量删除以及混合替换操作,其中混合替换轨迹在100轮中循环执行删除与插入,灵活使用不同的向量源和标签空间。
特点
该数据集的核心特色在于其紧凑的批量描述符设计,利用`range`、`u32_slice`和`u32_cyclic_slice`等结构替代传统的百万级ID数组,极大降低了存储开销。地面真值通过过滤静态源地面真值并结合检查点所有者映射生成,仅在每个查询保留至少10个活跃候选时输出精确的前10结果,否则标记为无效而非填充数据。此外,数据集提供了重排后的PQ伪影文件,其内部ID顺序与初始HNSW索引对齐,便于直接用于量化搜索加速。配套的校验和文件确保了数据包的完整性与可复现性。
使用方法
使用本数据集时,首先需通过`workload.json`和`static-workload-reference.json`读取工作负载合约与静态参考信息。初始HNSW索引文件位于`initial/index_80m_m32_efc500`,可直接加载用于向量检索。对于批更新操作,研究人员需解析`traces/*/batches/*.json`中的紧凑描述符,从`base_permuted.fbin`中读取对应的向量行范围,并利用`update_order.u32`获取更新顺序。检查点地面真值存储于`traces/*/groundtruth/*`目录,需依据有效标记判断是否可用。可选的PQ伪影文件位于`initial/pq/`目录,可配合初始索引实现高效的距离计算。
背景与挑战
背景概述
在大规模高维向量检索领域,动态更新场景下的索引性能评估一直是学术界与工业界关注的焦点。deep-100m-batch-update-eval数据集由向量检索研究团队于近期构建,旨在为批处理更新操作提供标准化的评测基准。该数据集源于静态检索评测集deep-100m-static-search-eval,包含1亿条96维的浮点型向量,采用欧氏距离度量。研究核心在于模拟实际生产环境中频繁的数据插入与删除操作,通过设计插入、删除及混合替换三种轨迹,系统性地评估索引结构在动态环境下的查询精度与构建效率。该数据集为向量数据库、推荐系统等领域的算法优化提供了关键的测试平台,推动了动态向量检索技术的标准化进展。
当前挑战
该数据集主要解决的领域问题在于,静态评测基准无法反映真实世界中数据持续更新的场景,导致索引算法在动态负载下的鲁棒性不足。具体挑战包括:一是如何在80M初始基数上高效处理千万级向量的增量插入与删除,避免完整重建索引带来的高昂计算代价;二是混合轨迹中重复删除与插入相同ID区间时,需避免标签冲突与索引碎片化,保证查询结果的一致性。构建过程中,挑战性任务包括确保插入向量源的重排顺序与标签映射的精确同步,以及为每个检查点生成精确的top-10真实结果,通过过滤静态源距离序并验证候选数是否充足,避免无效填充导致的评估偏差。
常用场景
经典使用场景
在近似最近邻搜索(ANNS)领域,数据集的动态更新特性对算法鲁棒性提出了严苛挑战。deep-100m-batch-update-eval专为评估向量索引在批量更新场景下的性能而设计,其核心使用场景涵盖三种典型操作模式:增量插入、批量删除以及混合替换。通过精心编排的二十批次百万级向量操作,该数据集能够系统性地测试索引结构在持续数据流中的重构能力。特别是其混合替换场景,在100轮迭代中交替执行删除与插入,模拟真实世界中数据不断更迭的复杂环境,为研究人员提供了一个标准化的基准测试平台,用以衡量索引在维持搜索精度与响应速度方面的动态适应表现。
解决学术问题
该数据集精准回应了静态ANNS基准测试无法覆盖的学术研究空白。传统评估方法往往忽视数据动态变化对索引性能的影响,而deep-100m-batch-update-eval通过引入精确的检查点真实值机制,解决了在批量更新过程中验证索引正确性的核心难题。它使得研究者能够系统量化索引在插入、删除等操作后,搜索精度随数据规模变化的衰减曲线,从而深入探索索引结构在非稳定状态下的误差累积规律。这一设计推动了近似搜索理论从静态假设向动态现实的演进,为构建更鲁棒、自适应的索引算法奠定了实证基础。
衍生相关工作
该数据集的发布催生了一系列聚焦动态ANNS索引的开创性工作。基于其定义的三种更新模式,研究者相继提出了支持高效插入的滑动窗口HNSW变体、针对批量删除优化的分片式IVF索引,以及融合学习型排序的混合更新策略。其中,若干工作专门针对其包含的PQ(乘积量化)重排序制品展开,探索如何在索引内部ID重映射后保持压缩编码的有效性。此外,其紧凑的批次描述符格式(如range和u32_cyclic_slice)启发了下一代基准测试工具的设计范式,推动了从静态评测向支持声明式更新轨迹的标准化转变,这些成果共同丰富了动态近似搜索的理论体系与实践工具箱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务