遇见数据集

WIKI-Dir and ARXIV-Dir

收藏
arXiv2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

WIKI-Dir和ARXIV-Dir是由字节跳动等机构构建的大规模基准数据集,旨在支持向量数据库中目录语义检索的深入研究。该数据集包含具有层次目录拓扑结构的数据内容,数据量庞大,源自Wikipedia和arXiv等公开文章档案,通过结构化处理形成嵌套命名空间。数据集创建过程涉及对知识库的路径编码和向量化处理,以模拟真实场景中的文件系统和代码仓库组织。其应用领域聚焦于人工智能代理的上下文管理、检索增强生成系统以及企业知识库的目录递归查询,旨在解决传统向量数据库在层次结构检索和一致性维护方面的局限性。

WIKI-Dir and ARXIV-Dir are large-scale benchmark datasets developed by ByteDance and other institutions, aiming to support in-depth research on directory semantic retrieval in vector databases. This dataset contains data content with hierarchical directory topology, includes massive volumes of data sourced from public article archives such as Wikipedia and arXiv, and forms nested namespaces through structured processing. The dataset creation process involves path encoding and vectorization of the underlying knowledge base, to simulate the organizational patterns of real-world file systems and code repositories. Its application scenarios focus on context management for AI Agents, retrieval-augmented generation (RAG) systems, and recursive directory queries in enterprise knowledge bases, with the goal of addressing the limitations of traditional vector databases in hierarchical structure retrieval and consistency maintenance.

创建时间:
2026-06-16
原始信息汇总

数据集名称:dir-vector-dataset

数据集概述: 该数据集包含两个大规模真实世界数据集(WIKI-DirARXIV-Dir),专门用于基准测试向量数据库中的目录语义操作(如 DSQ 和 DSM)。

数据集构成

  1. ARXIV-Dir(基于 arXiv)

    • 规模:基于 276 万篇 arXiv 论文摘要。
    • 特征:包含两个并行的层级结构(arXiv 类别分类体系 + 时间发布日期结构)。
    • 向量维度:论文摘要编码为 1024 维向量(mxb-ai-embed-large-v1)。
    • 查询:包含 1,000 个带有目录约束的查询及暴力搜索真实标签。
    • 文件:包括类别真实标签、查询约束、查询向量、语料元数据、语料向量、通用真实标签等文件。
  2. WIKI-Dir(基于 DBpedia/Wikipedia)

    • 规模:包含 194 万个条目,363,000 个独立目录(平均深度 11.95)。
    • 特征:具有深层层级结构,用于模拟复杂知识库。
    • 向量维度:条目编码为 1024 维向量(bge-m3)。
    • 查询与操作:包含 456 个测试查询及 2,000 个 DSM(移动/合并)操作。
    • 文件:包括核心语料库、语料向量、目录路径信息、查询集、查询向量、真实标签等文件。

数据格式

  • 文本/元数据:JSON、JSONL、TXT、TSV(UTF-8 编码)。
  • 向量:fvecs 格式(1024 维浮点向量,兼容 faiss/numpy)。

核心用途:基准测试数据库中目录语义查询(DSQ)和目录语义维护(DSM)操作。

数据下载: 通过谷歌云硬盘共享链接提供两个数据集的完整访问权限。

使用声明: 该数据集仅用于学术研究和非商业用途。使用时需遵守 arXiv、Wikipedia 和 DBpedia 的版权规定,禁止未经授权的商业使用或分发。

搜集汇总
数据集介绍
WIKI-Dir and ARXIV-Dir 数据集图片
构建方式
WIKI-Dir与ARXIV-Dir两个数据集的构建源于对目录语义向量搜索的研究需求。WIKI-Dir基于维基百科语料库与DBpedia的查询及相关性标签构建,通过爬取维基百科类别层次结构为每篇文章添加层次化命名空间,并选取每个条目的一条规范类别路径构成树形层次结构,最终形成包含约194万向量化条目、36.3万个目录节点、平均深度为11.95的数据集。ARXIV-Dir则基于276万篇arXiv论文摘要构建,为每篇摘要关联独立的主体层次(如/cs/AI/)与时间层次(如/2024/05/)两类命名空间,主体目录含168个目录节点,时间目录含432个节点,摘要经嵌入模型编码为1024维向量。两个数据集均配套生成用于目录语义查询与维护评估的测试查询及结构变更操作。
特点
这两个数据集的核心特点在于其内在的层次化目录拓扑结构。WIKI-Dir的目录深度较深(平均11.95层),浅层目录下包含规模庞大的子目录条目集合,呈现明显的广度与深度结构性不平衡;这使得数据集特别适合检验递归查询时路径枚举的扩展成本。ARXIV-Dir则拥有两套正交的命名空间(主体与时间),结构更浅但更宽,便于评估目录语义在不同语义粒度下的检索表现。此外,每个数据集均附带了精确的目录约束查询、目录移动与合并操作,以及通过暴力搜索计算得到的真实相关性标注,从而为递归与非递归查询、结构维护等多种目录语义操作提供了标准化评估基准。
使用方法
WIKI-Dir与ARXIV-Dir的使用方法主要围绕目录语义的查询与维护两个维度展开。研究人员可将数据集加载至支持目录感知的向量数据库(如集成TRIEHI模块的Viking引擎)中,利用提供的目录约束查询测试递归搜索(如锚定于/HR/目录下的所有条目)与非递归搜索(仅返回直接绑定于指定目录的条目)的性能。同时,通过执行数据集中预定义的目录移动与合并操作序列,可评估不同实现策略(如PE-ONLINE、PE-OFFLINE与TRIEHI)在结构变更时的维护成本。数据集中的条目均包含高维向量与路径元数据,支持与图或分区类近似最近邻索引协同工作,便于研究者分离目录语义解析层与向量检索层的开销,进行细粒度性能分析。
背景与挑战
背景概述
在检索增强生成与AI智能体系统蓬勃发展的当下,向量数据库已成为支撑大规模语义检索的核心基础设施。然而,现实世界中的知识体系——从代码仓库、企业维基到个人文件系统和智能体上下文存储——普遍采用层次化的目录结构来组织信息。传统向量数据库在处理这种层级语义时,往往将目录路径扁平化为标量属性,导致递归范围检索成本高昂,且目录结构变更(如移动或合并子目录)需要在应用层以繁琐的变通方案实现,引发了一致性与写放大问题。为填补这一空白,ByteDance联合杭州电子科技大学与浙江大学的研究团队,于2025年提出了WIKI-Dir与ARXIV-Dir两个大规模基准数据集。WIKI-Dir从维基百科类别层次中构建了包含36万余个目录节点的树状结构,覆盖约194万条向量化条目;ARXIV-Dir则基于arXiv论文元数据,构建了主题与时间双重层级命名空间,涵盖276万条摘要。这些数据集的推出,旨在将目录语义作为向量数据库的一等公民,推动层次化范围检索与结构维护这一核心研究问题的系统化探索。
当前挑战
WIKI-Dir与ARXIV-Dir所聚焦的目录语义向量搜索面临双重挑战。首先,在领域问题层面,传统向量数据库仅支持基于标量属性的扁平化元数据过滤,无法原生表达递归子树检索、非递归直接访问或分支排除等层次化范围约束。这导致实际检索中频繁出现语义相似但与上下文无关的误召回,例如在搜索「架构设计」时,当前文档与归档旧文档会被无差别混入结果集。其次,在数据集构建与实现层面,构建过程需面对两大技术难题:其一,如何从维基百科的类别有向无环图与arXiv的复合层级元数据中,提取并规范化出结构一致且语义完整的树形目录拓扑;其二,目录语义模块必须兼容现有近似最近邻索引,在不修改向量排序核心的前提下,实现高效的目录范围解析层。此外,目录结构维护(如移动或合并子树)若采用路径展开策略,将引发严重的写放大——一个逻辑上的子树操作可能演变为对数百万条目路径键的重映射,导致维护延迟方差极大,这一矛盾在WIKI-Dir深达12层的目录结构中尤为尖锐。
常用场景
经典使用场景
WIKI-Dir与ARXIV-Dir数据集的核心使用场景在于评估向量数据库中目录语义查询(DSQ)与目录语义维护(DSM)操作的性能表现。这两个大规模基准数据集分别基于维基百科文章分类层级与arXiv论文的学科及时序元数据构建,为研究者在递归/非递归目录范围检索、子树移动与合并等结构化维护操作上提供了标准化的评测平台。通过引入层次化目录拓扑结构,WIKI-Dir与ARXIV-Dir使得学术界能够系统性地对比在线路径展开、离线路径展开以及基于前缀树的层次索引等不同实现策略在查询延迟、维护成本及索引存储开销上的优劣差异。
解决学术问题
WIKI-Dir与ARXIV-Dir数据集填补了现有向量数据库评测体系中缺乏目录语义考量的空白,解决了学术界长期面临的两个核心难题:一是递归查询时因路径展开导致的延迟爆炸,二是目录结构变更(如移动与合并)时因标量元数据重写引发的写放大与一致性风险。借助这两个数据集,研究者得以脱离应用层临时方案的束缚,直接在向量引擎内部评估层次化范围解析的可行性,从而推动了将目录拓扑作为一等公民操作的原语形式化与代价分析。该工作深刻影响了混合检索与元数据过滤研究的评价范式,使得学术社区能够以可复现的方式验证新索引结构在层次化知识库场景下的鲁棒性。
衍生相关工作
WIKI-Dir与ARXIV-Dir的发布催生了一系列围绕向量数据库目录语义优化的衍生工作。直接受其启发的方向包括:基于前缀树的层次索引维护策略扩展、目录感知的查询代价规划器设计、以及融合语义相似性与结构约束的混合排序模型。在系统层面,OpenViking项目以此数据集为基础验证了目录递归检索在用户记忆问答(LOCOMO)与多跳知识库问答(HotpotQA)上的有效性,并衍生出TRIEHI与路径展开策略的性能对比基准。此外,WIKI-Dir的深度层次结构也被用于分析过滤器谓词选择性与图索引遍历效率之间的耦合关系,进而推动了范围过滤近似最近邻搜索(如Range-filtering ANN)等交叉领域的实验方法学进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务