atlasnav-artifacts
收藏资源简介:
BrowseComp-Plus 是一个用于评估信息检索与导航系统的数据集,源自 AtlasNav 匿名研究项目。该数据集包含 830 个查询的完整轨迹,覆盖 AtlasNav、DR-DCI 以及基于 DeepSeek 和 ChatGPT 的原始 DCI 方法。数据集提供冻结的 Atlas 资源(100,195 个文件),包括四份 192 维降维文档向量矩阵、PCA 变换、稀疏图、77 父/443 叶层次结构数组、卡片、标签、目录和溯源信息;同时包含部署的 Router 以及冻结的排名结果(所有查询/文档对的加权 RRF 分数、查询 ID 目录、检索审计和首次导航视图的元数据)。此外,提供 30,000 个基于语料库的支持候选(candidate_tasks_v1)和片段级 Qrel(v2_4,覆盖 830 个问题、889 个必需答案槽、1,753 个可接受跨度)。辅助基准包括 PhantomWiki、FanOutQA、TREC-COVID、2Wiki-Global-400、SciFact/ArguAna 固定样本及 EnterpriseRAG 诊断记录。该数据集适用于信息检索、问答、导航和检索增强生成等任务的复现、评估与比较。
BrowseComp-Plus is a dataset for evaluating information retrieval and navigation systems, derived from the AtlasNav anonymous research project. It contains complete trajectories of 830 queries, covering AtlasNav, DR-DCI, and original DCI methods based on DeepSeek and ChatGPT. The dataset provides frozen Atlas resources (100,195 files), including four 192-dimensional reduced document vector matrices, PCA transformation, sparse graph, 77 parent/443 leaf hierarchy arrays, cards, labels, directories, and provenance information; also includes deployed Router and frozen ranking results (weighted RRF scores for all query/document pairs, query ID directory, retrieval audit, and metadata of first navigation view). Additionally, it provides 30,000 corpus-based support candidates (candidate_tasks_v1) and fragment-level Qrel (v2_4, covering 830 questions, 889 required answer slots, 1,753 acceptable spans). Auxiliary benchmarks include PhantomWiki, FanOutQA, TREC-COVID, 2Wiki-Global-400, fixed samples of SciFact/ArguAna, and EnterpriseRAG diagnostic records. The dataset is suitable for reproduction, evaluation, and comparison of tasks such as information retrieval, question answering, navigation, and retrieval-augmented generation.
AtlasNav 匿名研究数据制品
该数据集是 AtlasNav 0.2.x 版本的配套匿名研究数据发布,主要用于论文复现与验证。
1. BrowseComp-Plus 核心数据
- 轨迹数据:包含 830 条完整轨迹的校验和存档,分别对应 AtlasNav、DR-DCI 和原始 DCI 在 DeepSeek 与 ChatGPT 两种骨干模型下的采用轨迹。重放命令可计算严格准确率、在线成本、论文一致性等多项指标。
- 冻结 Atlas:完整的 100,195 文件冻结版本,含四个 192 维约简向量矩阵及变换、稀疏图、77 父/443 叶层次结构数组、卡片、标签、目录与溯源信息。
- 路由器:精确部署的线性路由器版本。
- 冻结排名:包含 830 个查询的逐对加权 RRF 分数、对齐查询 ID 目录、检索审计及字节级精确冻结视口,可在无嵌入 API 调用的情况下重建精确初始路由。
2. 附加数据资产
- 候选任务:包含 30,000 个基于语料库的候选支持样本,但最终 7,163 个训练样本不可用且不得声称已恢复。
- 片段级 Qrel:覆盖 830 个问题、889 个必需答案槽位和 1,753 个可接受片段,基准引文需经上游再分发审查。
- 冻结辅助构建资产:包含辅助基准的最终 Atlas 和完整四视图查询嵌入,但 2,560 维完整文档矩阵被有意省略,可通过公共管道从上游语料库重新生成。
3. 辅助基准记录
覆盖 PhantomWiki、FanOutQA、TREC-COVID、2Wiki-Global-400 及 SciFact/ArguAna 固定样本。EnterpriseRAG 被明确标注为结果感知的已知错误替换上界诊断,不属于稳定的单轨迹排行榜提交。
4. 完整性与范围声明
release_manifest.json声明模式兼容性和已知阻塞问题。MANIFEST.sha256.json绑定每个路径、字节大小和 SHA-256 哈希。- 上游语料库和问题数据集未再分发。
- 发布中不包含任何账户凭证、主机配置、作者身份或本地机器路径。




