遇见数据集

atlasnav-artifacts

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

BrowseComp-Plus 是一个用于评估信息检索与导航系统的数据集,源自 AtlasNav 匿名研究项目。该数据集包含 830 个查询的完整轨迹,覆盖 AtlasNav、DR-DCI 以及基于 DeepSeek 和 ChatGPT 的原始 DCI 方法。数据集提供冻结的 Atlas 资源(100,195 个文件),包括四份 192 维降维文档向量矩阵、PCA 变换、稀疏图、77 父/443 叶层次结构数组、卡片、标签、目录和溯源信息;同时包含部署的 Router 以及冻结的排名结果(所有查询/文档对的加权 RRF 分数、查询 ID 目录、检索审计和首次导航视图的元数据)。此外,提供 30,000 个基于语料库的支持候选(candidate_tasks_v1)和片段级 Qrel(v2_4,覆盖 830 个问题、889 个必需答案槽、1,753 个可接受跨度)。辅助基准包括 PhantomWiki、FanOutQA、TREC-COVID、2Wiki-Global-400、SciFact/ArguAna 固定样本及 EnterpriseRAG 诊断记录。该数据集适用于信息检索、问答、导航和检索增强生成等任务的复现、评估与比较。

BrowseComp-Plus is a dataset for evaluating information retrieval and navigation systems, derived from the AtlasNav anonymous research project. It contains complete trajectories of 830 queries, covering AtlasNav, DR-DCI, and original DCI methods based on DeepSeek and ChatGPT. The dataset provides frozen Atlas resources (100,195 files), including four 192-dimensional reduced document vector matrices, PCA transformation, sparse graph, 77 parent/443 leaf hierarchy arrays, cards, labels, directories, and provenance information; also includes deployed Router and frozen ranking results (weighted RRF scores for all query/document pairs, query ID directory, retrieval audit, and metadata of first navigation view). Additionally, it provides 30,000 corpus-based support candidates (candidate_tasks_v1) and fragment-level Qrel (v2_4, covering 830 questions, 889 required answer slots, 1,753 acceptable spans). Auxiliary benchmarks include PhantomWiki, FanOutQA, TREC-COVID, 2Wiki-Global-400, fixed samples of SciFact/ArguAna, and EnterpriseRAG diagnostic records. The dataset is suitable for reproduction, evaluation, and comparison of tasks such as information retrieval, question answering, navigation, and retrieval-augmented generation.

创建时间:
2026-08-26
原始信息汇总

AtlasNav 匿名研究数据制品

该数据集是 AtlasNav 0.2.x 版本的配套匿名研究数据发布,主要用于论文复现与验证。

1. BrowseComp-Plus 核心数据

  • 轨迹数据:包含 830 条完整轨迹的校验和存档,分别对应 AtlasNav、DR-DCI 和原始 DCI 在 DeepSeek 与 ChatGPT 两种骨干模型下的采用轨迹。重放命令可计算严格准确率、在线成本、论文一致性等多项指标。
  • 冻结 Atlas:完整的 100,195 文件冻结版本,含四个 192 维约简向量矩阵及变换、稀疏图、77 父/443 叶层次结构数组、卡片、标签、目录与溯源信息。
  • 路由器:精确部署的线性路由器版本。
  • 冻结排名:包含 830 个查询的逐对加权 RRF 分数、对齐查询 ID 目录、检索审计及字节级精确冻结视口,可在无嵌入 API 调用的情况下重建精确初始路由。

2. 附加数据资产

  • 候选任务:包含 30,000 个基于语料库的候选支持样本,但最终 7,163 个训练样本不可用且不得声称已恢复。
  • 片段级 Qrel:覆盖 830 个问题、889 个必需答案槽位和 1,753 个可接受片段,基准引文需经上游再分发审查。
  • 冻结辅助构建资产:包含辅助基准的最终 Atlas 和完整四视图查询嵌入,但 2,560 维完整文档矩阵被有意省略,可通过公共管道从上游语料库重新生成。

3. 辅助基准记录

覆盖 PhantomWiki、FanOutQA、TREC-COVID、2Wiki-Global-400 及 SciFact/ArguAna 固定样本。EnterpriseRAG 被明确标注为结果感知的已知错误替换上界诊断,不属于稳定的单轨迹排行榜提交。

4. 完整性与范围声明

  • release_manifest.json 声明模式兼容性和已知阻塞问题。
  • MANIFEST.sha256.json 绑定每个路径、字节大小和 SHA-256 哈希。
  • 上游语料库和问题数据集未再分发。
  • 发布中不包含任何账户凭证、主机配置、作者身份或本地机器路径。
搜集汇总
数据集介绍
atlasnav-artifacts 数据集图片
构建方式
本数据集为AtlasNav 0.2.x研究的匿名辅助发布,旨在支持论文实验的可复现性。其核心构建策略在于对多源检索轨迹与静态索引资产的精心封装:针对BrowseComp-Plus基准,收录了七份经校验的全量830条轨迹档案,分别对应AtlasNav、DR-DCI及原始DCI在DeepSeek与ChatGPT骨干下的单一采纳路径,并附ChatGPT金文档参考,通过整洁合并单元而非开发/余量分片组织。此外,数据集冻结了100,195文件的统一多元v1索引,包含降维向量矩阵、变换、稀疏图、层次数组及目录,并存储路由器线性v1的精确部署版本。鉴于原始查询向量包缺失,又补充了冻结的加权RRF评分及字节级精确首视图,使初始路由能在无需嵌入API调用的条件下精确重建。辅助任务资产亦同步冻结,但上游语料与查询文本未再分发,且声明中不含任何身份或配置信息。
使用方法
使用该数据集时,应首先通过AtlasNav 0.2.x的命令行接口进行验证与复现,即运行`atlasnav artifacts verify`检查归档完整性,随后使用`atlasnav reproduce --suite paper`重现论文结果,其中复现命令会严格计算准确率(包括801/830的实证参考单元格)、在线成本及一致性指标。BrowseComp-Plus的轨迹档案支持被动重放,但不得将被动结果标记为反事实的主动安全释放精度。冻结的排名文件使得初始路由的精确重构成为可能,而无需调用嵌入API;辅助基准的冻结重放则依赖Atlas与嵌入向量。研究人员可依据声明中的限制,利用这些资产进行独立的评估与诊断,但需注意上游语料与查询文本并未包含在内,需另行获取。
背景与挑战
背景概述
AtlasNav-artifacts数据集由AtlasNav研究团队于2025年创建,旨在支撑其0.2.x版本的可复现性验证。该数据集聚焦于浏览代理(browsing agent)在复杂网页导航任务中的性能评估,核心研究问题在于如何通过冻结的Atlas索引、路由器评分及轨迹数据,实现无需原始查询嵌入即可精确重建在线路由过程。这一工作对检索增强生成(RAG)与自主代理领域具有重要影响,为后续研究提供了标准化的评估基线与审计框架。其附属基准如BrowseComp-Plus和PhantomWiki等,进一步扩展了多跳推理与事实性检索的评估维度,有望推动代理系统在真实网页环境中的鲁棒性研究。
当前挑战
该数据集所面临的挑战多维且深刻。在领域问题层面,它需应对浏览代理在动态网页中的高效导航与准确检索难题,尤其在处理多文档、多跳推理时,如何缓解‘证据盲性’(Evidence Blindness)——即代理忽略关键上下文——成为关键瓶颈。在构建过程中,挑战同样严峻:原始查询向量与部分训练轨迹因服务器限制而不可恢复,团队不得不采用冻结的后期排名分数与摘要记录进行近似复原,这要求在不完整数据下确保复现结果的严格一致性。此外,上游语料与查询文本的再分发限制、以及生成训练样本的不可得,均对数据集的完整性与通用性构成制约。
常用场景
经典使用场景
AtlasNav-artifacts数据集作为AtlasNav系统0.2.x版本的官方配套资源,其核心用途在于为检索增强生成(RAG)领域的研究者提供一套可复现、可验证的实验基准。该数据集精妙地封装了BrowseComp-Plus基准的完整轨迹数据,包括830个查询的决策路径、冻结的Atlas索引(包含100,195个文件的多路复用向量与层级结构)以及路由器模型,使得研究者能够精确重放论文中的实验,从而严格评估系统在复杂网页导航任务中的表现。特别是,该数据集支持对96.51%的实证参考准确率进行独立验证,为对比不同推理策略(如DR-DCI与原始DCI)提供了标准化的测试平台。
解决学术问题
该数据集直面了当前RAG与智能体研究中普遍存在的可复现性危机。在许多学术工作中,实验细节的缺失或数据的不透明导致研究结果难以被他人验证,阻碍了领域的良性发展。AtlasNav-artifacts通过提供带校验和的完整轨迹归档、冻结的模型权重和排名文件,解决了‘如何确保复杂实验的可信复现’这一关键问题。它允许学术社区在不依赖原始嵌入API的情况下,重建精确的初始路由,从而审视证据盲区、检查点完整性等微妙因素对最终准确率的影响,为后续研究设立了严谨的基准规范。
实际应用
在实际应用层面,该数据集主要用于推动企业级检索增强生成系统的研发与评估。例如,它可以作为开发新的路由或上下文压缩算法的测试床,帮助工程师在离线环境中模拟高难度的网页问答任务,从而优化系统的响应准确性与成本消耗。此外,数据集中包含的EnterpriseRAG变体,尽管被定义为单次运行的诊断工具,也能为现实场景中的已知错误替换和结果上限分析提供参考。其结构化的Atlas索引和查询轨迹还可用于训练更高效的导航模型,加速基于语言代理的自动化信息获取工具在金融、法律等领域的落地。
数据集最近研究
最新研究方向
数据集AtlasNav-artifacts作为匿名研究工件的伴生发布,旨在支撑AtlasNav 0.2.x的可复现性验证,其最新研究聚焦于构建大规模、多模态、层次化的检索增强生成(RAG)基准。该数据集以BrowseComp-Plus为核心,包含830个查询的完整轨迹,覆盖多种代理策略与骨干模型,并通过冻结的Atlas、路由器和排名分数,实现了无需嵌入API调用的精确在线路径重建,解决了原始查询向量不可得的复现难题。研究前沿方向体现在严格区分被动重放与反事实主动安全释放,确保评测的诚实性;同时提供30,000个语料库支撑的候选任务,虽最终训练实例不可恢复,但为后续生成式训练数据的探索预留空间。该数据集的意义在于,通过严格的校验机制(如SHA-256清单)和透明的范围声明,树立了复杂RAG系统可复现研究的标杆,其分层结构与冻结工件的设计理念,有望推动检索基准从单一指标向多维度、高保真、可审计的生态演进,深刻影响未来智能体导航与知识密集型问答的评估范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务