遇见数据集

BrowseComp-PlusCM

收藏
arXiv2026-08-21 更新2026-08-22 收录
数据链接:
官方服务:

资源简介:

BrowseComp-PlusCM是由滑铁卢大学构建的智能体搜索基准数据集,它保留了BrowseComp-Plus的复杂问题,但将证据迁移至NVIDIA发布的ClimbMix语料库。该数据集包含57个通过严格验证的多跳问题,每个问题被分解为原子推理跳,并确保每个跳在ClimbMix的553M文档、400B tokens中均有确切支撑。创建过程采用自动化流水线,结合独立代理验证与人工审核,仅保留所有跳均被证实的样本。该数据集旨在解耦智能体搜索中的检索与推理能力,通过将难度转移至更大规模、更自然的语料库,暴露检索瓶颈,为评估深度研究代理提供更真实的基准。

BrowseComp-PlusCM is an agent search benchmark dataset developed by the University of Waterloo. It retains the complex problem set from BrowseComp-Plus, while migrating the supporting evidence to the ClimbMix corpus released by NVIDIA. This dataset contains 57 rigorously validated multi-hop questions, each decomposed into atomic reasoning hops, with each hop guaranteed to have exact supporting evidence in the 553 million documents and 400 billion tokens of the ClimbMix corpus. The dataset was created via an automated pipeline that combines independent agent validation and manual review, only retaining samples where all reasoning hops are fully verified. This dataset aims to decouple retrieval and reasoning capabilities in agent search: by shifting the task difficulty to a larger, more natural corpus, it exposes retrieval bottlenecks, providing a more realistic benchmark for evaluating deep research agents.

创建时间:
2026-08-21
原始信息汇总

CMASS 数据集概述

基本信息

  • 全称:ClimbMix Agentic Search Suite(CMASS)
  • 类型:基于语料库的智能体搜索基准数据集
  • 论文:https://arxiv.org/abs/2608.20317
  • 数据集发布地址:https://huggingface.co/datasets/castorini/cmass
  • 许可证:Apache 2.0
  • Python要求:3.10 或更高版本

核心目标

CMASS 通过将现有的问答基准投影到固定的检索语料库上,构建基于语料库的智能体搜索基准。每个问题被分解为原子推理步骤,并且只有当每个步骤都能在目标语料库中被可检索文档支持时,该问题才会被保留。

数据集内容

首个版本:BrowseComp-Plus_CM

  • 源语料库:ClimbMix,包含 5.53 亿篇文档,共计 4000 亿 token
  • 基准规模:57 个人工验证的问题,附带问题级别的相关性判断(Qrels)

构建流程

  1. 投影阶段(Stage 1):包含四个操作——跳跃/线索分解、基础验证、可回答性检查、全跳跃验证
  2. 独立智能体验证(Stage 2):使用 PIIKA 进行独立验证
  3. 人工验证(Stage 3):人工审核
  4. Qrels 构建(Stage 4):构建相关性判断

数据过滤结果

  • 初始来源问题:830 个
  • 可从 ClimbMix 回答的问题:326 个
  • 通过自动全跳跃验证的问题:65 个
  • 人工审核后保留的问题:57 个

数据集结构

  • queries.jsonl:包含混淆编码的问题和答案,需通过 canary 字段解码
  • qrels.jsonl:包含混淆编码的文档 ID,同样需解码
  • corpus_duplicates 配置:包含 219,066,180 行重复文档关系记录(精确和近似重复)

PIIKA 评估结果

在 57 个人工验证问题上评估了三种 PIIKA 配置:

模型 语料库 准确率(%) 召回率(%) 平均工具调用次数
GPT-5.6 Sol (max) BrowseComp-Plus 85.96 84.28 60.16
GPT-5.6 Sol (max) BrowseComp-Plus_CM 80.70 21.37 98.26
Gemma 4 31B IT BrowseComp-Plus 26.32 24.91 24.46
Gemma 4 31B IT BrowseComp-Plus_CM 15.79 2.77 23.42
Qwen 3.5 9B BrowseComp-Plus 14.04 19.33 33.44
Qwen 3.5 9B BrowseComp-Plus_CM 12.28 2.64 37.93

关键发现:投影使检索难度显著增加。对于 GPT-5.6 Sol,证据召回率从 84.28% 下降到 21.37%,同时检索调用增加了 63%,而答案准确率仅下降约 5 个百分点。

仓库结构

  • pipelines/bcp_climbmix/:BrowseComp-Plus 到 ClimbMix 的投影实现,包含 Stage 1 的四个操作及 Stage 4 的 Qrels 构建
  • corpus_analysis/:ClimbMix 语料库分析(token 长度分布、重复检测等)
  • scripts/deobfuscate.py:解码 Hugging Face 发布中混淆的字段

使用方式

  1. 克隆仓库并安装依赖(见 README 中的 Quick Start)
  2. 通过 Hugging Face datasets 库加载查询和 Qrels
  3. 使用 decode_row 函数解码混淆字段
  4. 如需复现完整的投影流程,可参考 pipelines/bcp_climbmix/ 目录

引用方式

bibtex @misc{sharifymoghaddam2026projectingbrowsecompplusclimbmixrealistic, title={Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search}, author={Sahel Sharifymoghaddam and Lingwei Gu and Yijun Ge and Jimmy Lin}, year={2026}, eprint={2608.20317}, archivePrefix={arXiv}, primaryClass={cs.IR}, url={https://arxiv.org/abs/2608.20317}, }

搜集汇总
数据集介绍
BrowseComp-PlusCM 数据集图片
构建方式
BrowseComp-PlusCM 的构建源于对既有基准的迁移投影,其核心在于将 BrowseComp-Plus 的 830 道测试问题重新定位至 NVIDIA 发布的 ClimbMix 语料库,该语料库包含 553M 篇文档、总计 400B 词元,且构建时未参考任何基准。构建流程采用五阶段流水线:首先对语料库进行长度与重复性分析,并通过 MinHash 与 Jaccard 系数识别重复文档;随后由投影智能体将每个问题分解为原子推理跳,并利用 BM25 检索在 ClimbMix 中为每一跳寻找支撑证据;经过可回答性检查与全跳验证后,再由独立智能体 PIIKA 基于所提供文档进行验证,最终经人工审核确认每一跳均获得可靠支撑。通过严格筛选,仅 57 道问题所有推理跳均在 ClimbMix 中找到对应文档,并构建了问题级相关性判断。
特点
该数据集的核心特点在于将评估场景从受控的小型语料库扩展至大规模自然网络文本,从而显著提升检索难度与真实性。ClimbMix 语料库规模较 BrowseComp-Plus 原始语料大三个数量级,文档平均长度短(中位数 614 词元),无需截断策略,且内容经过语义聚类与质量过滤,更贴近真实搜索环境。投影后的基准将难度重心从推理转移至检索:即使最强大的智能体在答案准确率仅下降 5 个百分点的情况下,证据召回率从 84.3% 骤降至 21.4%,同时检索调用次数增加 63%。此外,数据集保留了问题级相关性判断,并进行了重复文档扩展,确保评估的公平性与全面性。
使用方法
BrowseComp-PlusCM 的使用遵循标准智能体搜索评估流程:系统通过 Pyserini 提供的 BM25 索引接口(climbmix-400b)进行检索,并使用 search 与 get_document 工具访问文档。评估时,智能体需自主分解问题、制定检索策略并综合证据回答问题,其表现通过准确率、证据召回率及检索调用次数衡量。数据集的 qrels 文件采用与 BrowseComp-Plus 兼容的格式,文档 ID 形如 shard_<shard_index>_<doc_index>,可直接用于现有评估代码。该基准适用于测试大规模语料下检索组件的性能、比较不同检索策略的有效性,以及探究预训练知识对闭卷与开卷评估的影响。
背景与挑战
背景概述
BrowseComp-PlusCM由加拿大滑铁卢大学的Sahel Sharifymoghaddam、Lingwei Gu、Yijun Ge与Jimmy Lin于2026年提出,旨在解决代理式搜索评测中检索与推理能力纠缠不清的顽疾。该数据集将BrowseComp-Plus的830道测试问题迁移至NVIDIA发布的ClimbMix语料库(4000亿词元、5.53亿篇文档),通过将问题分解为原子推理跳变并在新语料库中逐跳验证,构建了包含57道完全可落地问题及问答级相关性判断的基准。其核心贡献在于开创性的投影流水线,使评测能够剥离检索器影响而聚焦智能体能力,为大规模、自然分布语料上的代理式检索研究提供了可复现的评测基座,并已开源全部代码与数据。
当前挑战
BrowseComp-PlusCM面临的核心挑战存在于两个层面。领域层面,它需在5.53亿篇文档中发掘支持性证据,相较原始仅约10万篇的人工构造语料,检索难度陡增:最强智能体的证据召回率从84.3%骤降至21.4%,需多发出63%的搜索调用,而开放权重模型召回率更跌至3%以下,凸显了真实规模语料对检索能力的严苛考验。构建层面,流水线须克服智能体约束漂移、浅层阅读导致的误判、多轮会话的不稳定性,以及人工验证的高昂成本——830道题中仅57道最终通过全部校验,每一丢弃案例均需可诊断的归因记录,确保基准的严谨性与可复现性。
常用场景
经典使用场景
BrowseComp-PlusCM作为首个将智能体搜索评估从定制化小规模语料迁移至海量自然网页语料的基准,其经典使用场景在于严格分离检索与推理能力的评估。研究者借助该数据集,在包含5.53亿文档、400B词元的ClimbMix语料上,通过BM25索引与检索工具接口,系统性地考察智能体在近乎真实网络规模的检索环境中的表现。该场景尤其适用于探究检索难度对端到端问答准确率的影响,以及对比不同规模、不同架构的深度研究智能体在证据召回率和检索调用次数上的差异,从而为智能体搜索系统的设计与优化提供可复现的评测平台。
实际应用
在实际应用中,BrowseComp-PlusCM为深研型搜索智能体的部署前评估提供了高难度的真实场景。由于ClimbMix语料与预训练数据同源,该基准可用于检验模型在开放域检索中的泛化能力,避免因语料泄漏导致的性能虚高。工业界与学术界可借此基准测试不同检索接口(如BM25、稠密检索、布尔查询)在超大语料上的有效性,并优化智能体的搜索策略,例如查询重构深度、文档阅读完整度与停时机制。此外,其问题级相关性判定支持检索系统组件的独立调优,有助于开发更鲁棒的证据定位算法,从而提升实际产品中智能体搜索的准确性与效率。
衍生相关工作
BrowseComp-PlusCM的出现催生了系列衍生工作。其投影管线被证明是数据集无关的,可应用于TRQA、DeepSearchQA等可在原子事实层面分解的基准,促进了跨语料基准迁移研究。基于同一ClimbMix语料,NanoKnow等项目进一步探索了预训练与检索知识解耦的评估框架,而TREC RAG 2026已采纳该语料作为官方检索集合,推动了大型语料上检索与生成联合评估的标准化。此外,针对该基准暴露的检索瓶颈,研究者开始探索直接语料交互、布尔查询增强等新型检索范式,并发展出基于逐跳覆盖的细粒度评测指标,形成了围绕大规模自然语料构建智能体搜索评测的活跃研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务