遇见数据集

Q2D-Web

收藏
arXiv2026-09-08 更新2026-09-10 收录
官方服务:

资源简介:

Q2D-Web(Query2Doc-Web)是由Perplexity AI构建的大规模智能体检索基准,包含约1.9亿文档的网页语料库和约7万条经智能体重写的搜索查询,覆盖十种语言,采样自九个月的无个人识别信息生产流量。数据集创建过程包括查询采样、语料库构建、多源相关性标注(结合智能体引用、生产排序及LLM判断)以及子语料库采样以支持高效评估。该基准旨在评估生产级RAG系统中第一阶段检索器的深度召回能力,弥补现有基准在规模、查询类型和标注深度上的不足,为智能体检索研究提供更真实、更全面的测试平台。

Q2D-Web (Query2Doc-Web) is a large-scale intelligent retrieval benchmark developed by Perplexity AI. It comprises a web corpus with approximately 190 million documents and around 70,000 search queries intelligently rewritten by AI agents, covering ten languages and sampled from nine months of production traffic free of personally identifiable information (PII). The dataset creation process includes query sampling, corpus construction, multi-source relevance annotation (integrating AI agent citations, production ranking results, and LLM judgments), as well as sub-corpus sampling to support efficient evaluation. This benchmark is designed to evaluate the deep recall capability of first-stage retrievers in production-grade Retrieval-Augmented Generation (RAG) systems, addressing the shortcomings of existing benchmarks in terms of scale, query types, and annotation depth, and providing a more realistic and comprehensive testbed for intelligent retrieval research.

提供机构:
Perplexity AI
创建时间:
2026-09-08
搜集汇总
数据集介绍
Q2D-Web 数据集图片
构建方式
Q2D-Web的构建遵循一个严谨的四阶段流水线。首先,从九个月的匿名生产流量中,通过分层抽样获得约7万条由LLM智能体重写的中继查询,涵盖十个语种,并剔除含个人身份信息及重复项。其次,基于这些查询,利用生产检索系统为每条查询拉取前5000篇文档,合并后采用MinHash-LSH去重,构建出约1.9亿篇文档的大型网络语料库,并以文本最长的文档作为类代表。再者,从引用、生产排名及LLM评判三个独立源派生出二元相关性判断集,以降低单一标注源的偏差。最后,通过倒排融合采样策略,构造了以31.7%语料规模保持全语料系统排序的评估子集。
使用方法
Q2D-Web主要针对大规模RAG流水线中初段检索器的深度召回评估。研究者可采用共识的Recall@1000为主要指标,辅以Recall@100与nDCG@10,在完整语料或RRF子集上对词汇、稠密及后交互模型进行基准测试。由于包含多套标签集,对比不同评判源下的表现,可有效衡量检索器的稳定性与源偏差鲁棒性。为保持基准时效并规避数据污染,原始语料与查询及判断集不公开,但社区可通过公开的排行榜提交开放权重模型,以获得针对该私有基准的性能验证,推动代理式检索研究的进展。
背景与挑战
背景概述
Q2D-Web是由Perplexity AI的研究团队于2026年推出的大规模智能体检索基准,旨在评估生产环境中第一阶段的检索器。该数据集基于九个月的真实用户查询构建,包含约1.9亿篇网页文档和约7万个由智能体改写后的多语言查询,并提供了基于引用、生产排名及大语言模型标注的三套相关性判断。其核心研究问题在于填补现有基准在规模、查询类型和标注深度上的空白,为智能体RAG系统提供更为真实和全面的评测,对该领域的发展具有重要的推动意义。
当前挑战
Q2D-Web面临的挑战主要来自三个方面:其一,大规模语料库上的检索评测计算代价高昂,单次全语料评测需要数千GPU小时,限制了社区参与;其二,现有基准的查询多为人工撰写,与智能体改写后的查询分布存在差异,且支持查询的召回性能普遍低于主查询;其三,构建过程中需应对大规模去重、多语言处理以及避免单一标注源引入偏置等复杂问题。此外,为确保基准的有效性,必须防范训练数据污染,这要求对数据集进行保密管理。
常用场景
经典使用场景
Q2D-Web作为大规模智能体检索基准,其经典使用场景聚焦于评估生产级检索增强生成(RAG)系统中第一阶段的检索器性能。该数据集包含约1.9亿篇网络文档和约7万条由智能体重写后的多语言查询,覆盖十种语言,并基于真实用户会话生成。研究者能够利用其深度相关性标注(平均每查询99.6个正例)在全面且接近真实的网络规模环境下测试词法、稠密及晚期交互等不同检索模型,尤其关注Recall@1000等深层召回指标。其构造过程融入了生产环境的查询改写特性,成为衡量实际部署中检索器鲁棒性的可靠平台。
解决学术问题
该数据集解决了现有信息检索基准在规模与深度标注上的双重缺失。传统基准如MS MARCO或TREC DL受限于文档集与查询数量,无法反映生产级RAG中智能体改写查询的分布,而Q2D-Web通过整合1.9亿文档与7万查询,同时提供从引用、排位及LLM判别三种来源构建的标注,显著减少假阴性。它支持在严格控制混淆因素下,检验检索器在不同主题、语言及查询类型间的泛化能力,揭示模型排序随环境和标签源变化的规律,为大规模检索实验设计提供了更科学的方法论基础。
实际应用
在实际应用中,Q2D-Web主要服务于多阶段检索管线的优化与部署决策。企业可参照其对不同规模稠密模型及晚期交互模型的基准测试结果,选择在特定语言或领域上表现最优的检索器,并配置候选集大小与重排策略。此外,其子语料采样方法使开发者在约三分之一文档量下即可高效迭代,节省数千GPU小时的计算资源,适用于快速验证新模型性能,并在持续集成流程中监控检索质量,防范数据污染引起的性能高估,从而保障大规模RAG系统的稳定与可信。
数据集最近研究
最新研究方向
Q2D-Web数据集的最新研究方向聚焦于代理检索增强生成(Agentic RAG)系统中第一级检索器的大规模评估,突破了传统基准在语料库规模、查询数量与相关性标注深度上的局限。该研究依托约1.9亿文档的网页语料库与近7万条由真实用户查询重构的智能体查询,覆盖十种语言,并通过引入多源相关性判断集合(包括智能体引用、生产系统排名及大语言模型标注的联合集),有效减少标注偏差与假阴性问题。当前研究趋势着力于深召回协议下对词汇检索、稠密向量与后期交互模型的系统性对比,探索跨主题领域、查询语言及查询类型的性能差异,同时研究子语料采样策略,以实现规模化评估的高效性与保真度。这一前沿方向不仅为生产级RAG系统的检索组件建立了可复现的评测范式,也为多语言、多模态信息检索在复杂交互场景中的鲁棒性评估奠定了基础,推动了检索技术在智能体应用中的可信部署。
相关研究论文
  • 1
    Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG SystemsPerplexity AI · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务