遇见数据集

AetherSearch-Eval

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集是 Search-R1 的完整评估测试集,由 AetherSearch 项目提供,用于搜索增强的问答评估。它包含 51,713 个样本,来自七个问答基准数据集:2WikiMultiHopQA、Bamboogle、HotpotQA、MuSiQue、Natural Questions、PopQA 和 TriviaQA。数据以 Parquet 格式存储,保留了原始行顺序,是原版测试文件的精确副本,用于 AetherSearch 的全数据评估方案。用户需遵守 Search-R1 和各上游基准的许可条款。

This dataset is the complete evaluation test set for Search-R1, provided by the AetherSearch project, used for search-augmented question answering evaluation. It contains 51,713 samples from seven question answering benchmark datasets: 2WikiMultiHopQA, Bamboogle, HotpotQA, MuSiQue, Natural Questions, PopQA, and TriviaQA. The data is stored in Parquet format, preserving the original row order, and is an exact copy of the original test files for the full-data evaluation scheme of AetherSearch. Users must comply with the license terms of Search-R1 and each upstream benchmark.

创建时间:
2026-08-19
原始信息汇总

数据集概述

AetherSearch Search-R1 Full Evaluation Set 是一个用于 AetherSearch 全量数据评估的完整测试集,包含 51,713 行数据。该数据集是 PeterJinGo/nq_hotpotqa_train 中测试文件的精确、未修改镜像,主要用于问答(question-answering)任务。

基本信息

  • 语言:英语
  • 许可证:其他(other
  • 数据量:10K < n < 100K
  • 任务类别:问答

数据来源与分布

该数据集由多个上游 QA 基准合并而成,具体分布如下:

数据源 行数
2WikiMultiHopQA 12,576
Bamboogle 125
HotpotQA 7,405
MuSiQue 2,417
Natural Questions 3,610
PopQA 14,267
TriviaQA 11,313

文件与完整性

  • 文件test.parquet,包含全部 51,713 行
  • SHA-256 校验值30aa887b6d47e06e8c0f6f5307c88fe4e13461ac25a20ec0a5433ad7a4fe25dc
  • 评估清单保留了原始 parquet 行的顺序,并覆盖所有行,未使用任何抽样子集

溯源与许可说明

  • 文件来自官方 Search-R1 数据集发布,主要经由 RUC-NLPIR/FlashRAG_datasets 构建
  • 本镜像不声称对源数据集拥有所有权,也未授予新的许可证
  • 用户需遵循 Search-R1 及每个底层基准的条款
  • 上游 Hugging Face 仓库未声明统一的许可证,因此采用 license: other

使用方法

下载数据集后,设置本地路径:

bash export AETHERSEARCH_VALIDATION_DATA=/path/to/test.parquet

公共评估配方在评估前会验证文件的 SHA-256、总行数、各来源计数及完整行身份清单。

搜集汇总
数据集介绍
AetherSearch-Eval 数据集图片
构建方式
本数据集为AetherSearch全量评估套件的核心构成,系对Search-R1官方测试集的精确镜像,源自PeterJinGo/nq_hotpotqa_train仓库。其构建过程整合了多个上游问答基准,包括2WikiMultiHopQA、Bamboogle、HotpotQA、MuSiQue、Natural Questions、PopQA及TriviaQA,共计51,713条样本,经RUC-NLPIR/FlashRAG_datasets流水线汇聚而成。数据集以parquet格式存储,完整保留原始行序与全量行内容,未经过任何抽样或筛选,确保评估的全面性与代表性。
特点
该数据集兼具规模性与多样性,覆盖七类问答基准,涵盖多跳推理、事实性问答及开放域查询等多种任务形态,为检索增强生成(RAG)模型的综合评估提供了坚实基础。其数据来源清晰,溯源链条完整,从上游基准到合并过程均详细记录,增强了数据的可信度。此外,数据集提供SHA-256校验码及分源统计,支持严格的完整性验证,确保评估结果的可复现性。
使用方法
使用本数据集时,用户需从HuggingFace下载test.parquet文件,并通过环境变量AETHERSEARCH_VALIDATION_DATA指定其本地路径。AetherSearch评估配方在运行前会校验文件哈希值、总行数及各来源计数,确保数据未被篡改。用户可依据该数据集执行全量评估,无需额外采样,以获取模型在多样化问答任务上的全面性能表现。鉴于数据来源涉及多基准,使用者须遵守各上游数据集的许可条款。
背景与挑战
背景概述
AetherSearch-Eval数据集由AetherSearch项目于近期创建,旨在为检索增强生成(RAG)领域提供一套全面、可靠的评估基准。该数据集整合了多个知名的问答基准,包括2WikiMultiHopQA、HotpotQA、MuSiQue、TriviaQA等,共计51,713个样本,覆盖了从单跳事实查询到多跳推理的广泛任务类型。其核心研究问题在于如何构建一个能够真实反映检索系统在复杂信息需求下性能的评估框架,以推动检索模型和生成模型的协同优化。作为Search-R1全量评估方案的关键组成部分,AetherSearch-Eval为研究社区提供了标准化的数据基础设施,其影响力体现在为RAG模型的鲁棒性、泛化能力及跨域适应性的研究提供了可信的量化依据。
当前挑战
AetherSearch-Eval所面临的挑战首先在于其融合了多个上游数据源,这些数据源在问题风格、难度分布和标注一致性上存在显著差异,导致评估结果的解析与归因变得复杂,对模型的细粒度性能剖析提出了更高要求。其次,构建过程中需确保数据集的完整性与可复现性,包括维护原始行序、计算SHA-256哈希进行校验,以及处理上游许可不明确的问题。此外,如何在不引入采样偏差的前提下,保留全部样本用于评估,同时兼顾计算资源的效率,也是构建过程中需要精心权衡的难题。这些挑战共同考验着数据集在支撑公平、全面、可验证的RAG系统评估方面的能力。
常用场景
经典使用场景
AetherSearch-Eval 数据集作为 Search-R1 全量评估基准的核心测试集,广泛应用于检索增强生成(RAG)与多跳问答系统的性能评测。该数据集整合了多个主流问答基准(如 HotpotQA、Natural Questions、TriviaQA)的测试样本,共计 51,713 条,涵盖了单跳与多跳推理、事实验证、开放域问答等多样化任务。研究者借助该数据集可系统评估模型在复杂信息检索、证据融合及答案生成方面的综合能力,尤其适用于验证搜索-推理一体化模型(如 Search-R1)在真实场景下的鲁棒性与泛化性能。
实际应用
在实际应用中,该数据集常用于企业级知识库问答系统、智能搜索引擎以及学术文献辅助分析平台的性能调优。开发团队可借助其多领域样本(如 PopQA 的常识问答、2WikiMultiHopQA 的复杂推理)对系统进行压力测试,识别检索模块的召回瓶颈与生成模块的事实一致性缺陷。此外,数据集的完整清单便于自动化流水线集成,支持持续集成与部署(CI/CD)中的回归测试,保障产品迭代过程中问答质量的稳定性。
衍生相关工作
基于该数据集,研究者已衍生出一系列经典工作,包括检索重排序策略优化(如 Rerank-R1)、多跳推理路径压缩算法以及无检索器问答的蒸馏方法。同时,其与 FlashRAG 工具链的兼容性催生了多个高效评估框架,如针对长尾知识适配的微调方案。这些衍生研究不仅验证了 Search-R1 的训练有效性,还反向推动了上游基准确(如 HotpotQA、TriviaQA)的标注质量反思,形成了‘评估-改进-再评估’的良性学术循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务