遇见数据集

SpecUBench

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

LLM-Specific Utility Benchmark (SpecUBench) 是一个专门用于衡量检索增强生成(RAG)中检索段落对特定 LLM 效用的基准测试。该基准测试打破了传统“相关段落对所有读者同样有用”的假设,而是为每个检索段落标注其对指定 LLM 的“黄金效用”——即该段落实际帮助模型生成正确答案的程度。数据来源于六个广泛使用的开放域问答/检索数据集:Natural Questions (NQ)、HotpotQA、TriviaQA、FEVER、MS MARCO 和 2WikiMultiHopQA。对于每个数据集,基准测试提供了查询、真实答案、由稠密检索器(BGE)检索的每个查询的 top-200 段落,以及针对四个 LLM(Qwen3-8B、Qwen3-14B、Qwen3-32B 和 Llama-3.1-8B-Instruct)的段落级黄金效用标签。数据以 JSONL 和 TREC qrel 格式存储,并包含完整的评估脚本(排名评估和集合评估)。该基准测试可用于训练或评估效用感知的检索器和重排序器,促进 RAG 系统中更精准的段落选择。

LLM-Specific Utility Benchmark (SpecUBench) is a benchmark specifically designed to measure the utility of retrieved passages for a specific LLM in Retrieval-Augmented Generation (RAG). It breaks the traditional assumption that relevant passages are equally useful to all readers, instead annotating each retrieved passage with its golden utility for a specified LLM—i.e., the degree to which the passage actually helps the model generate the correct answer. The data comes from six widely used open-domain question answering/retrieval datasets: Natural Questions (NQ), HotpotQA, TriviaQA, FEVER, MS MARCO, and 2WikiMultiHopQA. For each dataset, the benchmark provides queries, ground-truth answers, top-200 passages retrieved by a dense retriever (BGE) for each query, and passage-level golden utility labels for four LLMs (Qwen3-8B, Qwen3-14B, Qwen3-32B, and Llama-3.1-8B-Instruct). The data is stored in JSONL and TREC qrel formats, and includes complete evaluation scripts (ranking evaluation and set evaluation). This benchmark can be used to train or evaluate utility-aware retrievers and rerankers, promoting more accurate passage selection in RAG systems.

创建时间:
2026-08-19
原始信息汇总

LLM专用效用基准(SpecUBench)

SpecUBench是一个用于衡量检索增强生成(RAG)中检索段落LLM专用效用的基准数据集。该基准不假设"相关"段落对每个读者同样有用,而是标注每个检索段落对特定LLM的实际帮助程度——即该段落是否真正帮助模型生成正确答案。

核心特性

  • 效用定义:通过模型在有/无检索段落时的性能差异(精确匹配/F1分数)计算段落级黄金效用标签
  • 覆盖模型:Qwen3-8B、Qwen3-14B、Qwen3-32B、Llama-3.1-8B-Instruct
  • 许可协议:Apache License 2.0
  • 语言:英语

来源数据集

基准基于六个广泛使用的开放域问答/检索数据集:

数据集 类型 来源
Natural Questions (NQ) 开放域问答 KILT / DPR
HotpotQA 多跳问答 KILT / DPR
TriviaQA 开放域问答 KILT / DPR
FEVER 事实验证 KILT / DPR
MS MARCO 段落检索/问答 Microsoft MS MARCO
2WikiMultiHopQA (2WikiQA) 多跳问答 官方2WikiQA

每个数据集提供查询、标准答案,以及由稠密检索器(BGE,经Tevatron)检索出的每查询前200个段落。

数据内容与结构

UtilityBench/ ├── source_datasets/ # 查询、答案、检索段落、相关性判断 ├── Golden_utility_passage/ # 各模型的黄金效用段落标签 │ └── {model}_utility_passages.jsonl # 段落级效用标签 │ └── {model}_utility_passages_qrel.txt # TREC格式qrel文件 └── evaluation/ # 评估与显著性检验脚本及结果

  • source_datasets/:包含每数据集的查询(dev.jsonl)、标准答案(gt_answer.jsonl)、每查询前200个检索段落(top_200_passages.jsonl)及相关性判断文件
  • Golden_utility_passage/:JSONL文件携带段落级效用信号,配套的.txt文件以TREC qrel格式提供相同信息
  • evaluation/:包含基于排序和基于集合的评估脚本、精确匹配/F1计算脚本及统计显著性检验脚本

使用方式

黄金效用标签可直接用于训练或评估效用感知的检索器和重排序器。完整的标注与评估流程详见官方代码仓库,涵盖黄金效用标注、LLM专用效用判断方法及评估工具。

搜集汇总
数据集介绍
SpecUBench 数据集图片
构建方式
SpecUBench基准的构建根植于对检索增强生成(RAG)中段落效用的深层理解,它摒弃了传统相关性的单一视角,转而关注段落对特定大型语言模型(LLM)的实质助益。构建过程依托六个广泛采用的开域问答与检索数据集,涵盖Natural Questions、HotpotQA、TriviaQA、FEVER、MS MARCO及2WikiMultiHopQA,每个数据集均提供查询、标准答案以及由稠密检索器BGE检索得到的每查询前200篇段落。基准的核心在于针对多种LLM(如Qwen3系列及Llama-3.1-8B-Instruct)计算每篇段落的黄金效用标签,该标签通过对比模型在有、无该段落条件下的答案精确匹配度与F1分数差异获得,从而精准量化段落对模型回答的贡献程度。
特点
SpecUBench的独特之处在于其模型特定的效用标注,每个段落可能对不同LLM呈现差异化效用,这打破了传统检索相关性判断的通用性假设。基准提供了细粒度的段落级效用信号,以JSONL格式与TREC qrel格式双轨呈现,便于直接融入检索与重排序模型的训练或评估流程。此外,基准整合了六个语义丰富、难度各异的源数据集,覆盖单跳、多跳推理及事实验证等任务,为评测utility-aware检索器提供了全面且具挑战性的测试床。其评估体系内置了基于排名与集合的评测脚本及显著性检验工具,确保结果统计严谨,为研究段落效用与LLM能力间的复杂交互提供了坚实的数据基础。
使用方法
使用SpecUBench时,研究者可直接加载各数据集提供的黄金效用标签,将其作为训练utility-aware检索器或重排序器的监督信号,或作为评估现有检索效用的新维度。具体操作上,可依据JSONL文件中的段落级效用分数构建训练实例,或利用TREC格式的qrel文件进行标准化的检索评测。基准附带的评估脚本支持排名与集合两种评估模式,并可执行精确匹配与F1计算,便于对比不同模型在段落效用上的表现。对于需要完整复现效用标注过程的用户,官方仓库提供了从答案生成到效用计算的全套流程代码,允许针对其他LLM或数据集扩展效用标签,进而推动检索增强生成系统朝向模型感知、效用驱动的方向发展。
背景与挑战
背景概述
SpecUBench(LLM-Specific Utility Benchmark)是由Trustworthy Information Access团队于2024年构建的基准数据集,旨在衡量检索增强生成(RAG)中检索段落对特定大型语言模型(LLM)的效用。该基准基于六个广泛使用的开放域问答与检索数据集(如NQ、HotpotQA、TriviaQA、FEVER、MS MARCO和2WikiMultiHopQA),并为Qwen3-8B、Qwen3-14B、Qwen3-32B及Llama-3.1-8B-Instruct等模型提供逐段落的黄金效用标签。其核心创新在于摒弃传统“相关性”概念,转而定义“对特定LLM的实际帮助程度”,通过对比模型在有/无段落条件下的回答性能差异来计算效用。该数据集为效用感知的检索器与重排序器提供了训练与评估基础,推动了RAG系统向模型定制化方向发展,对信息检索与自然语言处理领域具有重要影响力。
当前挑战
SpecUBench所解决的领域问题在于传统检索评估指标(如相关性和精确率)未能反映段落对LLM回答的实际增益,导致检索结果与模型效用脱节。其挑战包括:1. 效用标签计算需对每个模型分别生成有/无段落条件下的回答,并计算EM/F1差异,计算开销巨大;2. 不同LLM对同一段落可能表现出迥异的效用,如何构建泛化性强的效用预测模型是一大难题;3. 构建过程中需整合六个来源数据集,处理格式差异与噪声,并确保检索段落集合的公平性;4. 评估涉及排序与集合两种范式,且需进行统计显著性检验,增加了评估流程的复杂性。
常用场景
经典使用场景
SpecUBench作为面向检索增强生成(RAG)的专用基准,其核心经典用法在于为给定查询和候选段落,针对特定大语言模型(LLM)标注细粒度的效用标签,以供研发人员训练或评估效用感知的检索器与重排序器。该基准融合六个广泛采用的开源问答与检索数据集,为不同参数规模的LLM(如Qwen3系列与Llama-3.1)提供段落级黄金效用标注,使研究者能够基于统一的评估脚本,系统性地衡量检索段落对模型答案生成的真实贡献度。
解决学术问题
该数据集直面传统相关性假设在RAG范式下的失配问题,即传统检索仅关注内容相关性而忽视段落对特定模型的实用性。通过引入模型专属效用度量,SpecUBench解决了如何量化检索结果对LLM推理实际助益的难题,为信息检索领域提供了从相关性导向转向效用导向的研究新视角,显著推动了效用感知检索与重排序算法的学术探索,并为跨模型泛化研究奠定了数据基础。
衍生相关工作
围绕SpecUBench衍生出一系列重要工作,包括基于效用标签训练新的检索损失函数以替代传统相关性排序,开发针对不同LLM的效用预测模型,以及构建跨数据集与跨模型的效用迁移研究。此外,该基准催生了显著性检验工具在检索评估中的应用,并启发了将效用概念引入多模态RAG或工具增强生成的探索,推动了信息检索与自然语言处理交叉领域的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务