遇见数据集

SARA-QASPER

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

SARA QASPER (reformatted) 是一个基于 QASPER 数据集重新格式化的科学论文问答数据集,用于支持 SARA(Selective and Adaptive Retrieval-augmented Generation with Context Compression)模型的训练与评估。该数据集包含两个配置:第一个是默认的 qa 配置,针对每个可回答的 QASPER 问题,提供问题、上下文、答案和问题类型等字段,其中上下文由 BM25 算法从论文中排序的段落组成(格式为“章节名 <文本>”),答案是从原始 QASPER 注释中提取的简短黄金答案(如文本片段、数值、短语或 yes/no)。训练集包含 2,321 条记录(来自官方训练论文),测试集包含 1,312 条记录(来自官方测试论文)。第二个是 compression_alignment 配置,用于投影器对齐预热阶段,包含从 QASPER 论文正文中提取的文本片段,训练集 22,111 条,验证集 200 条。该数据集继承自 allenai/qasper(Dasigi et al., NAACL 2021),基于 CC BY 4.0 许可证发布。在 SARA 模型中,模型在训练时使用链式思维推理后跟标记答案的方式进行回答,评估时提取标记跨度与答案进行比较。

SARA QASPER (reformatted) is a scientific paper question-answering dataset reformatted from the QASPER dataset, designed to support the training and evaluation of SARA (Selective and Adaptive Retrieval-augmented Generation with Context Compression) models. It contains two configurations: the default qa configuration, which provides question, context, answer, and question type fields for each answerable QASPER question, where the context consists of paragraphs ranked by BM25 from the paper (formatted as section name <text>), and answers are short gold answers extracted from original QASPER annotations (e.g., text spans, numbers, phrases, or yes/no). The training set has 2,321 records (from official training papers) and the test set has 1,312 records (from official test papers). The second compression_alignment configuration is used for projector alignment warm-up, containing text spans extracted from QASPER paper bodies, with 22,111 training records and 200 validation records. This dataset is derived from allenai/qasper (Dasigi et al., NAACL 2021) and released under the CC BY 4.0 license. In the SARA model, during training, the model answers using chain-of-thought reasoning followed by labeled answers, and during evaluation, extracted span tokens are compared with answers.

创建时间:
2026-07-23
原始信息汇总

SARA QASPER(重格式化)数据集概述

基本信息

  • 数据集名称:SARA QASPER(重格式化)
  • 许可证:CC BY 4.0
  • 语言:英语
  • 任务类别:问答(Question Answering)
  • 标签:检索增强生成、上下文压缩、科学论文

数据集来源与背景

该数据集是对 QASPER(Dasigi 等人,NAACL 2021)的重格式化版本,用于 SARA:Selective and Adaptive Retrieval-augmented Generation with Context Compression(ACL 2026,arXiv:2507.05633)研究。原始 QASPER 数据集基于 CC BY 4.0 许可证发布,本衍生数据集在相同许可证下发布并注明出处。

数据集配置

1. qa 配置(默认)

每个记录对应一个可回答的 QASPER 问题,包含以下数据划分:

  • 训练集:2,321 行(基于官方训练论文)
  • 测试集:1,312 行(官方测试论文)
字段 类型 描述
id str 行索引
example_id str 论文索引,用于防泄漏的文档级训练/开发集划分
question str QASPER 问题
context list[str] BM25 排序的论文上下文,格式为 "章节名 <文本>"
answer str 简短黄金答案(片段、数值、短语或是/否),作为训练目标和评估参考
choices null 未使用(保持与多选题数据集模式兼容)
question_type str 取值为 extractivefree_formyes_nounanswerable 之一

模型训练方式:模型以思维链方式输出推理过程,最终简短答案包裹在标签中:... 推理 ... <answer>简短答案</answer>;评估时提取标签内片段并与 answer 字段进行评分。

2. compression_alignment 配置

包含来自 QASPER 论文正文的文本片段,用于 SARA 投影器对齐预热阶段(投影器在问答微调前学习从语义压缩向量重构文档)。

  • 训练集:22,111 行
  • 验证集:200 行
  • 每条记录格式为 {"text": "<文档文本片段>"}

数据处理细节

  • context 字段由每篇论文的标题、摘要和章节构建,并按问题进行了 BM25 排序
  • 移除了 BIBREF 引用标记
  • 早期版本包含的 LLM 重写 answer_reformatted 字段已移除,当前以简短黄金答案 answer 作为唯一参考标准

文件校验和(SHA256)

文件 校验和
QASPER_train.jsonl 0ec3d1bbab2f85341a9432b263ca90669f5cfd45bb2163170cedddf8ff60742c
QASPER_test.jsonl a26afe8a11e350e5a860c83b75ee4938b2b89f19dc4883cea063dd90642bc1e1
QASPER_compression_alignment_train.jsonl 1d6386a84408127a20f01db92f8b9a73ec9499d884d0cab3c2c9f07c4494aa12
QASPER_compression_alignment_dev.jsonl 9de81c3cbf42aa4b4001a57762c37f981eb2ae0c5b468c3bfebffe65438f8a0f

引用信息

该数据集关联两篇论文:

  1. SARA(ACL 2026):Jin 等人提出的选择性自适应检索增强生成与上下文压缩方法
  2. QASPER(NAACL 2021):Dasigi 等人提出的研究论文问答数据集
搜集汇总
数据集介绍
SARA-QASPER 数据集图片
构建方式
SARA-QASPER数据集源于ACL 2026年录用的SARA研究,其构建基于对原始QASPER数据集的深度改造与精炼。该数据集以每篇论文为单位,通过BM25算法对论文的标题、摘要及章节内容进行检索排序,并将排序后的上下文片段以'章节名\t文本'的格式整合至context字段,同时剥离了引用标记。针对每个可回答的问题,数据集提供了标准短答案,并标注了问题类型(抽取式、自由形式、是非题或不可回答)。此外,为支撑SARA的投影器对齐预训练,数据集额外构建了压缩对齐配置,从论文正文中提取文本片段形成独立的训练与验证集。
特点
该数据集的核心特点在于其双配置设计,紧密贴合SARA的检索增强生成与上下文压缩框架。'qa'配置含训练集2321条、测试集1312条,每条数据包含问题、BM25排序的上下文、短答案及问题类型,且采用文档级划分确保泄漏安全。'compression_alignment'配置含训练集22111条、验证集200条,专为投影器学习从语义压缩向量重构文档而设。数据集还统一采用<answer>标签格式规范模型输出,便于评估阶段提取答案,同时去除了先前版本的LLM改写字段,以官方短答案为唯一参照,保障了数据纯净性。
使用方法
使用者可直接通过HuggingFace datasets库加载,指定配置名'qa'或'compression_alignment'即可获取相应数据。对于QA任务,模型需基于context字段中的BM25排序上下文进行推理,输出思维链后以<answer>标签包裹最终短答案,评估时提取标签内文本与标准答案比对。压缩对齐配置则用于SARA投影器的预训练阶段,输入为文档文本片段,训练目标是重建原始文档。该数据集亦可通过SARA仓库的快速启动脚本自动下载,便于复现实验或进一步开发检索增强生成相关研究。
背景与挑战
背景概述
SARA-QASPER数据集由Yiqiao Jin等研究者于2025年创建,旨在支持检索增强生成(RAG)中的上下文压缩研究,其核心源于ACL 2026论文《SARA: Selective and Adaptive Retrieval-augmented Generation with Context Compression》。该数据集对原始QASPER(Dasigi等人,NAACL 2021)进行了重构,针对可回答的问题生成单条记录,并引入BM25排序的篇章上下文,同时提供压缩对齐配置以训练语义压缩投影器,从而有效衔接检索与生成,推动了科学文献问答与高效信息检索的交叉发展,对RAG领域具有重要影响。
当前挑战
该数据集面临的挑战包括:领域层面,科学文献问答需处理复杂信息需求,涵盖抽取式、自由形式、是非判断及不可回答等多类型问题,并要求模型在长文档中精准定位答案;构建层面,需确保训练与测试分割的泄漏安全,通过文档级划分避免数据泄漏,同时需对原文进行去标记化处理(如去除BIBREF引文标记),并利用BM25进行上下文重排,以适配压缩感知的检索增强生成框架。
常用场景
经典使用场景
SARA-QASPER数据集为检索增强生成(RAG)与上下文压缩技术的研究提供了标准化的评测基准。其核心配置包含约三千余条可回答的科学论文问答对,每条样本集成了基于BM25算法检索得到的论文分节上下文与对应的短答案标注,并明确界定了抽取式、自由形式、是非判断及不可回答等多种问题类型。该数据集依托ACL 2026论文SARA,旨在模拟真实科研场景下信息寻求的开放性需求,尤其聚焦于评估模型在长文档中精准定位并压缩关键信息的能力,成为验证选择性上下文压缩算法有效性的关键平台。
解决学术问题
该数据集有效解决了科学文献问答中检索增强系统面临的上下文长度爆炸与信息冗余问题。传统RAG方法依赖整篇论文的嵌入表示,导致计算开销大且易引入噪声。SARA-QASPER通过提供与问题强相关的分节排序上下文,支持研究者探索如何在不损失关键信息的前提下,对上下文进行选择性压缩,显著降低推理成本并提升答案生成的准确性。其精细的问题类型划分,有助于诊断模型在不同推理难度上的表现短板,推动了面向长文档的语义压缩与自适应检索策略的理论发展。
衍生相关工作
基于SARA-QASPER,衍生出一系列探索上下文压缩感知的检索增强生成模型。SARA本身提出的投影器对齐机制,利用其compression_alignment子集预训练语义压缩向量,并通过端到端微调实现选择性剪切,为后续工作提供了基准范式。后继研究包括动态压缩比的自适应算法、基于强化学习的压缩策略,以及将压缩信号融入问答生成的联合训练方法。此外,该数据集常与QASPER原版及同类科学问答数据集组合使用,用于跨数据集泛化能力检验,催生了多篇关于长文档信息检索与生成协同优化的高水平论文。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务