遇见数据集

repeated-context-qa-artifacts

收藏
Hugging Face2026-07-05 更新2026-07-06 收录
官方服务:

资源简介:

该数据集是“重复上下文长文档问答”研究的运行产物,旨在支持论文《文档结构是否仍有价值?一个针对重复上下文长文档问答的受控基准测试》。它系统比较了四种问答架构——平面全上下文提示(缓存感知)、朴素RAG、RAPTOR和GraphRAG(局部搜索)——在QASPER和NovelQA两个长文档问答基准上的性能。所有实验在固定设置下进行,使用统一的答案生成模型(gemini-3.1-flash-lite-preview)、共享的嵌入编码器(BGE-M3)、固定提示模板和一致的成本核算规则。数据集包含两部分核心内容:1) `run/`目录提供了主要研究的完整运行结果(N=5次重复),包括各架构的预测结果(如数据集、论文ID、问题ID、运行索引、问题、预测答案、检索块数、答案F1、证据F1和准确率等字段)、资源使用账本(记录输入/输出令牌、API调用、GPU时间等)以及嵌入成本校准数据;2) `analysis/`目录包含从运行数据衍生的确定性分析产物,如评分单元格、架构间显著性检验、成本分解(按架构和数据集)、盈亏平衡点分析、记忆控制实验和错误切片统计。数据集适用于长文档问答、检索增强生成(RAG)架构评估和基准测试分析等任务,基于CC-BY-4.0许可证发布,问题文本源自QASPER和NovelQA基准(保留原许可条款),但不包含任何测试集的黄金答案。

创建时间:
2026-07-02
原始信息汇总

数据集概述

该数据集是论文 "Does Document Structure Still Pay? A Controlled Benchmark for Repeated-Context Long-Document Question Answering" (B. Jonkhout, University of Twente, 2026) 的运行产物(Run Artifacts),用于复现论文中的所有数字、表格和图表。

数据集内容

核心运行数据 (run/)

包含一个完整的主研究运行(N=5次重复)的所有数据,具体文件如下:

文件名 描述
run_manifest.json 运行标识符、模型检查点、条目数量、完成状态
flat_predictions.jsonl 扁平全上下文提示架构的预测结果,字段包括:dataset, paper_id, question_id, run_index, question, predicted_answer, retrieved_chunks_count, answer_f1, evidence_f1, accuracy
naive_rag_predictions.jsonl Naive RAG架构的预测结果,架构与flat相同
raptor_predictions.jsonl RAPTOR架构的预测结果,架构与flat相同
graphrag_predictions.jsonl GraphRAG(局部搜索)架构的预测结果,架构与flat相同
ledger.jsonl 每次调用的资源日志:未缓存/缓存输入token、输出token、API调用、本地嵌入的GPU秒数、阶段标签(构建 vs 回答),所有成本核算的基础
embedding_cost_calibration.json 本地BGE-M3嵌入项的GPU时间校准数据

衍生分析数据 (analysis/)

包含确定性分析产物,具体文件如下:

文件名 描述
scored_cells.jsonl 按(架构, 问题)分组的评分单元格,连接预测结果与黄金评分,是生成所有表格的输入数据
significance.json 聚类配对自助法比较结果,涵盖所有6个架构对(每个数据集10,000次重采样,固定种子),包含原始和Holm调整后的p值
cost_per_arch.json / cost_by_dataset.json 按架构(以及按工作负载)的部署成本分解,包含存储占用
breakeven.json / breakeven_by_dataset.json 每个数据集在两种价格牌下的盈亏平衡密度N*(每架构)
memorization_control.json 闭书控制实验:两个工作负载的基线精度和每架构的阅读提升
error_slices.jsonl / error_slices_summary.json RQ2错误切片普查:按方面的精度、粒度桶、假缺失和弃权计数
novelqa_nocontext_predictions.jsonl / qasper_nocontext_predictions.jsonl 闭书(无文档)控制实验的预测结果

基准实验设计

该基准比较了四种QA架构:

  • 扁平全上下文提示(缓存感知)
  • Naive RAG
  • RAPTOR
  • GraphRAG(局部搜索)

QASPERNovelQA 两个数据集上进行测试,所有实验使用:

  • 固定回答器:gemini-3.1-flash-lite-preview
  • 共享嵌入编码器:BGE-M3
  • 每任务格式使用统一提示模板
  • 统一的成本核算规则

评分说明

  • NovelQA的黄金标签由Codabench托管,不包含在此数据集中,其准确率通过Codabench提交预测结果获得
  • QASPER使用官方Answer-F1评分器本地评分

许可与来源

  • 本数据集采用 CC-BY-4.0 许可
  • 问题文本来源于 QASPER (CC-BY-4.0) 和 NovelQA 基准,保留其原始条款
  • 不包含保留拆分的黄金答案
  • 模型输出通过提供商API生成,配置记录在 run_manifest.json

相关资源

配套代码仓库:https://github.com/BCJonkhout/msc-thesis-code

搜集汇总
数据集介绍
repeated-context-qa-artifacts 数据集图片
构建方式
该数据集源自题为“Does Document Structure Still Pay? A Controlled Benchmark for Repeated-Context Long-Document Question Answering”的硕士论文研究成果,旨在系统评估四种长文档问答架构在重复上下文场景下的表现。数据集构建过程严格遵循控制变量原则:固定使用同一语言模型(Gemini-3.1-flash-lite-preview)作为答案生成器,统一采用BGE-M3作为嵌入编码器,并为每种任务格式设定相同提示模板。研究选取QASPER与NovelQA两大基准数据集,分别对扁平全上下文提示、Naive RAG、RAPTOR及GraphRAG四种架构进行对比实验。所有预测结果、资源消耗记录及衍生分析文件均以JSONL或JSON格式存储,确保论文中每个数字、表格和图表均可通过配套代码仓库中的脚本确定性复现。
特点
该数据集最显著的特点在于其完整性与可复现性。数据集不仅包含四种问答架构在两次运行中的原始预测结果(含F1分数、准确率等评估指标),还记录每次API调用的资源明细,包括输入/输出令牌数、缓存状态、API调用次数以及本地嵌入计算的GPU耗时,为成本分析提供精确依据。此外,数据集提供衍生分析产物,如配对自助法显著性检验结果、各架构部署成本分解、盈亏平衡密度分析以及错误切片统计数据,支持从性能、成本、鲁棒性等多维度深入比较。特别的是,数据集还包含无文档背景的封闭式对照预测,用于量化各架构从文档中提取信息的能力。
使用方法
用户可通过运行配套代码仓库中的脚本,直接利用本数据集重现论文中的全部表格与图表。使用流程包括:首先加载相应架构的预测文件(如`flat_predictions.jsonl`),结合黄金标准标注计算评估指标;其次调用`analysis/`目录下的分析脚本生成显著性检验、成本分解等统计结果。对于QASPER数据集,可使用官方Answer-F1评分器进行本地评分;而NovelQA的黄金标签需通过Codabench平台提交预测结果获取。所有文件均采用标准JSONL格式,易于解析与集成到自定义分析流程中。数据集采用CC-BY-4.0许可证发布,但需注意原始问题文本源自QASPER与NovelQA基准,需遵守其各自使用条款。
背景与挑战
背景概述
该数据集源自B. Jonkhout于2026年在特温特大学完成的硕士论文,旨在系统评估重复上下文长文档问答场景下多种架构的性能。研究聚焦于文档结构对问答系统的影响,通过统一控制答案器、嵌入编码器、提示模板和成本核算规则,对扁平全上下文、朴素RAG、RAPTOR及GraphRAG四种架构在QASPER和NovelQA基准上进行了公平比较。数据集提供了完整的运行记录与分析产物,涵盖预测结果、资源成本、显著性检验与错误分析等,为长上下文检索增强生成领域提供了可复现的标准化评估框架,推动了面向结构化文档的问答系统研究。
当前挑战
当前数据集所应对的核心挑战在于长文档问答中重复上下文带来的语义冗余与结构干扰,这要求模型在大量重复信息中精准定位事实性答案。同时,构建过程中面临多维挑战:需统一多种异构架构的实验条件(如同参数设置、相同提示模板),确保对比公平;需要处理NovelQA的黄金标签保密限制,依赖Codabench提交进行准确率评估;还需建立细粒度的成本核算模型,涵盖API调用、GPU加速及存储开销,以支持不同部署场景的性价比分析。
常用场景
经典使用场景
在长文档问答的研究领域中,Repeated-Context Long-Document QA 数据集作为一个受控基准测试平台,为评估不同检索增强生成架构在处理重复上下文时的鲁棒性提供了标准化的实验范式。该数据集通过精心设计的实验配置,统一了问答模型、嵌入编码器、提示模板及成本核算规则,使得研究者能够在消融条件下公平比较平面全上下文提示、朴素RAG、RAPTOR及GraphRAG四种代表性架构的性能表现。其核心设计理念在于揭示文档结构对长文本问答系统的影响机制,特别是当关键信息在文档中多次出现时,不同检索策略如何影响答案的准确性和证据召回率。这一基准测试不仅适用于学术研究中的算法对比,更为工业界在构建长文档智能问答系统时提供了可靠的评估框架。
实际应用
在实际应用场景中,该数据集所涉及的技术路线直接服务于企业知识库问答、法律文档审查、医学文献分析及学术论文摘要生成等需要处理超长文本的专业领域。金融机构可利用类似架构对包含重复条款的合同文档进行智能问答,显著提升合规审查效率;法律事务所能够基于该基准评估的工具链快速定位多源法律文书中冲突条款的关联性;医疗研究机构则可通过优化后的检索增强系统从海量论文中提取循证医学证据。数据集提供的成本核算框架使企业能够预先评估不同部署方案(如本地嵌入与云端API调用组合)的经济可行性,为实际系统选型提供量化决策依据。
衍生相关工作
该数据集衍生出的系列工作包括但不限于:基于重复上下文检测的文档预处理器,该模块能够自动识别并压缩冗余信息以提升检索效率;面向长文本问答的成本感知架构搜索方法,通过贝叶斯优化在检索深度与生成质量之间寻找帕累托最优解;以及融合层次化摘要的迭代式RAG系统,该工作借鉴了数据集中RAPTOR架构的分层思想,进一步扩展了树状检索结构的适用性。此外,该数据集还催生了关于问答系统记忆效应的控制实验范式,相关工作利用其提供的闭卷基准数据揭示了不同架构在信息提取与知识记忆之间的能力边界,为设计更可靠的混合推理模型提供了理论指导。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务