repeated-context-qa-artifacts
收藏资源简介:
该数据集是“重复上下文长文档问答”研究的运行产物,旨在支持论文《文档结构是否仍有价值?一个针对重复上下文长文档问答的受控基准测试》。它系统比较了四种问答架构——平面全上下文提示(缓存感知)、朴素RAG、RAPTOR和GraphRAG(局部搜索)——在QASPER和NovelQA两个长文档问答基准上的性能。所有实验在固定设置下进行,使用统一的答案生成模型(gemini-3.1-flash-lite-preview)、共享的嵌入编码器(BGE-M3)、固定提示模板和一致的成本核算规则。数据集包含两部分核心内容:1) `run/`目录提供了主要研究的完整运行结果(N=5次重复),包括各架构的预测结果(如数据集、论文ID、问题ID、运行索引、问题、预测答案、检索块数、答案F1、证据F1和准确率等字段)、资源使用账本(记录输入/输出令牌、API调用、GPU时间等)以及嵌入成本校准数据;2) `analysis/`目录包含从运行数据衍生的确定性分析产物,如评分单元格、架构间显著性检验、成本分解(按架构和数据集)、盈亏平衡点分析、记忆控制实验和错误切片统计。数据集适用于长文档问答、检索增强生成(RAG)架构评估和基准测试分析等任务,基于CC-BY-4.0许可证发布,问题文本源自QASPER和NovelQA基准(保留原许可条款),但不包含任何测试集的黄金答案。
数据集概述
该数据集是论文 "Does Document Structure Still Pay? A Controlled Benchmark for Repeated-Context Long-Document Question Answering" (B. Jonkhout, University of Twente, 2026) 的运行产物(Run Artifacts),用于复现论文中的所有数字、表格和图表。
数据集内容
核心运行数据 (run/)
包含一个完整的主研究运行(N=5次重复)的所有数据,具体文件如下:
| 文件名 | 描述 |
|---|---|
run_manifest.json |
运行标识符、模型检查点、条目数量、完成状态 |
flat_predictions.jsonl |
扁平全上下文提示架构的预测结果,字段包括:dataset, paper_id, question_id, run_index, question, predicted_answer, retrieved_chunks_count, answer_f1, evidence_f1, accuracy |
naive_rag_predictions.jsonl |
Naive RAG架构的预测结果,架构与flat相同 |
raptor_predictions.jsonl |
RAPTOR架构的预测结果,架构与flat相同 |
graphrag_predictions.jsonl |
GraphRAG(局部搜索)架构的预测结果,架构与flat相同 |
ledger.jsonl |
每次调用的资源日志:未缓存/缓存输入token、输出token、API调用、本地嵌入的GPU秒数、阶段标签(构建 vs 回答),所有成本核算的基础 |
embedding_cost_calibration.json |
本地BGE-M3嵌入项的GPU时间校准数据 |
衍生分析数据 (analysis/)
包含确定性分析产物,具体文件如下:
| 文件名 | 描述 |
|---|---|
scored_cells.jsonl |
按(架构, 问题)分组的评分单元格,连接预测结果与黄金评分,是生成所有表格的输入数据 |
significance.json |
聚类配对自助法比较结果,涵盖所有6个架构对(每个数据集10,000次重采样,固定种子),包含原始和Holm调整后的p值 |
cost_per_arch.json / cost_by_dataset.json |
按架构(以及按工作负载)的部署成本分解,包含存储占用 |
breakeven.json / breakeven_by_dataset.json |
每个数据集在两种价格牌下的盈亏平衡密度N*(每架构) |
memorization_control.json |
闭书控制实验:两个工作负载的基线精度和每架构的阅读提升 |
error_slices.jsonl / error_slices_summary.json |
RQ2错误切片普查:按方面的精度、粒度桶、假缺失和弃权计数 |
novelqa_nocontext_predictions.jsonl / qasper_nocontext_predictions.jsonl |
闭书(无文档)控制实验的预测结果 |
基准实验设计
该基准比较了四种QA架构:
- 扁平全上下文提示(缓存感知)
- Naive RAG
- RAPTOR
- GraphRAG(局部搜索)
在 QASPER 和 NovelQA 两个数据集上进行测试,所有实验使用:
- 固定回答器:
gemini-3.1-flash-lite-preview - 共享嵌入编码器:BGE-M3
- 每任务格式使用统一提示模板
- 统一的成本核算规则
评分说明
- NovelQA的黄金标签由Codabench托管,不包含在此数据集中,其准确率通过Codabench提交预测结果获得
- QASPER使用官方Answer-F1评分器本地评分
许可与来源
- 本数据集采用 CC-BY-4.0 许可
- 问题文本来源于 QASPER (CC-BY-4.0) 和 NovelQA 基准,保留其原始条款
- 不包含保留拆分的黄金答案
- 模型输出通过提供商API生成,配置记录在
run_manifest.json中
相关资源
配套代码仓库:https://github.com/BCJonkhout/msc-thesis-code




