said-rag-eval-benchmark
收藏资源简介:
SAID RAG评估基准(v1.1)是一个包含75个单元的基准测试,用于研究RAG(检索增强生成)管道评估输出的无监督度量可靠性过滤。该基准测试包含10个由LLM(大型语言模型)评判的指标,旨在检测表面混淆因素。数据集包含来自5个源数据集(HotpotQA、MS MARCO、WikiQA、PubMedQA、FinQA)的100个问题样本,使用5种生成器(Claude-Sonnet-4.6、GPT-5、Gemini-2.5-Pro、Llama-3.1-8B-Instruct、Qwen3-8B)和3种前沿评判模型(Claude-Sonnet-4.6、GPT-5、Gemini-2.5-Pro)生成的数据。每个单元包含32种管道配置,总计240,000个答案记录和2.4M个度量值。数据集适用于研究LLM评判中的系统性偏差、无监督度量聚合过滤的基准测试以及新RAG评估方法的压力测试。数据集不包含原始问题文本、真实答案或上下文文本,用户需从源数据集中获取这些信息并与之关联。
SAID RAG Evaluation Benchmark (v1.1) is a 75-unit benchmark developed to investigate the reliability filtering of unsupervised metrics for evaluating Retrieval-Augmented Generation (RAG) pipeline outputs. This benchmark incorporates 10 LLM-judged metrics aimed at detecting surface-level confounding factors. The dataset encompasses 100 question samples sourced from five benchmark datasets: HotpotQA, MS MARCO, WikiQA, PubMedQA, and FinQA. Data was generated using 5 generation models (Claude-Sonnet-4.6, GPT-5, Gemini-2.5-Pro, Llama-3.1-8B-Instruct, Qwen3-8B) and 3 state-of-the-art LLM judging models (Claude-Sonnet-4.6, GPT-5, Gemini-2.5-Pro). Each unit includes 32 pipeline configurations, resulting in a total of 240,000 answer records and 2.4 million metric values. This dataset is applicable for researching systematic biases in LLM-based evaluations, benchmarking unsupervised metric aggregation and filtering, and stress-testing novel RAG evaluation methodologies. The dataset does not contain original question texts, ground-truth answers, or context passages; users are required to obtain and link these resources from the corresponding source datasets.
SAID RAG Evaluation Benchmark (v1.1) 数据集详情
数据集概述
该数据集是一个包含 75 个单元格 的 RAG 流水线评估基准,拥有 10 个由 LLM 评分的指标,专为研究 无监督指标可靠性过滤 而设计,用于 LLM 评判的 RAG 评估。该数据集是 NeurIPS 2026 评估与数据集轨道投稿的配套成果。
数据集规模
- 总样本量: 100K < n < 1M
- 构成:
- 5 个数据集: HotpotQA、MS MARCO、WikiQA、PubMedQA、FinQA(每个数据集采样 100 个问题,种子为 42)
- 5 个生成器: Claude-Sonnet-4.6、GPT-5、Gemini-2.5-Pro、Llama-3.1-8B-Instruct、Qwen3-8B
- 3 个前沿评判模型: Claude-Sonnet-4.6、GPT-5、Gemini-2.5-Pro
- 每个单元格 32 条流水线: 5 个检索器 × 多种深度 × 4 种提示风格,外加 2 条对抗性打乱检索流水线
- 总计: 240,000 条答案记录,在 240 万个指标值 上评分
任务与标签
- 任务类别: 问答、文本检索
- 语言: 英语
- 标签: RAG、检索增强生成、评估、基准、以 LLM 作为评判
数据内容与版本
v1.1(当前版本)
| 文件/文件夹 | 大小 | 内容 |
|---|---|---|
metric_scores_compact.json |
~19 MB | 75 个单元格 × 32 条流水线 × ~100 个样本的所有指标分数 + 答案长度 |
human_eval_annotations.xlsx |
~2 MB | 三位标注者 × 720 个条目(Krippendorffs α = 0.980) |
raw/stage_a/ |
~5 MB | 25 个经过编辑的 Stage A 文件(LLM 答案,无指标分数) |
raw/stage_b/ |
~20 MB | 75 个经过编辑的 Stage B 文件(LLM 答案 + 每个评判模型的指标分数) |
v1.0(先前版本)
与 v1.1 相同,但缺少 raw/ 目录。
数据模式
metric_scores_compact.json 结构
python { "metadata": { "n_cells": 75, "datasets": [...], "generators": [...], "judges": [...], "metric_names": [...] }, "cells": [ { "dataset": "HotpotQA", "generator": "...", "judge": "...", "n_answers_total": 3200, "pipelines": { "bm25_top5_direct": { "n_samples": 100, "answer_length_stats": {...}, "answer_lengths": [...], "metric_scores": { "faithfulness": [...], "gt_judge": [...] } } } } ] }
raw/ 目录内容
每个记录包含:
sample_id: 源数据集的稳定标识符pipeline,generator,retriever,chunk_spec,prompt_style: 流水线元数据answer: LLM 生成的答案failed: API 调用是否失败metric_scores(仅 Stage B): 10 个 LLM 评判指标 + gt_judge 预言judge(仅 Stage B): 产生指标分数的前沿 LLM
每个记录不包含:
- ❌
question(原始数据集文本) - ❌
ground_truth/ 黄金答案(原始数据集文本) - ❌
contexts_text(检索到的段落) - ❌
gold_titles/context_titles(段落标题)
10 个 LLM 评判指标
- faithfulness(忠实度)
- hallucination_free(无幻觉)
- answer_relevancy(答案相关性)
- context_precision(上下文精确度)
- context_utilization(上下文利用率)
- completeness(完整性)
- conciseness(简洁性)
- coherence(连贯性)
- specificity(特异性)
- citation_quality(引用质量)
- gt_judge(黄金评判,作为预言)
许可信息
- 基准产物(紧凑指标分数、原始 LLM 答案、指标分数、人工评分): CC BY 4.0
- 原始问题/黄金答案/上下文: 未重新分发,每个源数据集保留其原始许可
| 源数据集 | 许可 | 来源 |
|---|---|---|
| HotpotQA | CC BY-SA 4.0 | https://hotpotqa.github.io/ |
| MS MARCO | MS MARCO 非商业许可 | https://microsoft.github.io/msmarco/ |
| WikiQA | MS 研究许可 | https://www.microsoft.com/en-us/research/publication/wikiqa-a-challenge-dataset-for-open-domain-question-answering/ |
| PubMedQA | MIT | https://pubmedqa.github.io/ |
| FinQA | MIT | https://finqasite.github.io/ |
预期用途与局限性
预期用途
- 研究 LLM 作为评判的评估中的系统性偏差
- 对无监督指标聚合过滤器进行基准测试
- 压力测试新的 RAG 评估方法论
- 审计现有的 RAG 评估框架(RAGAS、ARES、RAGChecker、DeepEval)
超出范围的使用
- 在这些答案上训练新的评判模型
- 仅检索器评估(基准围绕流水线级评估构建)
- 不考虑已知偏差,将高 LLM 评判分数视为真实正确性
局限性
- 5 个仅限英语的问答数据集
- LLM 评判可能与黄金评判预言共享偏差(通过 18 个单元格的人工研究得到了缓解但未消除)
- 75 个单元格中有 14 个在 SAID 下略有退化(主要是拒绝率高的 GPT-5)
文档化的偏差
- 长度偏差:
conciseness与答案长度的平均 Kendall τ 为 −0.53;与拒绝模板相关 - 拒绝模板偏差: GPT-5 在对抗性流水线上产生约 30% 的简短拒绝
- 领域特定的表面偏好:
coherence和conciseness在不同数据集上跟踪风格
数据连接
每个记录的 sample_id 是源数据集的原生 ID。用户需直接从相应来源获取原始数据集,然后在 sample_id 上进行连接。
| 数据集 | sample_id 格式 | 获取方式 |
|---|---|---|
| HotpotQA | 24 字符十六进制(如 5ac1b8ee5542994d76dccedc) |
https://hotpotqa.github.io/ |
| MS MARCO | 数字查询 ID | https://microsoft.github.io/msmarco/ |
| WikiQA | Q#### |
https://www.microsoft.com/en-us/research/publication/wikiqa-a-challenge-dataset-for-open-domain-question-answering/ |
| PubMedQA | PubMed ID | https://pubmedqa.github.io/ |
| FinQA | FinQA 训练分割中的序列 ID | https://finqasite.github.io/ |
维护信息
- v1.0: 指标分数 + 人工评估
- v1.1(当前): + 原始编辑后的答案(Stage A + Stage B)
- 作者承诺在发表后至少三年内维护此产物
- 勘误将以补丁版本发布;实质性扩展将以次要版本发布




