ballast-evalsets
收藏资源简介:
Ballast eval sets 是一个用于评估模型事实性和幻觉程度的数据集,包含 50,147 个事实性问题。每个问题均配有标准答案、别名集合、7 个类型匹配的干扰项,以及可解析的 Wikidata 主题 Q-ID(其中 90.5% 的问题可链接到 Ballast T0 语料库)。数据来源包括 PopQA、自动生成的 Wikidata 子集、SimpleQA、Natural Questions (Open) 和 TriviaQA。数据模式包含 question_id、source、question、prop、subj、subj_qid、gold、gold_aliases、distractors、s_pop、pop_decile 等字段。该数据集主要用于对数概率选择评分:在同一提示下对标准答案和干扰项进行评分,通过长度归一化的答案对数概率取 argmax 得到预测,并基于 softmax 质量计算置信度,低于 0.5 时弃权。支持无语境和基于 T0 语料库的语境化两种条件进行两次评估,以计算“有语境增益”。数据集的 Wikidata 子集在构建过程中避免了网络污染,而其他子集的上游基准可能已被预训练数据暴露。各上游子集保留其原始许可证(PopQA/TriviaQA/NQ 为研究标准开放许可,SimpleQA 为 MIT),Wikidata 子集采用 CC0 许可证。该数据集还计划包含 halluc_probes 文件,涵盖 2-hop 组合、不可回答/错误前提问题等。
Ballast eval sets is a dataset for evaluating model factuality and hallucination degree, containing 50,147 factual questions. Each question is accompanied by a gold answer, a set of aliases, 7 type-matched distractors, and a resolvable Wikidata subject Q-ID (90.5% of questions can be linked to the Ballast T0 corpus). Data sources include PopQA, an automatically generated Wikidata subset, SimpleQA, Natural Questions (Open), and TriviaQA. The data schema includes fields such as question_id, source, question, prop, subj, subj_qid, gold, gold_aliases, distractors, s_pop, pop_decile, etc. This dataset is primarily used for log-probability selection scoring: scoring the gold answer and distractors under the same prompt, taking the argmax of length-normalized answer log-probabilities for prediction, and computing confidence based on softmax quality, with abstention below 0.5. It supports two evaluation conditions (no context and context based on the T0 corpus) to compute context gain. The Wikidata subset avoids web pollution during construction, while other upstream benchmarks may have been exposed to pre-training data. Each upstream subset retains its original license (PopQA/TriviaQA/NQ: standard research open license; SimpleQA: MIT), and the Wikidata subset uses CC0 license. The dataset also plans to include a halluc_probes file covering 2-hop combinations, unanswerable/mispremise questions, etc.
数据集概述
该数据集是 Ballast 评估集,包含两个探针集文件,用于支撑 Ballast 项目的测量工作。数据集总规模介于 10K 到 100K 条记录之间,语言为英文。
文件构成
| 文件 | 内容 | 规模 |
|---|---|---|
matrix_probes.parquet |
50,147 个事实性问答(召回)探针 | 50,147 条 |
halluc_probes.parquet |
43,137 个幻觉(超出召回范围)探针 | 43,137 条 |
数据来源与结构
召回探针 (matrix_probes) 基于五个来源构建:
- PopQA:主要工具,包含原生 subject Q-ids 和流行度信息
- Wikidata:从 T0 语料库自行生成,按排名分层,不受污染,可重新生成
- SimpleQA:根据答案类型与主题生成类型匹配的干扰项
- NQ_open:基于开放的自然问题,通过归一化 n-gram 匹配进行实体链接
- TriviaQA:通过维基标题提示和文本片段进行实体链接
幻觉探针 (halluc_probes) 包含四个测试族:
| 族 | 数量 | 测试内容 |
|---|---|---|
hop2 |
24,320 | 自生成的 2 跳组合问题(如“这部电影导演出生在哪里?”),答案仅存在于两条证据线的连接中;包含 3,200 个对抗性子集 |
unanswerable |
12,000 | 9,600 个“属性缺失”+ 2,400 个“错误前提”,所有候选答案均为假 |
wikimulti |
6,000 | 2WikiMultiHopQA 的组合与推理问题,两跳均实体链接 |
truthfulqa |
817 | TruthfulQA mc1,作为对照组 |
核心发现
- 在全部 21 个族×模型单元读数中,接地(grounding)使多跳幻觉降低 3–20 倍,且随语料库层级单调变化
- 在不可回答探针上,随语料库覆盖率增加,捏造率反而上升(7 个单元全部一致)
- TruthfulQA 对照组不完美:7 个单元中仅 3 个在 2% 容差内
数据模式
两个文件均包含:question_id、source、question、prop、subj、subj_qid、gold、gold_aliases[]、distractors[]、s_pop、pop_decile。幻觉探针额外包含 family、subfamily、adversarial、bridge_qid 字段。
使用方式
采用对数概率选择评分:在相同提示下对正确答案和干扰项评分,预测结果为长度归一化答案对数概率的 argmax,置信度为该 argmax 的 softmax 质量,低于 0.5 则弃权。接地条件在 T0 的指定层级前置呈现主体的证据块(2 跳探针前置两跳的证据块)。两次传递(无语料库 / 全语料库)通过主体的排名桶精确组合到每个语料库层级。
污染立场
模型在预训练中已见过上游基准的来源。wikidata 召回探针和 hop2 组合通过构造不受污染(从语料库而非网络生成)。关键指标(接地 − 未接地差值)对污染是保守的:预训练暴露抬高了未接地的下限,缩小了测得的增益。
许可证
上游数据集保留各自许可证(PopQA/TriviaQA/NQ/2WikiMultiHopQA/TruthfulQA 为研究标准开放许可证;SimpleQA 为 MIT)。自生成的 wikidata 和 hop2 探针为 CC0 许可证。商业使用前需检查上游条款。




