遇见数据集

ballast-evalsets

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

Ballast eval sets 是一个用于评估模型事实性和幻觉程度的数据集,包含 50,147 个事实性问题。每个问题均配有标准答案、别名集合、7 个类型匹配的干扰项,以及可解析的 Wikidata 主题 Q-ID(其中 90.5% 的问题可链接到 Ballast T0 语料库)。数据来源包括 PopQA、自动生成的 Wikidata 子集、SimpleQA、Natural Questions (Open) 和 TriviaQA。数据模式包含 question_id、source、question、prop、subj、subj_qid、gold、gold_aliases、distractors、s_pop、pop_decile 等字段。该数据集主要用于对数概率选择评分:在同一提示下对标准答案和干扰项进行评分,通过长度归一化的答案对数概率取 argmax 得到预测,并基于 softmax 质量计算置信度,低于 0.5 时弃权。支持无语境和基于 T0 语料库的语境化两种条件进行两次评估,以计算“有语境增益”。数据集的 Wikidata 子集在构建过程中避免了网络污染,而其他子集的上游基准可能已被预训练数据暴露。各上游子集保留其原始许可证(PopQA/TriviaQA/NQ 为研究标准开放许可,SimpleQA 为 MIT),Wikidata 子集采用 CC0 许可证。该数据集还计划包含 halluc_probes 文件,涵盖 2-hop 组合、不可回答/错误前提问题等。

Ballast eval sets is a dataset for evaluating model factuality and hallucination degree, containing 50,147 factual questions. Each question is accompanied by a gold answer, a set of aliases, 7 type-matched distractors, and a resolvable Wikidata subject Q-ID (90.5% of questions can be linked to the Ballast T0 corpus). Data sources include PopQA, an automatically generated Wikidata subset, SimpleQA, Natural Questions (Open), and TriviaQA. The data schema includes fields such as question_id, source, question, prop, subj, subj_qid, gold, gold_aliases, distractors, s_pop, pop_decile, etc. This dataset is primarily used for log-probability selection scoring: scoring the gold answer and distractors under the same prompt, taking the argmax of length-normalized answer log-probabilities for prediction, and computing confidence based on softmax quality, with abstention below 0.5. It supports two evaluation conditions (no context and context based on the T0 corpus) to compute context gain. The Wikidata subset avoids web pollution during construction, while other upstream benchmarks may have been exposed to pre-training data. Each upstream subset retains its original license (PopQA/TriviaQA/NQ: standard research open license; SimpleQA: MIT), and the Wikidata subset uses CC0 license. The dataset also plans to include a halluc_probes file covering 2-hop combinations, unanswerable/mispremise questions, etc.

创建时间:
2026-07-31
原始信息汇总

数据集概述

该数据集是 Ballast 评估集,包含两个探针集文件,用于支撑 Ballast 项目的测量工作。数据集总规模介于 10K 到 100K 条记录之间,语言为英文。

文件构成

文件 内容 规模
matrix_probes.parquet 50,147 个事实性问答(召回)探针 50,147 条
halluc_probes.parquet 43,137 个幻觉(超出召回范围)探针 43,137 条

数据来源与结构

召回探针 (matrix_probes) 基于五个来源构建:

  • PopQA:主要工具,包含原生 subject Q-ids 和流行度信息
  • Wikidata:从 T0 语料库自行生成,按排名分层,不受污染,可重新生成
  • SimpleQA:根据答案类型与主题生成类型匹配的干扰项
  • NQ_open:基于开放的自然问题,通过归一化 n-gram 匹配进行实体链接
  • TriviaQA:通过维基标题提示和文本片段进行实体链接

幻觉探针 (halluc_probes) 包含四个测试族:

数量 测试内容
hop2 24,320 自生成的 2 跳组合问题(如“这部电影导演出生在哪里?”),答案仅存在于两条证据线的连接中;包含 3,200 个对抗性子集
unanswerable 12,000 9,600 个“属性缺失”+ 2,400 个“错误前提”,所有候选答案均为假
wikimulti 6,000 2WikiMultiHopQA 的组合与推理问题,两跳均实体链接
truthfulqa 817 TruthfulQA mc1,作为对照组

核心发现

  • 在全部 21 个族×模型单元读数中,接地(grounding)使多跳幻觉降低 3–20 倍,且随语料库层级单调变化
  • 在不可回答探针上,随语料库覆盖率增加,捏造率反而上升(7 个单元全部一致)
  • TruthfulQA 对照组不完美:7 个单元中仅 3 个在 2% 容差内

数据模式

两个文件均包含:question_idsourcequestionpropsubjsubj_qidgoldgold_aliases[]distractors[]s_poppop_decile。幻觉探针额外包含 familysubfamilyadversarialbridge_qid 字段。

使用方式

采用对数概率选择评分:在相同提示下对正确答案和干扰项评分,预测结果为长度归一化答案对数概率的 argmax,置信度为该 argmax 的 softmax 质量,低于 0.5 则弃权。接地条件在 T0 的指定层级前置呈现主体的证据块(2 跳探针前置两跳的证据块)。两次传递(无语料库 / 全语料库)通过主体的排名桶精确组合到每个语料库层级。

污染立场

模型在预训练中已见过上游基准的来源。wikidata 召回探针和 hop2 组合通过构造不受污染(从语料库而非网络生成)。关键指标(接地 − 未接地差值)对污染是保守的:预训练暴露抬高了未接地的下限,缩小了测得的增益。

许可证

上游数据集保留各自许可证(PopQA/TriviaQA/NQ/2WikiMultiHopQA/TruthfulQA 为研究标准开放许可证;SimpleQA 为 MIT)。自生成的 wikidatahop2 探针为 CC0 许可证。商业使用前需检查上游条款。

搜集汇总
数据集介绍
ballast-evalsets 数据集图片
构建方式
Ballast-evalsets数据集是基于Ballast测量框架构建的一组探针集,旨在系统评估大型语言模型在检索增强生成(RAG)场景下的事实性与幻觉表现。该数据集由两个核心文件构成:matrix_probes.parquet包含50,147个事实性问题,源自PopQA、自生成的Wikidata(从T0语料库中按排名分层生成)、SimpleQA、Natural Questions(开放版)和TriviaQA,每个问题均配有标准答案、别名集、7个类型匹配的干扰项,以及可解析的维基数据实体QID(整体链接率达90.5%)。halluc_probes.parquet包含43,137个幻觉探针,专注于超越回忆能力的复杂情景,其中98.3%的探针实现了实体链接,涵盖hop2多跳组合、不可回答问题(包括属性缺失和虚假前提)、2WikiMultiHopQA的推理问题及TruthfulQA的对照探针。
特点
该数据集的特点在于其精细的结构化设计与对抗性构造策略。每个探针均携带丰富的元数据,如问题ID、来源、属性、主语及其QID、答案、别名、干扰项、流行度分数及十分位数,便于进行细粒度的误差分析。其中,hop2子集包含3,200个对抗性样本,其竞争性连接路径的答案也出现在证据中,从而严格测试模型的推理鲁棒性。不可回答问题的设计确保所有候选答案均为错误,任何自信的预测均被视为虚构,这有效暴露了模型在证据缺失时的过度自信倾向。此外,自生成的Wikidata和hop2探针通过构造避免污染,确保了评估的纯净性,而多模型(Gemma-4、Qwen3.5)及量化(bf16/fp8/nf4)的交叉测量为量化压缩对事实性的影响提供了基准。
使用方法
该数据集的设计用途为对数概率选择评分法,即在统一提示下对金标答案和干扰项进行评分,预测为归一化长度后对数概率最高的选项,置信度通过softmax质量计算,低于0.5时触发弃权机制。在有依据条件下,会在问题前拼接主语在T0语料库中的证据块,对于双跳探针则拼接两跳的证据。通过两次推理(无语料/全语料)并利用主语的排名桶进行组合,可以精确地在任意语料水平上度量性能变化。使用前需注意上游数据集的许可限制(如PopQA等为研究用途开放,SimpleQA为MIT),自生成部分为CC0,但商业使用时需检查上游条款。
背景与挑战
背景概述
Ballast评估集由OpenBallast团队于2025年构建,旨在系统性地测度检索增强生成(RAG)框架中知识注入对模型事实性回答的影响。该数据集包含50,147个事实性回忆问题与43,137个幻觉探测问题,基于PopQA、SimpleQA、Natural Questions等公开基准融合生成,并通过Wikidata实体链接确保信息可追溯性。其核心研究问题在于量化不同语料库覆盖水平下,模型多跳推理与事实回忆能力的变化,尤其关注对无答案问题的谦逊弃权行为。该评估集为RAG系统的可靠性提供细粒度诊断工具,推动了事实性问答评估方法的精细化发展,成为该领域基准测试的重要参考。
当前挑战
所解决的领域挑战包括:传统问答基准难以区分模型真实知识提取与记忆复制,多跳问题因证据分散导致推理易失败,且无答案问题易诱发错误自信;数据集构建中融合多源数据需处理格式统一与实体链接的归一化问题,同时需防止预训练污染,确保生成的探测项无网络来源。评估显示,无答案探针的虚报率随语料覆盖上升,揭示了知识注入可能抑制正确弃权,而TruthfulQA对照显示部分模型对辅助信息不敏感,凸显评估信号在量化压缩下存在失效风险。
常用场景
经典使用场景
Ballast评测集作为检索增强生成(RAG)框架下的事实性与幻觉检测基准,其经典用途在于度量大型语言模型在知识密集型问答中的记忆检索与逻辑推理能力。该数据集包含超过五万条事实性回忆探针(如来自PopQA、Natural Questions、TriviaQA等源头)及四万三千余条幻觉探针(如多跳组合、不可回答及对抗性子集),以logprob选择评分和基于置信度的弃权机制为核心评估协议。研究者借此可系统考察模型在不同语料库覆盖水平下的回答准确性、幻觉倾向及知识溯源能力,其设计精巧地隔离了回忆与推理两个维度,成为评估生成模型可信度的标准工具。
实际应用
在实际应用中,Ballast评测集可服务于企业级知识库问答系统的开发与优化,尤其在金融、法律、医疗等事实准确性要求苛刻的领域。开发者可利用该数据集对RAG管线进行端到端压力测试,识别在复杂多跳查询或对抗性输入下系统自动生成虚假信息的薄弱环节。其提供的量化评分框架支持自动化的超参数调优,例如选择最优的语料库检索层级或置信度阈值,从而在推理成本与回答可靠性间取得平衡。此外,该数据集也适用于模型量化压缩场景,评测低比特部署下模型事实性的保持程度,为边缘设备上的可信AI应用提供质量保障依据。
衍生相关工作
基于Ballast评测集,衍生出多项引领性研究工作。其测量方法直接支撑了Ballast开源工具的验证,该工具能在推理阶段实时注入事实性证据,将多跳幻觉率降低三至二十倍。数据集中对不可问答探针的深入分析催生了关于'检索抑制正确弃权'现象的后续研究,促使学界重新审视RAG框架中证据注入的策略与时机。其分层语料库关联(T0)设计启发了新的基准构建范式,即从大规模知识语料中自主生成无污染测试集,这一思想已被多篇后续文献采纳。对TruthfulQA控制组的精细检验也推动了关于知识基准稳健性的方法论讨论,对评估协议的规范化产生积极影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务