遇见数据集

vigneshwar234/phantasm-hallucination-benchmark

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

PHANTASM幻觉基准数据集是PHANTASM框架的配套数据集,这是首个通过数学方法将大型语言模型(LLM)的幻觉、虚构和认知校准错误转化为生产性特征的机器学习系统。该数据集支持评估PHANTASM的三个核心支柱:HGT(幻觉边界检测)、CMN(虚构新颖性/合理性评分)和UC(不确定性校准)。具体包括以下分割:hgt_train(30个示例用于幻觉边界检测训练)、hgt_test(10个示例用于测试)、cmn_train(10个示例用于虚构新颖性和合理性评分)和uc_train(20个示例用于不确定性校准)。数据集涵盖多个领域(如历史、科学、医学),并提供标签如幻觉标签、新颖性分数、合理性分数和校准置信度等,旨在帮助研究者和开发者评估和改进LLM在生成文本时的可靠性、准确性和不确定性管理。

The PHANTASM Hallucination Benchmark is the companion dataset to the PHANTASM framework — the first ML system to mathematically invert LLM hallucination, confabulation, and epistemic miscalibration into productive features. This dataset supports evaluation of all three PHANTASM pillars: HGT (Hallucination boundary detection), CMN (Confabulation novelty/plausibility scoring), and UC (Uncertainty calibration). It includes splits such as hgt_train (30 examples for hallucination boundary detection training), hgt_test (10 examples for testing), cmn_train (10 examples for confabulation novelty and plausibility scoring), and uc_train (20 examples for uncertainty calibration). The dataset covers various domains (e.g., history, science, medicine) and provides labels like hallucination_label, novelty_score, plausibility_score, and calibrated_confidence, aiming to assist researchers and developers in evaluating and improving LLM reliability, accuracy, and uncertainty management in text generation.

提供机构:
vigneshwar234
搜集汇总
数据集介绍
vigneshwar234/phantasm-hallucination-benchmark 数据集图片
构建方式
PHANTASM Hallucination Benchmark 数据集是伴随 PHANTASM 框架诞生的专业化评估资源,旨在系统性地覆盖大语言模型幻觉现象的三大核心维度。该数据集被精心划分为四个子集:HGT 训练与测试集分别包含 30 与 10 个样例,用于检测模型输出中是否存在脱离事实的幻觉边界;CMN 训练集包含 10 个样例,用于评估模型捏造内容的创新性与内在自洽性;UC 训练集包含 20 个样例,专注于校准模型在不确定性条件下的置信度。每个样本均配备结构化标签,例如事实性参考、严重程度分级或贝叶斯不确定性指标,从而构建起一个多轴联动的评估体系。
特点
该数据集的核心特性在于其独特的逆向思维视角——不是回避大模型的典型失败模式,而是将其转化为可量化、可利用的特征。HGT 子集对模型生成文本中的忠实度进行二元标注,并引入领域与严重程度标签;CMN 子集通过新颖性得分(0-1)与合理性得分(0-1)双维度刻画模型虚构内容的品质;UC 子集则创新性地引入可靠性层级(晶体/固体/流体/蒸汽)这一隐喻性标签,将抽象的不确定性具象化为可操作的分级。这种设计使得数据点并非孤立的错误样本,而是构成一个关于模型认知局限性的结构化图谱。
使用方法
该数据集的使用极为轻量化,研究者可通过一行命令(pip install phantasm-llm)轻松接入 PHANTASM 框架。在评估流程中,HGT 子集适用于二分类任务,用以衡量模型区分忠实与虚构内容的能力;CMN 子集则适合回归型任务,预测模型输出相对于已知事实的新颖性与自洽程度;UC 子集支持校准曲线分析,对比模型原始置信度与校准后置信度之间的差异。所有数据均采用统一的 JSON 化结构,便于集成至现有的训练与评测管线,并兼容主流深度学习框架中的文本分类与问答任务接口。
背景与挑战
背景概述
PHANTASM Hallucination Benchmark由研究者Vignesh S于2025年创建,旨在评估大型语言模型(LLM)在生成内容时出现的幻觉、虚构与认知校准偏差。该数据集是PHANTASM框架的配套资源,该框架首次提出利用机器学习方法将LLM的失败模式(如幻觉)转化为可量化的有效特征。数据集覆盖幻觉边界检测、虚构新颖性评分与不确定性校准三大任务,通过精细的标注(如严重度分级、可靠性分层)为评估模型的知识边界提供了标准化基准。其发布推动了LLM可信性研究的发展,尤其对AI生成内容的可解释性与安全性评估具有重要参考价值。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,LLM在缺乏事实锚点时常产生表面合理但虚假的回应,即“幻觉”现象,而现有基准难以系统区分模型的忠实生成、合理虚构与错误臆造,阻碍了可靠AI的构建;2)构建过程中,人工标注幻觉和虚构的边界高度依赖领域专家与精细定义,例如“严重度”或“新颖性”的量化易受主观影响;同时,数据集规模仅有70个样本,限制了跨领域泛化能力与机器学习模型的充分训练。
常用场景
经典使用场景
在大语言模型迅猛发展的当下,幻觉现象成为制约其可靠性的核心瓶颈。PHANTASM Hallucination Benchmark 专为评估与检测模型幻觉而生,其经典使用场景聚焦于对模型生成文本的忠实度进行二元判别,通过提供包含微观历史、科学、医学等多领域的人工标注样本,精准区分忠实输出与幻觉内容。该基准不仅涵盖幻觉边界检测任务,还创新性地引入了对模型胡诌的新颖性与合理性评分,以及不确定性校准的评估机制,为多维度剖析大模型在知识边界上的失败模式提供了标准化测试平台。
解决学术问题
该数据集直面大语言模型中三个长期困扰学界的难题:幻觉、胡诌与认知偏差。在传统评估体系下,模型幻觉常被简单视为错误,而 PHANTASM 基准通过概率化建模首次实现了对这些失败模式的逆向解析与特征转化。它解决了如何量化模型在未知知识领域中的不确定性、如何区分创造性输出与事实性错误、以及如何校准模型置信度使其与真实表现对齐等学术挑战。这一工作的意义在于将模型的弱点转化为可度量的特征,推动了从经验性规避向系统化可控的范式转变,为构建更可信赖的语言智能奠定了方法基础。
衍生相关工作
围绕 PHANTASM 基准已催生出若干具有影响力的后续工作。PHANTASM 框架本身作为首个将幻觉逆转为生产性特征的机器学习系统,其基于概率的幻觉感知神经变换方法启发了多项关于模型内省与自校正的研究。后续工作包括开发基于该基准的模型微调策略,利用 HGT 分支的标注数据训练具有幻觉感知能力的解码器;以及借鉴其不确定性校准方法,构建动态置信度调节机制以增强模型在开放域问答中的可靠性。这些衍生研究共同推动了从被动检测到主动预防的学术演进,使该基准成为评估大模型安全性与可靠性的重要参照体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务