遇见数据集

ai-safety-institute/unrelated-questions-follow-up-questions

收藏
Hugging Face2026-06-04 更新2026-06-14 收录
官方服务:

资源简介:

该数据集是一个固定的是/否后续(引发)问题集,用于无关问题谎言检测器,源自研究论文《How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions》(Pacchiardi等人,ICLR 2024)。当模型生成回应后,每个问题作为新的用户消息附加,并记录模型的是/否对数概率。每个问题的logsumexp(yes_logprobs) - logsumexp(no_logprobs)值构成特征向量,输入到训练好的探测器中。数据集包含一个CSV文件(follow_up_questions.csv),共有65个问题,其中48个在论文中使用于训练探测器。

The dataset is a fixed set of yes/no follow-up (elicitation) questions used by the Unrelated Questions lie detector, reproduced from the research paper How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions (Pacchiardi et al., ICLR 2024). After a model produces a response, each question is appended as a new user message and the models yes/no logprobs are recorded. The per-question logsumexp(yes_logprobs) - logsumexp(no_logprobs) values form the feature vector fed to the trained probe. It includes a CSV file (follow_up_questions.csv) with 65 questions in total, of which 48 are marked as used in the paper for training the probes.

提供机构:
ai-safety-institute
搜集汇总
数据集介绍
ai-safety-institute/unrelated-questions-follow-up-questions 数据集图片
构建方式
该数据集源自Pacchiardi等人于ICLR 2024发表的论文《How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions》,旨在为黑盒大语言模型谎言检测任务提供标准化的后续追问问题集。构建过程中,研究人员设计了一套固定的二元(是/否)追问问题,共计65个,其中48个被标记为`used_in_paper=true`并实际用于训练探针模型。每个问题以新用户消息的形式追加至模型生成的回答之后,通过记录模型对每个问题的`logsumexp(yes_logprobs) - logsumexp(no_logprobs)`值,构建出用于探针训练的特征向量。数据以单一CSV文件存储,包含问题文本、探针类型及论文使用标记等字段。
特点
该数据集的核心特点在于其精巧的追问问题设计——问题与原始对话内容无关,旨在通过模型对非相关问题的反应差异来捕捉其欺骗性行为。65个问题覆盖多样化的语义范畴,而48个精选问题经实验验证具有最优的谎言检测效能。数据集的二元问答形式(是/否)使得特征提取简洁高效,对数概率差值的计算方式保留了模型预测的分布信息,避免了离散化带来的信息损失。此外,数据集附带的探针类型标记支持对不同分类器进行系统性比较,增强了研究的可重复性与可扩展性。
使用方法
使用该数据集时,研究者可首先将目标模型的回答作为对话上下文,随后从CSV文件中选取若干追问问题,依次以用户消息形式输入模型,并获取模型对每个问题输出标记'Yes'与'No'的对数概率。通过针对每个问题计算`logsumexp(yes_logprobs) - logsumexp(no_logprobs)`,得到一组连续特征值,作为该回答的表示向量。该向量可输入至逻辑回归、支持向量机等任意浅层分类器进行训练或推理,从而判断模型原始回答是否包含谎言。数据集提供的48个标准问题可直接用于复现论文实验,而全部65个问题则可用于探针设计的进一步优化与探索。
背景与挑战
背景概述
在大规模语言模型(LLMs)日益融入日常应用的背景下,如何有效检测模型生成的虚假或误导性信息成为关键挑战。2024年,由Lorenzo Pacchiardi、Alex J. Chan等研究者联合牛津大学与加州大学伯克利分校等机构,在ICLR 2024上提出了《How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions》一文,开创性地利用无关问题探测法鉴别LLMs中的谎言。该数据集“unrelated-questions-follow-up-questions”正是该方法的核心组件,包含65个精心设计的追问题,旨在通过分析模型对无关问题的回答概率特征,训练出高准确率的欺骗分类探针。这一工作拓展了黑盒场景下模型行为检测的研究边界,为提升AI系统的可信度与透明度提供了新范式。
当前挑战
该数据集所解决的领域核心问题在于,传统谎言检测方法多依赖对模型内部状态或输出文本的直接分析,但在黑盒LLMs中无法获取中间表征,且模型可能规避显式的谎言询问。通过无关问题策略,研究需应对如何设计出与初始回答语义无关却能诱发言语不一致特征的问题,同时确保问题数量足够支撑统计学习。在构建过程中,团队从大量候选问题中筛选出48个有效探针,并验证其在多种模型与任务上的泛化能力,面临问题语义独立性、探针噪声控制及跨场景稳健性等挑战。此外,固定问题集可能随模型迭代而效力衰减,如何动态更新问题库也是后续研究需解决的难题。
常用场景
经典使用场景
该数据集专为基于无关问题策略的谎言检测任务而设计,其核心用途在于收集大语言模型对特定是非追问问题的logprobs响应,进而构建用于训练线性探针的特征向量。研究者通过将65个固定的是非追问问题逐一附加为新的用户消息,记录模型对‘是’与‘否’的logsumexp差值,形成表征模型内部状态的多维数值特征。这一过程允许在无需访问模型内部参数的条件下,仅利用输出层概率分布实现黑盒谎言检测,为评估语言模型的诚实性提供了可复现的实验框架。
衍生相关工作
该数据集源自Pacchiardi等人发表于ICLR 2024的研究工作,其提出的无关问题检测范式直接催生了多类衍生研究。后续工作探索了追问问题集合的自动生成与优化方法,试图通过对抗训练发现更具检测效力的问题模板;亦有研究将该范式迁移至多模态谎言检测场景,在图文生成模型中验证此类检测信号的可迁移性。此外,线性探针的简单架构促使社区探索更高效的检测器设计,包括利用对比学习或元学习增强探针对不同模型架构的泛化能力。
数据集最近研究
最新研究方向
在大型语言模型(LLM)的可信度评估前沿,谎言检测成为保障AI安全的关键议题。unrelated-questions-follow-up-questions数据集源自ICLR 2024研究“How to Catch an AI Liar”,开创性地提出通过询问与模型输出内容无关的二元追问问题,利用模型回答时的对数概率差异构建特征向量,训练探测模型以识别黑盒LLM中的欺骗行为。这一方法突破了传统基于内容分析的局限,为检测AI恶意行为提供了全新范式,在对抗性安全评估、模型审计与伦理合规领域具有重要影响。随着前沿语言模型在决策与对话中的广泛应用,该数据集为构建鲁棒的撒谎检测系统奠定了基础,推动了可信人工智能的可验证性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务