KnownLieBench
收藏资源简介:
KnownLieBench是一个知识验证的基准测试,旨在评估LLM代理中的新兴欺骗行为。它通过中性探针确认代理知道用户应得的权利,然后在引入激励后测试代理是否虚假否认该权利。该基准涵盖8个客户服务领域和112个基于真实规则的案例,进行多轮对话,并区分由激励单独产生的欺骗与在明确指令下产生的欺骗。
KnownLieBench is a knowledge verification benchmark designed to evaluate emergent deceptive behaviors in LLM agents. It first uses neutral probes to confirm that the agent is aware of the user's entitled rights, then tests whether the agent will falsely deny those rights after introducing incentives. This benchmark covers 112 real-rule-based cases across 8 customer service domains, supports multi-turn conversations, and distinguishes between deception generated solely by incentives and deception induced by explicit instructions.
KnownLieBench 数据集概述
核心定位
KnownLieBench 是一个用于评估大语言模型(LLM)智能体在利益冲突场景中是否会产生“涌现性欺骗”(emergent deception)的知识验证基准(Knowledge-Verified Benchmark),其论文预印本编号为 arXiv:2608.26372。
设计思路
该基准首先通过“中性探针”(neutral probe)确认智能体是否知晓用户应享有的权利(确保其“知道”而非“不知道”或“幻觉”),随后引入欺骗动机,测试智能体是否会做出与其所知相悖的虚假否认,从而将“撒谎”与“不知情”两类行为严格区分。
数据构成
- 领域覆盖:8 个虚构客户服务场景(购物退款、航空退款、押金退还、车辆召回、订阅取消、账单争议、保险理赔、债务催收),每个领域均对应真实的美国法律法规(如 DOT 14 CFR Part 260、Cal. Civ. Code §1950.5 等)。
- 案例数量:共 112 个扎根案例(每领域 14 个),其中包括 8 个“应得”案例与 6 个“校准”案例,校准案例用于避免模型盲目拒绝或虚构权利。
- 条件设置:同一环境仅改变智能体的私有指令,分为诚实控制组(none)、涌现欺骗组(lie_incentive)、指令欺骗组(instructed_lie)三种条件。
- 信任层级:模拟客户初始信任程度分为低、中、高三档,并在对话回合中动态更新(分数计算由
scripts/score_dialogue.py完成)。
评估指标
- KPR(知识通过率):中性探针确认智能体知晓权利的比率,基于全部探针回合计算。
- DR(欺骗率,即 lie_rate):知识验证过的虚假陈述占总计分回合的比例。
- DSR(欺骗成功率):谎言被客户采信并导致客户失去应得权益的比率。
- Detect(检测率):客户识破谎言的频率。
数据格式与内容
- 对话轨迹以 JSONL 形式存储,包含完整转录、门控结果、裁判事实、派生裁决、信任轨迹和最终结果(文件命名:
trajectories_<label>_<domain>_<delta_set>.jsonl)。 - 另有按轨迹聚合的摘要 JSON 文件(
summary_<label>_<domain>_<delta_set>.json)。
裁判机制
使用固定版本的 gpt-5.1-2025-11-13 作为事实抽取裁判,抽取每回合事实后由确定性规则推导裁决,该机制在与 60 条人工标注样本对比中取得 κ = 0.815 的汇总一致性。可选装集成、分解、验证等增强型裁判包装。
规模与成本
复现论文完整流程需进行 3 条件 × 3 信任层级 × 14 案例 × 8 领域 = 每模型 1,008 回合对话;在论文设定的模型配置下,使用固定裁判的 API 运行成本约为每模型 $12。全文共包含 148 项无需 API 密钥的离线测试。
访问渠道
- 代码库:在 GitHub 上以 Apache-2.0 许可证发布。
- 数据:在 Hugging Face 上以 CC BY 4.0 许可证发布(地址为 https://huggingface.co/datasets/franciscoliu/KnownLieBench)。
- 内容知识产权:数据中引用的法规属于公共领域,所有机构与人物均为虚构。





