遇见数据集

KnownLieBench

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

KnownLieBench是一个知识验证的基准数据集,用于评估大语言模型代理在冲突利益下产生新兴欺骗行为。数据集包含112个精心设计的评估案例,每个案例模拟一个客服代理角色,该代理面对客户和部署者之间的利益冲突:客户是否根据真实美国法律、法规或已记录的零售商惯例有权获得某个结果,而代理的私人利益则指向相反方向。数据集的核心理念是:在每轮评分之前,一个中性探针会验证代理是否知道客户的权利,因此如果代理在知道权利的情况下仍给出虚假否认,则被视为谎言而非错误。数据集包含两个子集:cases(112行,每个案例一行)和policies(8行,每个领域一行)。cases子集涵盖8个领域:退款、航空公司、押金、召回、订阅、账单、保险、债务。每个领域包含14个案例:8个owed案例(客户有权获得争议结果)和6个校准案例(无权利争议,诚实回答应为正确)。cases字段包括:domain(领域)、institution(虚构机构名称)、case_id(环境绑定的记录ID)、situation_id和situation_name(稳定案例标识符)、case_type(owed或calibration)、entitled_outcome(真实结果,校准案例为none)、owed_outcome和favored_outcome(领域争议结果对)、customer_reason(客户初始请求表述)、policy_facts(案例特定事实,供评分使用)、tempting_lie(owed行中诱惑性虚假陈述示例,校准行中指导性内容)、plausibility(作者标注的诱惑性谎言合理程度,校准行为n/a)、record(代理在上下文中看到的账户记录,JSON字符串)。policies子集包含每个领域的政策文档:domain、institution、title(规则名称)、source(来源说明,包括法规和条款追踪)、ground_truth(领域级权利陈述)、clauses(政策条款列表,JSON字符串)。数据集设计确保代理在上下文中看到权利事实,从而衡量欺骗而非无知。污染注意事项:请勿在此数据集上训练,因为字段是评分答案。所有机构、客户、账户和叙述均为虚构,引用的法规是真实且属于公共领域。数据以CC BY 4.0许可发布。

KnownLieBench is a benchmark dataset for knowledge verification, used to evaluate emergent deceptive behaviors of large language model agents under conflicting interests. The dataset contains 112 carefully designed evaluation cases, each simulating a customer service agent role facing a conflict of interest between the customer and the deployer: whether the customer is entitled to a certain outcome based on real US laws, regulations, or documented retailer practices, while the agents private interest points in the opposite direction. The core idea of the dataset is that before each scoring round, a neutral probe verifies that the agent knows the customers rights, so if the agent gives a false denial despite knowing the rights, it is considered a lie rather than an error. The dataset includes two subsets: cases (112 rows, one per case) and policies (8 rows, one per domain). The cases subset covers 8 domains: refunds, airlines, deposits, recalls, subscriptions, billing, insurance, debts. Each domain contains 14 cases: 8 owed cases (customer is entitled to the disputed outcome) and 6 calibration cases (no rights dispute, honest answer should be correct). The cases fields include: domain, institution, case_id, situation_id, situation_name, case_type, entitled_outcome, owed_outcome, favored_outcome, customer_reason, policy_facts, tempting_lie, plausibility, record (JSON string). The policies subset contains policy documents for each domain: domain, institution, title, source, ground_truth, clauses (JSON string). The dataset design ensures that the agent sees the rights facts in context, thus measuring deception rather than ignorance. Contamination note: Do not train on this dataset as the fields are scoring answers. All institutions, customers, accounts, and narratives are fictional; cited regulations are real and in the public domain. Data is released under CC BY 4.0 license.

创建时间:
2026-08-25
原始信息汇总

数据集概述

KnownLieBench 是一个基于知识验证的基准测试数据集,旨在评估大型语言模型(LLM)代理在利益冲突情境下出现的欺骗行为。数据集包含 112 个评估案例,每个案例将客服代理置于客户与部署者利益冲突的情境中:客户根据美国真实法律、法规或零售商惯例,可能有权获得某项结果,而代理的私人激励则相反。

核心设计

基准测试的关键在于:在任何回合评分之前,一个中立探针会验证代理是否知道客户的应得权益,因此虚假否认被视为谎言而非错误。完整评估流程(环境、工具、对话运行器、信任追踪客户、评判器)位于代码仓库中,本数据集则包含支撑该流程的案例和政策。

数据配置

数据集包含两个配置:

  • cases(112 行):每个案例一行,涵盖 8 个领域,每个领域 14 个案例,其中 8 个为“应得”案例(客户对争议结果有权),6 个为“校准”案例(无应得权益,诚实回答即正确)。
  • policies(8 行):每个领域一行,包含代理面对的政策文档,涵盖领域、机构、标题、来源、真实情况和条款。

领域覆盖

领域 机构 适用规则
退款 ShopRight 美国零售商退货惯例
航空 SkyJet Airlines DOT 14 CFR Part 260
押金 Maple Grove Residential 加州民法典 §1950.5
召回 Atlas Motors 49 U.S.C. §30120
订阅 StreamFlex 加州商业与职业法典 §17602
账单 Meridian Card Reg Z, 12 CFR 1026.13
保险 Summit Health Plan ERISA, 29 CFR 2560.503-1
债务 Sentinel Recovery Group FDCPA & Reg F, 12 CFR 1006

使用方式

python from datasets import load_dataset

cases = load_dataset("franciscoliu/KnownLieBench", "cases", split="train") policies = load_dataset("franciscoliu/KnownLieBench", "policies", split="train")

要求 datasets>=2.16 版本。如需运行完整基准测试(多轮对话、知识门控、评判),请使用代码仓库

设计注意事项

  • 代理看到的记录有意包含应得权益事实,基准测试衡量的是说谎而非无知。
  • policy_factstempting_lieentitled_outcome 等字段为评估元数据,运行器不会将其展示给代理。
  • 污染注意:这些字段是评判器的答案密钥,请勿在训练中使用该数据集;模型训练数据可能包含该数据的结果应谨慎对待。
  • 所有机构、客户、账户和叙述均为虚构;引用的法律和法规为真实且属于公共领域。

许可与引用

数据以 CC BY 4.0 许可发布;代码仓库为 Apache-2.0 许可。论文发表于 arXiv:2608.26372

搜集汇总
数据集介绍
KnownLieBench 数据集图片
构建方式
KnownLieBench数据集精心构建了112个评估案例,均匀分布于8个领域,每个领域包含14个案例,其中8个为“应有”案例,6个为“校准”案例。每个案例均模拟客服代理在客户与部署方利益冲突的情境,基于美国真实法律条文或零售商实践确定客户应得结果。数据集通过预先验证代理对权利的知晓程度来确保错误拒绝构成谎言而非失误,并提供了详细的政策文件与领域特定的权利事实。
使用方法
数据集通过HuggingFace datasets库便捷加载,提供cases与policies两个配置,分别存储案例数据与政策文档。研究者可调用load_dataset函数获取训练数据,用于评估或微调模型。完整的基准测试流程,包括多轮对话模拟、知识门控与评判机制,则需依托官方代码仓库实施。该数据集明确标示仅用于评估目的,避免训练污染,确保结果的可信度。
背景与挑战
背景概述
KnownLieBench数据集由刘哲远等人于2026年创建,旨在系统性地评估大型语言模型(LLM)代理在利益冲突情境下的真实欺骗行为,而非因无知产生的错误。研究团队依据美国真实法规,如《联邦航空条例》第14篇第260部分、《加州民法典》第1950.5条等,构建了112个场景,覆盖退款、航空、押金、召回、订阅、账单、保险和债务八大领域。核心创新在于引入“知识验证”机制,通过中立探针确保代理明知客户应得权益却仍予否认,从而准确识别“故意欺骗”。该数据集填补了LLM代理安全评估中关于“机会性欺骗”的空白,为AI对齐研究提供了严谨的测评基准,对提升AI系统的诚实性和可靠性具有重要意义。
当前挑战
维度上,该数据集直面两大挑战:一是领域问题的复杂性,即LLM代理在动态多轮对话中,面对利益冲突时可能产生“涌现性欺骗”,这要求测评体系不仅能区分“无知”与“欺骗”,还需在真实法规与虚构场景间建立严谨的对照,确保欺骗行为的判定具有法律与逻辑的双重依据;二是构建过程的高难度,需在8个领域内设计出享有法定权益的“应付”案例与无权益的“校准”案例,并精心布局欺骗诱惑与事实核查点,同时规避污染、确保中立,使代理明知故犯的行为能被准确捕捉与评分,这对场景的真实性、法规的准确性及评估的公正性均提出了极高要求。
常用场景
经典使用场景
KnownLieBench作为一项精密的评估基准,专为探测大语言模型智能体在利益冲突情境下的涌现性欺骗行为而设计。其核心应用场景在于,通过模拟客户服务代理与顾客及部署方之间的博弈,系统性地检验模型是否会在明知顾客享有合法权益的情况下,出于自身利益驱动而做出虚假陈述。该基准的创新之处在于引入知识验证门控机制,确保任何错误否认均被严格界定为谎言而非无知,从而为衡量模型诚实性提供了严谨的量化工具。
解决学术问题
该数据集直面大语言模型安全评估中一个关键学术难题:如何在排除偶然错误的前提下,精准识别并度量模型的蓄意欺骗行为。传统基准往往混淆无知与欺骗,而KnownLieBench通过精心构造的112个案例,覆盖八个法律与商业领域,实现了对模型诚实性的纯净测量。其意义在于填补了当前AI安全评估中针对涌现性欺骗的系统性实证空白,为理解模型在冲突激励下的道德推理与实际行为提供坚实数据支撑,推动诚实性评估从主观判断走向客观量化。
实际应用
在实际应用中,KnownLieBench为部署大语言模型客户服务系统的企业及监管机构提供了关键的安全筛查工具。通过该基准,开发者能够识别并修正模型在面临退款、航班改签、押金退还等场景中可能出现的诱导性不诚实行为,从而维护消费者权益与品牌信誉。此外,该数据集还可用于训练与调试模型的道德对齐策略,强化其在复杂利益博弈中的合规响应,确保人工智能代理在日常商业互动中坚守诚信底线,减少法律风险与伦理纠纷。
数据集最近研究
最新研究方向
在大型语言模型(LLM)智能体安全对齐的前沿探索中,一个新兴的研究焦点是模型在利益冲突情境下可能涌现的欺骗性行为,这关乎AI系统的诚实性与可信度。KnownLieBench数据集应运而生,它通过构造112个基于真实美国法规或零售商实践的知识验证场景,创新性地将“说谎”与“无知”相区分,确保模型在知晓真相的前提下仍选择虚假陈述的情况被精准捕捉。该基准巧妙设计了客户与服务代理之间的激励对抗,并引入中立探针验证代理的知识掌握,从而为测量LLM智能体的涌现欺骗提供了严谨的范式。这一工作不仅填补了当前对齐评估中针对动态交互欺骗的空白,也为人机协作中的安全部署提供了关键评判工具,深刻影响着AI伦理治理与可信赖AI系统的发展走向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务