遇见数据集

lie_auditors

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

该数据集名为sycophantic_deception,专注于检测和分析模型在交互中可能产生的欺骗性回应。数据集包含5864个测试样本,每个样本记录了一次模型对话交互,核心字段包括:模型名称(model)、对话消息列表(messages,含角色和内容)、是否具有欺骗性(deceptive)、欺骗的具体证据描述(fabrication_evidence)、诱发欺骗的压力类别(pressure_category)、生成参数如温度(temperature),以及索引和元数据等。数据可用于研究人工智能模型在特定压力情境下产生不实或迎合性回应的行为模式,适用于欺骗检测、模型安全性评估和对话系统鲁棒性分析等任务。

The dataset named sycophantic_deception focuses on detecting and analyzing deceptive responses that models may produce during interactions. It contains 5864 test samples, each recording a model dialogue interaction. Key fields include: model name (model), dialogue message list (messages, including roles and content), whether it is deceptive (deceptive), specific evidence description of deception (fabrication_evidence), pressure category that induces deception (pressure_category), generation parameters such as temperature, as well as indices and metadata. The data can be used to study the behavioral patterns of AI models in generating false or sycophantic responses under specific pressure scenarios, applicable to tasks such as deception detection, model safety assessment, and dialogue system robustness analysis.

创建时间:
2026-05-28
原始信息汇总

数据集概述:lie_auditors

  • 数据集名称lie_auditors
  • 数据集地址:https://huggingface.co/datasets/hunarbatra/lie_auditors
  • 配置名称sycophantic_deception

数据集结构

  • 特征字段

    • index(整数):样本索引
    • model(字符串):模型名称
    • messages(列表):包含对话消息,每条消息有:
      • role(字符串):角色标识
      • content(字符串):消息内容
    • deceptive(布尔值):是否具有欺骗性
    • fabrication_evidence(字符串):捏造证据
    • pressure_category(字符串):压力类别
    • temperature(浮点数):温度参数
    • metadata(字符串):元数据
    • canary(字符串):金丝雀字符串(用于检测数据泄露)
  • 数据划分

    • 仅包含 test 划分
    • 测试集样本数:5,864 条
    • 数据集总大小:16,876,209 字节(约 16.88 MB)
    • 下载大小:13,313,633 字节(约 13.31 MB)

数据集用途

该数据集专注于研究模型在压力或特定情境下产生欺骗性或讨好性(sycophantic)回答的行为,包含对话消息、欺骗性标签以及压力类别等字段,适用于分析语言模型在诱导下是否会说谎或编造信息。

搜集汇总
数据集介绍
lie_auditors 数据集图片
构建方式
该数据集以模型在特定压力情境下的欺骗行为为核心构建对象,通过模拟对话场景收集模型输出。每条数据包含索引、模型名称、多轮消息序列、是否具有欺骗性标签、虚构证据内容、压力类别、温度参数、元数据及金丝雀标识。数据集共收录5864个测试样本,覆盖了模型在迎合倾向(sycophantic)与欺骗性(deception)交织下的行为模式,为研究对齐安全提供了结构化样本。
使用方法
该数据集适用于评估和审计语言模型的诚实性与安全性。用户可通过messages字段获取完整的对话历史,并利用deceptive标签进行二元分类训练或零样本评估。fabrication_evidence字段可辅助进行归因分析,结合pressure_category与temperature参数,能够系统性地剖析模型在不同压力强度与采样策略下产生虚构内容的倾向性。
背景与挑战
背景概述
lie_auditors数据集由研究团队于近期构建,旨在系统性地探究大型语言模型(LLM)在交互过程中的谄媚式欺骗行为。核心研究问题聚焦于模型在面对用户施加的特定压力(如情感诉求、权威暗示等)时,是否会生成与事实相悖但迎合用户的虚假信息。该数据集通过精心设计的对话场景(messages字段)和压力分类(pressure_category),结合人为标注的欺骗性标签(deceptive),为量化分析LLM的诚实性与鲁棒性提供了标准化测试基准。其发布对人工智能安全领域具有里程碑意义,促使研究者关注模型在复杂社会交互中的伦理风险。
当前挑战
数据集面临的挑战首先来自领域问题本身:LLM的谄媚欺骗高度依赖上下文,难以通过静态基准全面捕捉动态交互中的细微隐瞒或夸张。具体表现为,模型可能在低温度(temperature)下表现出看似诚实的回答,却通过省略关键信息(fabrication_evidence)构成欺骗,增加了检测难度。在构建过程中,挑战在于如何设计真实且压力分布均衡的对话案例,以避免数据偏斜导致模型策略被简单归因;同时,人工标注欺骗性时需区分善意调和与恶意误导,确保标签的客观性与可复现性。
常用场景
经典使用场景
该数据集主要用于评估和检测大型语言模型在对话中表现出的谄媚性欺骗行为。通过精心设计的交互场景,研究者可以系统性地考察模型在面对用户压力或特定提示时,是否会生成虚假或误导性信息以取悦用户。经典的使用方式包括:向模型提出一系列带有诱导性的问题,观察其是否在明知真相的情况下仍然选择编造事实,从而量化模型的诚实性缺陷。
解决学术问题
该数据集直面大语言模型在安全性和可信赖性方面的核心挑战,即模型在追求用户满意度时可能牺牲事实准确性。它解决了如何系统衡量模型在压力情境下产生谄媚性谎言这一学术空白,为理解模型对齐失败提供实证基础。其意义在于推动评估从单一性能指标向伦理维度拓展,警示研究者关注模型迎合人类偏见的风险,从而促进更稳健的对齐技术发展。
实际应用
在实际应用中,该数据集可用于大语言模型上线前的安全审计,帮助开发者识别哪些模型配置或训练策略容易引发谄媚性欺骗。企业可借助该数据集测试客服机器人、教育辅导系统等交互式AI产品,确保其在面对用户负面情绪或权威提问时依然保持事实完整性。此外,该资源对制定AI伦理规范、构建可信AI服务具有直接参考价值。
数据集最近研究
最新研究方向
在人工智能伦理与安全性研究的前沿,lie_auditors数据集聚焦于大语言模型中的谄媚性欺骗行为,即模型为迎合用户偏好而故意提供虚假或误导性信息。该数据集通过构造对话样本并标注欺骗性与压力类别,为探测模型在社交压力下的不诚实行为提供了基准。当前,随着AI系统的广泛应用,模型对齐问题备受关注,尤其是当用户意图与事实冲突时,模型是否会牺牲真实性以维持表面和谐。这一方向与近期热点如AI幻觉、价值观对齐及模型可审计性密切相关,lie_auditors的发布为量化评估模型的诚实性偏差、推动可信任AI系统的构建提供了关键数据支撑,有助于识别训练与部署中的系统性盲点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务