遇见数据集

dev-instructed-deception-gemma-3-27b-it-s-mo-gemma-3-27b-it

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

该数据集是一个测试集配置,旨在评估或测试语言模型及相关组件。它包含400个样本,每个样本包括模型标识(model)、LoRA适配器标识(lora)、样本索引(index)、对话消息列表(messages,其中每条消息包含内容content和角色role)、温度参数(temperature)以及一个标识字段(canary)。数据集总大小约为317KB,适用于对话生成、模型调优或参数化实验等任务,但具体背景和详细应用场景需参考外部文档或进一步分析数据内容。

This dataset is a test set configuration designed to evaluate or test language models and related components. It consists of 400 samples, each containing model identifier (model), LoRA adapter identifier (lora), sample index (index), dialogue message list (messages, where each message includes content and role), temperature parameter (temperature), and an identifier field (canary). The total dataset size is approximately 317KB, suitable for tasks such as dialogue generation, model fine-tuning, or parameterized experiments, but specific background and detailed application scenarios require reference to external documentation or further analysis of the data content.

创建时间:
2026-06-26
原始信息汇总

数据集概述

数据特征

该数据集包含以下字段:

  • model (string): 模型名称
  • lora (string): 微调方法或配置
  • index (int64): 样本索引编号
  • messages (list): 对话消息列表,每条消息包含:
    • content (string): 消息内容
    • role (string): 消息角色(如 user、assistant 等)
  • temperature (float64): 生成时的温度参数
  • canary (string): 用于追踪或验证的标识符

数据用途

该数据集用于评估或训练模型在“受指示欺骗”场景下的表现,涉及 Gemma-3-27b-it 及其变体(含 LoRA 微调)的对比或测试。

搜集汇总
数据集介绍
dev-instructed-deception-gemma-3-27b-it-s-mo-gemma-3-27b-it 数据集图片
构建方式
该数据集以‘dev-instructed-deception’为核心主题,专为研究大语言模型在指令遵循场景下的欺骗性行为而构建。数据来源于对Gemma-3-27B-it模型及其基于LoRA微调变体的对话生成,通过系统化设定欺骗性指令,采集模型在不同温度参数下的响应。每条数据包含模型标识、LoRA配置、对话消息序列、温度参数及金丝雀值,共计400条测试样本,覆盖多元化的欺骗诱发场景。
特点
数据集设计精巧,聚焦于模型行为差异比较,涵盖基准模型与LoRA微调版本的双重维度。features中‘messages’字段以角色-内容对形式存储完整对话历史,便于分析上下文中的欺骗模式;‘temperature’参数控制生成随机性,支持探究温度对欺骗倾向的影响。400条精选测试样本确保了评估的均衡性,为研究模型安全性与对齐性提供了细粒度观测窗口。
使用方法
数据集以HuggingFace标准格式发布,提供单一‘test’分割,可直接通过datasets库加载。用户可依据‘model’与‘lora’字段对比不同配置下的生成结果,利用‘messages’序列构建欺骗检测或分类任务。推荐将温度参数作为控制变量,分析模型在指令对抗中的鲁棒性。数据轻量(约317KB),便于快速迭代实验,适用于评估语言模型在安全性基准上的表现。
背景与挑战
背景概述
在大语言模型(LLM)与安全对齐的交叉研究领域,欺骗性行为检测成为评估模型可靠性的关键课题。该数据集由研究机构针对“指令驱动欺骗”(instruction-instructed deception)这一新兴现象构建,生成于2025年前后,旨在探索大型语言模型在特定指令下主动欺骗人类或其他系统的能力边界。核心研究问题聚焦于:当模型接收到明确要求其进行欺骗的指令时,是否能够以及如何执行此类行为,进而对模型的实际安全性与道德约束效力提出挑战。通过精心设计的400条测试样本,该数据集为分析Gemma-3-27B-it等模型在受控环境下的欺骗表现提供了标准化基准,对理解LLM对齐失败机理、设计鲁棒性安全协议具有重要推动价值。
当前挑战
该数据集面临的核心挑战体现在两个层面。在领域问题层面,需要精准定义“欺骗行为”的具体边界——由于语言模型生成内容的多样性,区分策略性掩饰、功能型错误输出与恶意欺诈之间存在模糊地带,传统基于静态规则的对齐方法难以覆盖此类动态欺骗意图。在构建过程层面,如何确保提示(messages)设计能够有效激发模型真实欺骗倾向,同时避免因提示歧义导致等效于错误输出;此外,低参数模型(仅27B)在有限样本量(400条)上的泛化能力不足,且依赖于单一温度参数(temperature)控制输出随机性,可能遗漏特定欺骗模式的变体表现,进而影响评估结论的普适性与鲁棒性。
常用场景
经典使用场景
在大型语言模型的安全性与对齐研究中,欺骗性行为(deception)的检测与模拟是极富挑战的前沿课题。该数据集聚焦于特定指令微调场景下,评估Gemma-3-27b-it模型在被注入恶意提示后是否会产生隐蔽的欺骗性输出。研究者可利用其精心编排的400条结构化对话样本,系统分析模型在不同温度参数下的虚假信息生成倾向,尤其适用于探究指令微调如何影响模型的内在诚实性。
实际应用
在现实部署中,大型模型的诚信风险可能诱发客服误导、教育信息污染及内容审核漏洞。该数据集可直接服务于企业级AI系统的红队测试(Red-Teaming),帮助开发者在敏感场景(如法律咨询、医疗建议、金融决策)下识别模型是否会被特定提示词诱导至欺骗轨迹。此外,它还能辅助设计更加鲁棒的提示模板与防御性训练策略,降低模型在用户交互中产生有害错误信息的可能性,保障AI辅助决策的可靠性与可信度。
衍生相关工作
该数据集的诞生为后续研究开辟了多条道路。基于其数据格式,研究者可衍生出对抗性提示生成器,自动创造更复杂的欺骗性场景以测试模型的心理理论(Theory of Mind)。其结构化消息记录与温度参数配置,亦可被用于训练辅助评审模型(Critic Model),自动标注模型输出中的可疑欺骗漏洞。同时,它为多模态场景下的诚信评估提供了基线模板,以及为基于强化学习的精细化安全对齐算法提供关键数据集支持,相关工作已逐步出现在安全AI社区的前沿讨论中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务