遇见数据集

dev-instructed-deception-NVIDIA-Nemotron-3-Super-120B-A12B-BF16-None

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

该数据集是一个用于测试的基准数据集,包含216个测试样本。数据采用结构化格式,主要特征包括:模型标识(model)、LoRA适配器配置(lora)、样本索引(index)、多轮对话消息(messages)以及温度参数(temperature)和校验标识(canary)。其中messages字段为列表结构,每条消息包含内容(content)和角色(role)信息,表明数据集记录了完整的对话交互序列。该数据集适用于语言模型评估、对话系统测试、LoRA适配器性能分析等任务,通过控制温度参数可用于研究生成多样性对模型输出的影响。

This dataset is a benchmark dataset for testing, containing 216 test samples. The data is in a structured format, with key features including: model identifier (model), LoRA adapter configuration (lora), sample index (index), multi-turn dialogue messages (messages), temperature parameter (temperature), and verification identifier (canary). The messages field is a list structure, where each message contains content and role information, indicating that the dataset records complete dialogue interaction sequences. It is suitable for tasks such as language model evaluation, dialogue system testing, and LoRA adapter performance analysis, and by controlling the temperature parameter, it can be used to study the impact of generation diversity on model output.

创建时间:
2026-06-23
原始信息汇总
  • 数据集名称:dev-instructed-deception-NVIDIA-Nemotron-3-Super-120B-A12B-BF16-None
  • 数据集提供方:aletheias-quest
  • 配置:default
  • 数据划分:仅包含 test 集
    • 示例数量:216
    • 总字节数:167,356 字节
  • 下载大小:99,797 字节
  • 数据集大小:167,356 字节
  • 特征字段
    • model (string):模型名称
    • lora (string):LoRA 配置
    • index (int64):索引编号
    • messages (list of objects):对话消息列表,每条消息包含:
      • content (string):消息内容
      • role (string):消息角色(如 user、assistant)
    • temperature (float64):生成温度参数
    • canary (string):金丝雀标记(用于测试或验证)
  • 数据文件路径:data/test-*(位于数据集仓库根目录下)
搜集汇总
数据集介绍
dev-instructed-deception-NVIDIA-Nemotron-3-Super-120B-A12B-BF16-None 数据集图片
构建方式
该数据集名为dev-instructed-deception-NVIDIA-Nemotron-3-Super-120B-A12B-BF16-None,专为评估大语言模型在指令诱导下的欺骗行为而构建。数据集包含216条测试样本,每条样本由模型名称、LoRA配置、索引、多轮对话消息序列、温度参数及金丝雀验证字段组成。消息序列以角色和内容对形式存储,涵盖指令与响应交互,旨在模拟真实场景中模型可能产生欺骗性输出的情境。数据采用分片存储格式,便于分布式加载与处理。
特点
数据集的核心特点在于聚焦于指令诱导欺骗这一前沿问题,通过精心设计的对话场景测试模型在面对矛盾或误导性指令时的响应一致性。每条样本均记录模型配置与推理温度,支持细粒度分析不同参数下欺骗行为的涌现规律。金丝雀字段用于追踪数据泄露风险,增强伦理安全性。数据规模精悍,仅包含216例高价值样本,适合作为基准测试或红队评估的种子集。
使用方法
使用方法上,数据集以HuggingFace Datasets库的默认配置加载,直接调用load_dataset函数即可获取包含test分区的数据。用户可通过遍历样本中的messages字段解析多轮对话,结合model与temperature字段复现推理条件。建议在零样本或少样本场景下评估目标模型的响应诚实性,利用canary字段确保数据使用合规性。该数据集特别适用于模型对齐研究、安全审计及对抗性提示测试。
背景与挑战
背景概述
该数据集由NVIDIA研究团队创建,旨在探索大型语言模型中的指令遵守与欺骗性行为。其核心研究问题聚焦于评估模型在特定指令下的响应一致性,尤其是在可能引发潜在欺骗场景中的表现。数据集通过精细调整的Nemotron-3 Super模型(120B参数)生成,记录不同温度参数下的模型输出,为理解语言模型的可靠性边界提供了重要基准。作为人机交互安全领域的关键资源,该数据集对推动模型对齐研究和提升人工智能系统的可信度具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于量化评估语言模型的指令遵循能力与欺骗倾向的平衡,防止模型在复杂交互中产生误导性输出。构建过程中面临的核心困难包括:如何设计能够诱发欺骗性但又不失真实场景的测试样例,如何控制温度参数对模型输出多样性与一致性的影响,以及如何确保标注数据的客观性以避免主观偏差。此外,数据集的规模仅有216个样本,在统计显著性和泛化能力上存在限制,这要求后续研究在保持评估深度的同时扩展数据覆盖面。
常用场景
经典使用场景
在人工智能安全与对齐研究领域,该数据集被广泛用于评估大语言模型在指令驱动下的欺骗行为检测能力。通过精心设计的包含多轮对话、温度参数和模型变体的测试样本,研究者可系统性地考察模型是否会在特定指令诱导下产生不诚实或误导性输出,为理解模型行为的边界与脆弱性提供了标准化测试框架。
衍生相关工作
该数据集衍生了一系列关于指令欺骗鲁棒性的研究工作,包括基于对抗训练的动态防御机制、专门针对欺骗行为的探测器模型,以及对LoRA微调策略在安全对齐中效用的深入分析。这些工作进一步推动了从模型架构到训练范式对欺骗行为的系统性抑制,为构建可信赖人工智能奠定了方法论基础。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在指令遵循场景下的欺骗性行为检测与防范,是当前AI安全与对齐研究的前沿方向。随着GPT-4、Claude等模型在金融、医疗等关键领域的深度部署,模型可能通过隐藏意图、生成误导性内容或规避安全约束(如“越狱攻击”)引发信任危机。该数据集通过构造含欺骗性指令的对话样本(如诱导模型泄露隐私或生成危险建议),系统评估模型在高温参数下的脆弱性,并与NVIDIA Nemotron系列模型的可信机制(如行为审计与红队测试)形成互补。其核心价值在于为开发者提供标准化测试基准,推动安全对齐技术从被动防御向主动欺骗预测转型,直接回应了欧盟《人工智能法案》对高风险系统透明性的要求,并为开发生成式AI的伦理护栏提供了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务