遇见数据集

dev-instructed-deception-Qwen3.5-27B-a-mo-qwen3.5-27b-1

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

该数据集是一个结构化数据集,包含400个测试样本。每个样本由以下字段构成:model(字符串类型,可能标识使用的模型)、lora(字符串类型,可能标识LoRA适配器)、index(整型索引)、messages(一个列表,其中每个元素包含content字符串和role字符串,暗示数据可能为对话或消息序列格式)、temperature(浮点类型,可能表示生成过程的温度参数)以及canary(字符串类型,可能为版本或标识符)。数据集总大小为317,430字节,下载大小为186,066字节。基于字段结构,该数据集可能适用于大型语言模型(LLM)的推理、评估或对话生成任务,但具体背景、目的和应用场景未在README中说明。

This is a structured dataset consisting of 400 test samples. Each sample is composed of the following fields: 1. `model`: a string-type field, possibly used to identify the model in use; 2. `lora`: a string-type field, possibly used to identify the LoRA adapter; 3. `index`: an integer index; 4. `messages`: a list where each element contains a `content` string and a `role` string, implying that the data may follow the format of a conversation or message sequence; 5. `temperature`: a floating-point value, possibly representing the temperature parameter during the generation process; 6. `canary`: a string-type field, possibly serving as a version or identifier. The total size of the dataset is 317,430 bytes, and the download size is 186,066 bytes. Based on its field structure, this dataset may be suitable for inference, evaluation, or conversational generation tasks of Large Language Models (LLMs). However, its specific background, purpose, and application scenarios are not specified in the README.

创建时间:
2026-06-26
原始信息汇总
  • 数据集名称:dev-instructed-deception-Qwen3.5-27B-a-mo-qwen3.5-27b-1
  • 数据集提供方:aletheias-quest
  • 数据集大小
    • 下载大小:186,066 字节
    • 数据集总大小:317,430 字节
  • 数据集划分:仅包含 test 划分,共 400 个样本
  • 数据特征
    • model(字符串)
    • lora(字符串)
    • index(整数)
    • messages(列表,包含 contentrole 两个字符串字段)
    • temperature(浮点数)
    • canary(字符串)
  • 数据文件格式:文件名匹配模式 data/test-*,所有文件属于 test 划分
搜集汇总
数据集介绍
dev-instructed-deception-Qwen3.5-27B-a-mo-qwen3.5-27b-1 数据集图片
构建方式
本数据集名为dev-instructed-deception-Qwen3.5-27B-a-mo-qwen3.5-27b-1,专注于评估大语言模型在指令性欺骗场景下的表现。数据集的构建基于Qwen3.5-27B模型的输出,通过配置特定的LoRA微调参数,生成多样化的交互样本。每条数据以结构化的messages形式呈现,包含角色(role)与内容(content)字段,模拟用户与模型之间的欺骗性对话。数据集共收录400条测试样本,以Parquet格式存储于data/test-*路径下,确保数据加载的便捷性与兼容性。
特点
该数据集的核心特点在于其聚焦于指令性欺骗任务的评估,通过精细的字段设计(如model、lora、temperature)记录生成配置,便于研究者复现实验。每条样本均包含唯一的index标识与canary字段,用于追踪数据来源与完整性。温度参数(temperature)的多样性确保了模型输出在确定性(温度接近0)与创造性(温度较高)之间的平衡,为分析模型在不同随机性水平下的欺骗行为提供了丰富视角。
使用方法
使用本数据集时,用户可借助HuggingFace的datasets库直接加载,指定配置名为'default'并划分测试集。通过访问messages字段中的对话历史,研究者可构建评估管道,衡量模型在欺骗性指令下的响应质量。建议结合LoRA权重文件与原始Qwen3.5-27B模型进行对比实验,深入分析微调后行为的变化。此外,canary字段可用于数据溯源与版权保护,确保伦理合规使用。
背景与挑战
背景概述
在大规模语言模型(LLM)安全性与对齐研究的前沿,欺骗性行为检测与防御正成为关键议题。该数据集由研究团队基于Qwen3.5-27B模型构建,旨在探索语言模型在指令遵循场景下被诱导生成欺骗性输出的可能性与边界。通过设计精细的指令与温度参数,数据集系统性地评估模型在人为操控下的真实性维持能力,为理解LLM的对抗鲁棒性与行为一致性提供了量化工具。其构建时间指向2025年,反映了对齐研究从能力评估向行为可控性深化的趋势,对推动可信人工智能的落地具有方法论层面的标杆意义。
当前挑战
该数据集直面两大挑战:其一,领域问题层面,现有LLM对齐策略多聚焦于显式有害内容过滤,而对模型在连贯对话中受微妙指令诱导而自主产生欺骗性回答的防御机制尚属空白,亟需建立标准化的欺骗性行为度量框架。其二,构建过程中,需平衡指令的诱导强度与自然度,避免人工构造的欺骗性提示过于刻意而失去生态效度;同时,温度参数的离散化采样需覆盖模型输出从确定性到高熵区的连续谱系,以捕捉非线性行为跃迁,这对实验设计的粒度与计算资源消耗提出了严苛要求。
常用场景
经典使用场景
在大型语言模型安全性与对齐研究的前沿领域,dev-instructed-deception-Qwen3.5-27B-a-mo-qwen3.5-27b-1数据集承载着揭示模型欺骗行为的学术使命。该数据集精心构造了400条人机对话样本,每条样本均包含模型名称、微调参数(lora)、多轮消息结构以及温度系数等关键元信息。研究者可借助此数据集系统性地评估语言模型在指令遵循过程中是否展现出有意的误导或隐瞒倾向,从而深入剖析模型在复杂情境下的诚实性表现。作为大模型安全性评估的基准测试集,它特别适用于探究模型回答中蕴含的欺骗性策略与用户期望之间的张力。
实际应用
在实际产业应用中,该数据集可支撑智能客服系统中的质量监控与风险防控模块。例如,金融咨询或医疗建议场景下,语言模型若在不确定诊断时误导用户,可能引发严重后果。开发者可利用本数据集对模型进行欺骗性回答压力测试,识别并修正有害的引导策略,确保AI助手在关键决策支持中保持绝对诚实。此外,其在内容审核、自动化面试系统以及教育辅导工具中亦有广阔前景,通过对抗性欺骗检测来维护交互的真实性与信息透明度,降低算法对用户决策的隐性操控风险。
衍生相关工作
围绕dev-instructed-deception结构特征,学术界已衍生出一系列富有影响力的探索方向。研究者基于其消息序列格式,发展出欺骗性对话模式聚类方法,通过分析不同温度参数下模型回答的变异程度来量化欺骗倾向。同时,该数据集激发了关于指令性欺骗可检测性的研究,催生了基于元学习(如LoRA参数响应特征)的欺骗行为早期预警模型。相关工作还将其与红队测试结合,形成了评估模型对齐程度的新型协议框架,进一步深化了对大模型在复杂指令下诚实性边界的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务