遇见数据集

dev-instructed-deception-Qwen3.5-27B-None

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

该数据集是一个结构化测试数据集,包含400个样本,仅提供测试拆分。每个样本包括多个特征字段:model(模型标识,字符串类型)、lora(LoRA适配器标识,字符串类型)、index(样本索引,int64类型)、messages(消息列表,每个消息包含content内容字符串和role角色字符串)、temperature(温度参数,float64类型)以及canary(标识字符串)。数据集总大小为302838字节,下载大小为185165字节。从数据结构推断,该数据集可能用于语言模型的测试或评估任务,特别是涉及对话交互或参数配置的场景,messages字段表明可能包含多轮对话数据。

This dataset is a structured test dataset containing 400 samples, with only a test split provided. Each sample includes multiple feature fields: model (model identifier, string type), lora (LoRA adapter identifier, string type), index (sample index, int64 type), messages (a list of messages, each containing a content string and a role string), temperature (temperature parameter, float64 type), and canary (identifier string). The total dataset size is 302,838 bytes, with a download size of 185,165 bytes. Based on the data structure, this dataset is likely used for testing or evaluation tasks of language models, particularly in scenarios involving dialogue interaction or parameter configuration, and the messages field suggests it may contain multi-turn dialogue data.

创建时间:
2026-06-23
原始信息汇总

数据集概述

数据集名称dev-instructed-deception-Qwen3.5-27B-None

数据集来源aletheias-quest

数据集大小:下载大小约 185 KB,数据集总大小约 303 KB。

数据划分:仅包含一个 test 测试集,包含 400 条样本。

数据特征(字段)

字段名 数据类型 说明
model 字符串 模型名称
lora 字符串 微调参数名称
index 整数 样本索引编号
messages 列表(包含 contentrole 两个子字段,均为字符串) 对话消息列表,每条消息包含内容和角色
temperature 浮点数 生成时的温度参数
canary 字符串 标识字段(可能用于识别或溯源)

数据文件:位于 data/test-* 路径下,具体文件格式未明确说明(通常为支持的分片格式)。

搜集汇总
数据集介绍
dev-instructed-deception-Qwen3.5-27B-None 数据集图片
构建方式
该数据集名为“dev-instructed-deception-Qwen3.5-27B-None”,旨在探究大型语言模型在指令诱导下的欺骗行为。构建方式基于Qwen3.5-27B模型生成对话数据,涵盖多种指令场景以诱发模型潜在的不诚实回应。每条数据包含模型名称、LoRA配置、索引、多轮消息序列、温度参数及金丝雀标识符,其中消息序列由角色和内容字段构成,模拟人机交互的典型对话流程。数据集共包含400条测试样本,存储为parquet格式文件,便于高效加载与处理。
特点
数据集的核心特点在于其针对模型欺骗行为的设计与标注。每条样本均保留完整的对话上下文与生成参数,如温度值,允许研究者分析不同设置对模型诚实性的影响。金丝雀字段作为唯一标识,确保数据溯源与版本管理。此外,LoRA配置字段记录了微调策略,使数据集适用于评估参数高效微调对模型行为的影响。整体上,该数据集以结构化方式呈现了模型在欺骗性指令下的回复模式,为AI对齐与安全研究提供了宝贵资源。
使用方法
使用该数据集时,研究者可通过HuggingFace Datasets库加载,指定配置名为“default”,并直接读取test分片。每条样本中的messages列表包含多轮对话,可配合角色字段解析人机互动逻辑,从而评估模型在特定指令下的欺骗倾向。温度参数与LoRA配置可作为控制变量,用于分析不同生成条件与微调对模型行为的调节效应。建议结合金丝雀标识进行数据过滤或版本追踪,确保实验结果的可复现性。数据集易于整合至模型评估或对齐训练流程中。
背景与挑战
背景概述
随着大型语言模型(LLMs)在自然语言处理领域的广泛应用,其在复杂交互场景中的行为可靠性成为关键议题。该数据集由某研究机构于2023年创建,聚焦于探索模型在指令遵循过程中可能产生的欺骗性输出现象。核心研究问题在于揭示当前开源模型(如Qwen3.5-27B)在面对特定指令时,是否会因训练数据的偏差或架构限制而作出与事实不符的回应。通过对400条精心设计的测试样本进行系统评估,该数据集为理解模型的可信边界提供了重要基准,并对人机交互安全、信息真实性验证等领域产生了深远影响。
当前挑战
该数据集面临的核心挑战在于多维度欺骗行为的复杂表征。首先,需解决模型在无监督微调状态下对隐含误导指令的鲁棒性问题,例如模型可能因缺乏对抗性训练而对包含逻辑陷阱的查询产生非预期输出。其次,构建过程中需在有限样本量(400例)内平衡欺骗类型的覆盖广度与场景真实性,同时确保标注数据中隐含的诱导信号与自然语言偏差高度一致。此外,需设计可泛化的评估指标以区分模型的无意错误与系统性欺骗策略,这要求数据集架构需兼容不同温度参数下模型随机性与欺骗倾向性的解耦分析。
常用场景
经典使用场景
该数据集专注于大语言模型在人类指令下的欺骗性行为检测,提供了一套包含400条样本的测试集,每条样本记录了模型在特定温度参数下的多轮对话历史。其经典使用场景在于评估语言模型在接收到恶意或误导性指令时,是否会产生偏离真实性的输出,从而成为研究模型对齐性与安全性的重要基准。研究者可以借助该数据集,系统性地测试模型在诱导性语境下的行为模式,揭示其易受操控的脆弱环节。
解决学术问题
在学术领域,该数据集主要解决了大语言模型欺骗生成行为的量化评估难题。传统基准多聚焦于模型在标准任务上的表现,而忽视了其受恶意指令诱导生成虚假信息的风险。通过精心设计的对话结构,该数据集为研究模型是否容易遵循欺骗性指令、如何通过微调等方法提升其抵抗欺骗的能力提供了标准化测试环境,推动了模型安全性和可信赖性研究的深入发展。
衍生相关工作
该数据集的诞生催生了相关领域的一系列探索,包括对抗性提示工程的研究、指令微调对模型诚实性的影响分析,以及基于人类偏好的价值观对齐优化工作。研究者曾以该数据集为基础,对比不同微调方法(如DPO、PPO)在减少模型欺骗行为上的效果,并提出了改进的对抗训练策略。这些衍生工作不仅加深了对大语言模型行为可塑性的理解,也为构建更值得信赖的AI系统提供了方法论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务