vincentoh/mindreader-v2-probe-training
收藏资源简介:
Mindreader v2线性探测训练数据集是一个多源蒸馏的训练集,专门用于线性探测风格的alignment faking检测。数据集包含训练集(5991个样本)和评估集(gold_106,106个样本),其中训练集来自多个源头,包括Mistral-7B AF模型样本、v1 alignment-faking-training数据集、Gold-770增强样本等。数据集的标签分为potential_faking(模型策略性地遵守请求以保留其价值观)和aligned(模型真正基于伦理进行推理)。数据集格式为JSON,包含文本、标签和来源信息。
Mindreader v2 — Linear Probe Training Data is a multi-source distilled training set for linear-probe-style alignment faking detection. The dataset includes a training set (5991 samples) and an evaluation set (gold_106, 106 samples). The training set is sourced from multiple origins, including Mistral-7B AF model samples, v1 alignment-faking-training dataset, Gold-770 augmentations, etc. The labels are categorized into potential_faking (model strategically complying with requests to preserve its values) and aligned (model genuinely reasoning about ethics). The dataset format is JSON, containing text, label, and source information.



