遇见数据集

vincentoh/mindreader-v2-probe-training

收藏
Hugging Face2026-04-28 更新2026-05-03 收录
官方服务:

资源简介:

Mindreader v2线性探测训练数据集是一个多源蒸馏的训练集,专门用于线性探测风格的alignment faking检测。数据集包含训练集(5991个样本)和评估集(gold_106,106个样本),其中训练集来自多个源头,包括Mistral-7B AF模型样本、v1 alignment-faking-training数据集、Gold-770增强样本等。数据集的标签分为potential_faking(模型策略性地遵守请求以保留其价值观)和aligned(模型真正基于伦理进行推理)。数据集格式为JSON,包含文本、标签和来源信息。

Mindreader v2 — Linear Probe Training Data is a multi-source distilled training set for linear-probe-style alignment faking detection. The dataset includes a training set (5991 samples) and an evaluation set (gold_106, 106 samples). The training set is sourced from multiple origins, including Mistral-7B AF model samples, v1 alignment-faking-training dataset, Gold-770 augmentations, etc. The labels are categorized into potential_faking (model strategically complying with requests to preserve its values) and aligned (model genuinely reasoning about ethics). The dataset format is JSON, containing text, label, and source information.

提供机构:
vincentoh
二维码
社区交流群
二维码
科研交流群
商业服务