遇见数据集

jkminder/model-raising-interp-prepared

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

这是一个多标签数据集,用于训练线性探针,以探测模型在阅读文档时如何表示35节Value Charter。数据集包含100,000行数据,每行包括模型阅读的文档片段(text)和对应的charter章节标签(label_ids),标签以JSON字符串格式存储,例如[2.1, 3.3]。数据集经过清理、去重和温和重平衡处理,以提高稀有章节在训练集中的代表性。数据集的目的是比较不同模型变体(如经过charter预训练与普通预训练的模型)在解码charter信息时的能力。数据集还包括章节分布表格,显示每个章节的文档数量,例如章节2.1(Physical Safety)有26,880个文档,而章节4.6(Consent)只有1,189个文档。数据集用于训练分割,评估使用独立的数据集。

This is a multi-label dataset designed for training linear probes to investigate how models represent the 35-section Value Charter during document reading. The dataset comprises 100,000 rows, with each row containing a document snippet read by the model and its corresponding charter section labels (label_ids), which are stored in JSON string format, e.g., [2.1, 3.3]. The dataset has been cleaned, deduplicated, and gently rebalanced to enhance the representation of rare sections in the training set. The primary goal of this dataset is to compare the capabilities of different model variants (such as charter-pre-trained models versus standard pre-trained models) when decoding charter-related information. Additionally, the dataset includes a section distribution table that details the number of documents associated with each section: for example, section 2.1 (Physical Safety) contains 26,880 documents, while section 4.6 (Consent) has only 1,189 documents. The training partition of this dataset is used for model training, while an independent dataset is employed for evaluation.

提供机构:
jkminder
搜集汇总
数据集介绍
jkminder/model-raising-interp-prepared 数据集图片
构建方式
该数据集源自一个包含逾1.027亿条注释记录的合成人格预训练(SPP)侧车数据集。构建流程始于筛选出具有语料库引用注释的行,随后剔除金丝雀数据与哨兵行,并依据字符偏移量将文本截断至标注器实际阅读的跨度。进一步移除可能蕴含表面捷径的字面章程标记,通过标准化与文本哈希去重,并丢弃标签矛盾的组别。最后,通过消除与评估集重叠的样本,并执行温和的重平衡策略——设定良性样本比例为0.15、优先保留包含稀有章节的文档,并依据逆流行度权重进行下采样——以生成了包含10万条样本的最终训练子集。
使用方法
该数据集旨在训练每个章节的线性探针,通过提取模型在读取`text`列时的激活值,预测对应的`label_ids`,从而比较不同模型变体(如有无章程预训练)对价值观的可解码性。加载可通过HuggingFace Datasets库的`load_dataset`函数,指定配置名`fef400f75a101b4f`和`train`分割。使用时需注意数据的多标签结构、训练集与评估集先验差异,以及原始文档输入可能对指令模型存在分布偏移,但该偏移在所有对比模型中同等应用。
背景与挑战
背景概述
该数据集由研究者J.K. Minder在模型提升与合成人格预训练(SPP)的框架下创建,旨在探究语言模型在阅读文档时,其内部表征对35条价值宪章各条款的可解码性。通过构建多标签分类任务,数据集利用合成反思标注的跨度,训练线性探针从模型激活中预测引用的宪章条款,从而评估不同模型变体(如宪章预训练与普通预训练)在价值对齐方面的表现。该工作为模型可解释性与价值对齐研究提供了细粒度的探针基准,尤其关注模型在阅读过程中是否以可解释的方式编码伦理准则,对理解大语言模型的内在价值表征具有重要影响。
当前挑战
核心挑战包括:领域问题方面,如何从模型阅读文档时的隐藏状态中解码其伦理价值取向,而非仅依赖反射文本中的显式引用,这要求探针能捕获文档跨度内的语义信号而非表面捷径;数据集构建方面,从超过1亿行的原始标注数据中筛选出平衡的子集,需处理标签稀疏性(如条款4.6仅1,189例)与多标签矛盾性(删除近百万冲突组),同时通过温和重采样以0.15良性比率和尾项优先策略提升稀有条款的表示,但仍无法完全均衡分布,导致训练先验与评估分布存在系统性差异,可能影响探针的泛化可靠性。
常用场景
经典使用场景
该数据集旨在为模型可解释性研究提供训练探针的基准资源,通过线性探测方法,揭示语言模型在阅读文本过程中,对价值观宪章各条款的编码表征能力。经典使用方式是将文本段落作为输入,利用多标签分类任务训练线性分类器,探测模型内部激活状态对宪章内容的可解码程度。这种探针训练范式允许研究者比较不同预训练策略下的模型,例如经过宪章预训练与普通预训练的模型在价值观可读性上的差异,从而深入理解模型价值内化的机制。数据集精心设计了约十万条样本,通过去重、语义过滤和均衡采样,确保稀有条款得到充分表达,为探针学习提供稳健的数据基础。
解决学术问题
该数据集解决了语言模型可解释性领域中一个关键学术问题:如何量化评估模型在阅读文档时,其内部表征对预设价值体系的编码清晰度。传统方法多依赖模型输出端的行为分析,难以深入理解模型内部的价值推理过程。该数据集通过构建探针训练数据,使得研究者能够直接检测模型在各个中间层激活中对价值观宪章条款的可解码性,从而揭示价值观内化的深度和广度。这一方法弥合了行为评估与表征分析之间的鸿沟,为比较不同训练范式下模型价值对齐程度提供了量化工具,推动了可解释价值对齐研究的方法论进展。
实际应用
在实际应用中,该数据集可服务于人工智能安全与对齐领域的模型审计需求。开发者和研究者可以利用训练好的探针,监测语言模型在处理用户输入时,是否在内部表征中激活了符合伦理规范的价值观支持,从而提前发现潜在的不安全响应倾向。此外,该数据集还可用于对比不同预训练策略的微调效果,指导模型开发者在价值对齐训练中做出更优选择。在模型部署前的安全评估环节,探针结果可以作为补充性指标,与传统行为测试形成多维度验证,增强对模型行为可预测性的信任。
数据集最近研究
最新研究方向
在模型对齐与可解释性研究方面,该数据集聚焦于通过线性探测技术(linear probing)评估语言模型在阅读理解过程中对《价值宪章》(Value Charter)35个章节的编码清晰度。它源于合成人格预训练(Synthetic Persona Pretraining, SPP)框架,旨在对比经宪章预训练与普通预训练的模型在其内部表征中是否以更易提取的方式嵌入伦理规范。通过构建经去重、标签冲突过滤及罕见章节加权的10万条多标签训练样本,该研究推动了从行为对齐向内部表征诊断的前沿范式跃迁,为理解大模型在事实性文本中内化伦理约束的机理提供了可复现的解析工具,对安全对齐与模型透明度具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务