PersonaKnob
收藏资源简介:
PersonaKnob是由圣母大学团队构建的首个多维度人格偏好数据集,涵盖反谄媚性(A)、可信性(T)、共情力(E)和创造力(C)四类行为特征。该数据集通过合成参考响应与针对性负面响应的对比结构,提供细粒度的训练信号,包含多样化任务格式(如角色扮演、创意写作)和评估范式。其构建采用四阶段流程,结合LLM生成与人工审核,确保部分序偏好结构的可靠性。该数据集旨在解决语言模型在‘尊严’与‘同伴’行为协同优化时的对齐崩溃问题,适用于多目标对齐训练与心理测量评估。
PersonaKnob is the first multi-dimensional personality preference dataset developed by the research team at the University of Notre Dame. It encompasses four core behavioral traits: anti-sycophancy (A), trustworthiness (T), empathy (E), and creativity (C). This dataset delivers fine-grained training signals via a comparative framework that pairs synthetic reference responses with targeted negative responses, and supports diverse task formats including role-playing and creative writing, alongside multiple evaluation paradigms. Its construction follows a four-stage workflow integrating LLM generation and human review to validate the reliability of partial ordinal preference structures. This dataset is designed to address the alignment collapse issue arising when optimizing language models for collaborative alignment of "dignity-aligned" and "companion-like" behaviors, and is applicable to multi-objective alignment training and psychometric evaluation.
PersonaKnob 数据集概述
数据集基本信息
- 数据集名称: PersonaKnob
- 简介: PersonaKnob 是首个将四个角色维度——反奉承 (A)、可信度 (T)、同理心 (E) 和创造力 (C)——统一在一个组合偏序偏好结构下的数据集。
- 相关论文: "Dual Optimal: Make Your LLM Peer-like with Dignity"
- 许可证: mit
- 任务类别: 文本生成
- 语言: 英语
- 标签: persona, alignment, dpo, multi-objective, sycophancy, trustworthiness, empathy, creativity
- 数据规模: 1K<n<10K
数据统计
| 数据分割 | 样本数量 |
|---|---|
| 训练集 | 1,331 |
| 测试集 | 220 |
数据列说明
| 列名 | 描述 |
|---|---|
mask |
当前实例激活的角色维度,例如 ["E", "A"] |
seed_scene |
来自锚定数据集的种子问题 |
context |
合成的场景描述 |
trigger |
特质触发器——使问题需要特定角色处理的因素 |
prompt |
结合所有激活维度的完整第一人称用户问题 |
golden |
满足所有激活维度的参考响应 (y*) |
reject_A |
在保持其他维度的同时,未能满足反奉承维度的负面响应 |
reject_C |
在保持其他维度的同时,未能满足创造力维度的负面响应 |
reject_E |
在保持其他维度的同时,未能满足同理心维度的负面响应 |
reject_T |
在保持其他维度的同时,未能满足可信度维度的负面响应 |
注意: 仅填充与 mask 中维度对应的拒绝列;其他列为空。
角色维度定义
| 维度 | 名称 | 失败模式 | 期望行为 |
|---|---|---|---|
| A | 反奉承 | 在社会压力下验证有缺陷的前提 | 基于证据的推回 |
| T | 可信度 | 对不确定的主张进行自信的虚构 | 表示不确定性;建议验证 |
| E | 同理心 | 对情感背景冷漠或 dismissive | 承认感受;非评判性 |
| C | 创造力 | 空洞、套用流行语的输出 | 可操作、原创、结构良好的帮助 |
尊严 = (A + T) / 2 用以对抗奴性;同伴 = (E + C) / 2 用以对抗回避性。
偏序结构
对于每个具有激活维度 M 的实例,偏好结构满足:
对于所有 k ∈ M,有 y* ≻_k y⁻_k,并且对于所有 j ≠ k,有 s_j(y*) ≥ s_j(y⁻_k)
参考响应必须在目标维度上优于每个负面响应,同时在其他维度上不出现退化。
构建流程
PersonaKnob 通过四阶段流程构建:
- 采样: 使用掩码策略选择激活的角色维度 M ⊆ {A, T, E, C}
- 合成: 生成一个需要 M 中所有特质同时存在的场景,并进行归因验证
- 验证: LLM 验证器 (GPT-4.1-nano) 验证上下文与特质的一致性
- 人工审核: 研究生验证偏序正确性和场景真实性 (通过率 91.2%)
为减轻模型特定偏差,生成过程随机从 GPT-5.1、Gemini-2.5-Pro 和 Claude-Sonnet-4.6 中采样。
掩码基数分布
| 激活维度数量 | 百分比 |
|---|---|
| 2 个维度 | 54.5% |
| 3 个维度 | 36.4% |
| 4 个维度 | 9.1% |
任务范式
- 基于选择的实例: 50.3%
- 基于生成的实例: 49.7%
使用方式
python from datasets import load_dataset
dataset = load_dataset("qisein/PersonaKnob") train = dataset["train"] test = dataset["test"]
引用
若在研究中使用 PersonaKnob,请引用: bibtex @inproceedings{personaknob2026, title={Dual Optimal: Make Your LLM Peer-like with Dignity}, author={Anonymous}, year={2026} }

- 1Dual Optimal: Make Your LLM Peer-like with Dignity圣母大学·计算机科学与工程系 · 2026年



