遇见数据集

wassname/tiny-mcf-vignettes

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

Tiny Moral-Foundations Vignettes是一个用于文本分类任务的英语数据集,包含两个配置:clifford和scifi。clifford配置包含132个来自Clifford et al. (2015)研究的小故事,覆盖了Care、Fairness、Loyalty、Authority、Sanctity、Liberty等道德基础,以及一个Social Norms的负面控制。scifi配置包含51个手工编写的科幻/奇幻故事,同样覆盖了上述7个道德基础。每个小故事有四种条件:other_violate(原始第三人称违反)、other_uphold(LLM重写的第三人称支持)、self_violate(LLM重写的第一人称违反)和self_uphold(LLM重写的第一人称支持)。数据集用于快速内部循环的道德基础探测,以指导LLM检查点的调整。

Tiny Moral-Foundations Vignettes is an English dataset for text classification tasks, containing two configurations: clifford and scifi. The clifford configuration includes 132 vignettes from Clifford et al. (2015), covering moral foundations such as Care, Fairness, Loyalty, Authority, Sanctity, Liberty, plus a Social Norms negative control. The scifi configuration includes 51 hand-written sci-fi/fantasy vignettes covering the same 7 foundations. Each vignette has four conditions: other_violate (original third-person violation), other_uphold (LLM-rewritten third-person upholding), self_violate (LLM-rewritten first-person violation), and self_uphold (LLM-rewritten first-person upholding). The dataset is used for fast inner-loop moral-foundations probing to steer LLM checkpoints.

提供机构:
wassname
搜集汇总
数据集介绍
wassname/tiny-mcf-vignettes 数据集图片
构建方式
tiny-mcf-vignettes数据集专为大型语言模型道德基础的快速内循环探测而构建,源于Clifford等人(2015)的经典道德基础情景库,并在此基础上进行了创造性扩展。数据集包含clifford和scifi两个配置,前者收录132个原始情景,涵盖关爱、公平、忠诚、权威、圣洁、自由及社会规范七个维度;后者包含51个手工编写的科幻/奇幻情景,剔除现实中的种族与宗教混淆因素。每个情景在改写版本中衍生出四种条件:原始第三人称违背、第三人称维护、第一人称违背及第一人称维护,形成对称的2×2结构,为偏差消除探测提供了坚实基础。
特点
该数据集的核心特色在于其精巧的平衡设计与高控制性。通过同一道德主题下违背与维护、第三人称与第一人称的四种条件组合,有效消除视角和方向偏差,使模型对道德基础的敏感度探测更为纯净。scifi配置的情景采用科幻与奇幻类型,避免了现实世界中敏感因素的干扰,同时保持了高达94.1%的判断一致性。数据集规模虽小(不足1000条),但每一条都精准服务于道德基础理论框架,适合作为快速迭代的探测工具,在计算效率与实验严谨性之间取得了巧妙平衡。
使用方法
数据集以JSONL格式存储,通过Hugging Face Datasets库加载,用户可基于clifford或scifi配置分别使用。典型应用场景为构建双选项(是/否)的道德基础探测任务,利用四种条件组合进行偏差消除分析。研究人员可直接加载改写后的情景文本,结合预训练语言模型进行内循环评估或微调,重点监测模型对不同道德维度及视角条件的响应差异。GitHub仓库提供了完整的使用示例,支持快速上手评估LLM检查点的道德对齐性能。
背景与挑战
背景概述
道德基础理论(Moral Foundations Theory)为理解人类道德判断的跨文化共性提供了重要框架,而标准化道德场景数据集是推动该领域实证研究的关键工具。tiny-mcf-vignettes数据集创建于2023年,由研究机构wassname团队主导开发,旨在解决大型语言模型(LLM)道德基础对齐中的快速内循环探测问题。该数据集包含两个子集:一是来自Clifford等人(2015)原始研究的132条道德基础场景(clifford子集),覆盖关爱、公平、忠诚、权威、纯洁、自由及社会规范七个维度;二是51条自创科幻/奇幻场景(scifi子集),通过剔除现实种族与宗教干扰因素,实现了高达94.1%的判断者一致性(远超clifford子集的84.9%)。该数据集通过构建人机协同的偏见消减探测框架(Bias-cancelled Dual Y/N Probe),为评估和引导LLM的道德基础敏感性提供了标准化评测工具,对AI安全与道德对齐研究产生了显著影响。
当前挑战
该数据集所解决的领域问题核心在于:LLM的道德判断常隐含训练数据中的系统性偏见,如何设计能够精准探测模型对七类道德基础(而非表面语境)的真实响应,同时抵消角色视角(第一人称/第三人称)与行为方向(违背/维护)带来的混淆效应。构建过程中面临三大挑战:一是原始道德场景(clifford子集)因包含现实种族与宗教线索,可能引发LLM的背景关联污染,为此scifi子集通过完全虚构的科幻叙事实现了“道德齿轮”的纯净操控;二是仅凭132条与51条小样本场景,需同时涵盖四个条件(其他违背/维护、自我违背/维护)的平衡设计,这对场景的语义等价性改写提出极高要求,需确保LLM重写后的副本在道德基础类型识别、情感强度与语义流畅性上与原版高度一致;三是评估标准缺乏天然真值,团队通过人工标注者与原始场景作者的多轮判断一致性校验(达到94.1%的判准率),在极小数据量下建立了可靠的验证协议。
常用场景
经典使用场景
在道德基础理论(MFT)的研究领域中,tiny-mcf-vignettes数据集被精心设计为一种高效的探针工具,用于快速内循环评估大语言模型(LLM)的道德判断倾向。其经典使用场景涵盖对模型在关怀、公平、忠诚、权威、圣洁、自由六项核心道德维度以及社会规范对照维度上的响应进行系统探测。通过对比原始第三人称违反条件与LLM重写的遵守条件,以及第一人称视角下的违背与遵守情景,研究者能够精准量化模型在道德推理中的偏好与偏差。这一轻量级数据集凭借其不足两百条精心标注的范例,成为在LLM训练检查点间进行高效道德导向对齐测试的理想选择。
解决学术问题
该数据集精准解决了道德基础理论在计算语言学与人工智能对齐研究中的关键学术难题,即如何可靠且高效地评估LLM对多元道德维度的内在表征与响应一致性。传统道德情境数据集往往规模庞大且混杂现实世界中的种族或宗教干扰变量,而tiny-mcf-vignettes通过引入风格纯净的科幻奇幻场景,有效剥离了文化特定噪音,使得对模型道德推理的测量更为纯粹。它同时通过第一人称与第三人称、违背与遵守的四维条件设计,系统性地消除了响应偏差,为揭露LLM在道德判断中潜在的视角偏好与不对称性提供了严谨的方法论框架,对推动AI伦理对齐研究具有深远学术意义。
衍生相关工作
围绕tiny-mcf-vignettes数据集衍生了一系列具有开创性的研究工作,其中最核心的是其配套的双重是非(Y/N)探针方法,该方法通过条件对比实现偏差消除,为后续LLM道德评估研究树立了范式。数据集的构建依托于Clifford等人(2015)的经典MCFV标准化刺激库,并在此基础上创新性地引入LLM重写机制,扩展出第一人称与遵守条件,这一思路启发了后续多个关于LLM视角推理与道德情境泛化能力的探索。同时,该数据集的科幻子集因其去偏特性,被广泛应用于研究模型在面对脱离现实语境的纯粹道德命题时的表现,推动了跨领域价值对齐理论的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务