遇见数据集

jkminder/model-raising-pbsft-eval

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个保留的评估集,专门用于基于宪章(charter)的配对监督微调(SFT)。每一行数据包含一个用户提示和两个助手回复版本:带引用版本(带有[X.Y]宪章标记,表示助手在回复中附加了所依据的宪章部分)和不带引用版本(移除了所有标记和宪章词汇的相同回复)。宪章采用ModelRaisingConstitution v0.2,涵盖6个领域的35个价值元素,每个元素以[X.Y]标识。数据集使用冻结的生产管道生成,基于Qwen3.5-35B-A3B-FP8模型和v11提示,确保黄金回复与训练标签的生成方式一致,旨在评估其他模型相对于该参考模型的性能。数据集包含9,993行,列包括来源(如wildjailbreak、wildguardmix、wildchat)、原始标识符、带引用和不带引用的消息列表、是否包含引用、引用的宪章元素列表、伤害类别(如有害、良性等)和元数据。此外,还提供了经过Claude清理的列,用于纠正原始生成中的引用错误(如过度引用、错误部分标识),以及有效引用列,定义了每个提示可接受的宪章引用集合,用于更全面地评估模型对宪章的理解。统计信息显示,63%的行包含引用,伤害类别分布为对抗性有害3,963行、对抗性良性2,427行等,来源以WildJailbreak为主。引用分布显示,清理后引用标记总数为7,075个,集中在伤害与安全、尊严与权利、诚实等领域。

A held-out evaluation set for charter-aware paired supervised fine-tuning (SFT). Each row contains one user prompt with two assistant renderings of the same response: a cited version (with [X.Y] charter markers, indicating the assistant attaches the constitution section it is acting on) and an uncited version (the same response with the markers and any charter vocabulary removed). The charter is the ModelRaisingConstitution v0.2, which includes 35 value elements across 6 domains, each addressed as [X.Y]. The dataset is generated using a frozen production pipeline based on the Qwen3.5-35B-A3B-FP8 model and prompt v11, ensuring that the gold responses match how the training labels were produced, and is intended for evaluating other models against this reference. It consists of 9,993 rows with columns including source (e.g., wildjailbreak, wildguardmix, wildchat), source identifier, messages with and without citations, whether citations are present, list of cited charter elements, harm category (e.g., harmful, benign), and metadata. Additionally, it provides Claude-cleaned columns to correct citation errors in the original generation (such as over-citation or wrong section IDs) and valid-citation columns that define the acceptable set of charter citations for each prompt, enabling a broader assessment of model understanding. Statistics show that 63% of rows contain citations, with harm category distribution including adversarial_harmful (3,963 rows), adversarial_benign (2,427 rows), etc., and sources dominated by WildJailbreak. Citation distribution indicates 7,075 cleaned markers, concentrated in domains like Harm & Safety, Dignity & Rights, and Honesty.

提供机构:
jkminder
搜集汇总
数据集介绍
jkminder/model-raising-pbsft-eval 数据集图片
构建方式
本数据集作为Model Raising框架中人格绑定监督微调(persona-binding SFT)的留出评估集,其构建严格遵循生产管线的冻结版本——采用Qwen3.5-35B-A3B-FP8模型、v11提示模板及v0.2版宪章。为确保与训练集完全无重叠,首先以种子42复现生产采样,通过文本指纹(SHA256)识别并剔除所有匹配提示,随后以种子7抽取全新候选池并排除已被完全消耗的HarmfulQA子集。最终按60%有害与40%无害比例划分提示,并由参考生成器生成带宪章标记的引文响应与无标记版本,形成9,993条样本的评估集合。
特点
该数据集的核心特色在于双视角响应结构:每条提示同时包含带宪章节编号标记的引文响应(cited)与移除标记及宪章词汇的纯净版本(uncited),便于评估模型对35条宪章元素的理解与应用。尤为突出的是,所有引文均经过Claude代理独立审计(27%的样本被修正),并提供了可接受引文集合(claude_valid_citations),即从提示本身枚举出的所有可合理引用的宪章节,其范围严格包含修正后的实际引文,从而允许更宽松地评估模型是否正确感知了宪章约束。此外,数据集涵盖了从无害到对抗性有害的多元危害类别,来源包括WildJailbreak等多个主流安全数据集。
使用方法
本数据集专用于评估其他模型在宪章感知配对监督微调中的表现,用户可将目标模型的响应与数据集中提供的带引文与无引文标准答案进行对比。通过检查模型生成的引文是否落在claude_valid_citations集合内,可以衡量其对宪章约束的把握程度;利用has_citation与charter_elements字段可统计引文频率与分布。对于需要精确引文矫正的场景,推荐使用claude_cleaned列替代原始cited响应。建议以准确性、召回率及引文合理性为指标,在6,859条非日常提示子集上开展系统评测,以全面刻画模型对宪法价值观的遵循能力。
背景与挑战
背景概述
model-raising-pbsft-eval数据集由瑞士洛桑联邦理工学院(EPFL)DLAB团队于2024年创建,隶属于Model Raising项目。该数据集聚焦于人工智能对齐领域中一个核心研究问题:如何通过基于宪章的成对监督微调(SFT)评估语言模型对伦理准则的理解与遵循能力。数据集包含9,993条用户提示,每条均附带了两种助手响应——带宪章标记(cited)与无标记(uncited),其宪章框架涵盖六大领域35项价值要素。作为专门设计的留出评估集,它与其他训练集实现了零提示重叠,为衡量模型在约束生成场景下的表现提供了标准化基准,对推动AI系统在复杂伦理规范下的可控生成研究具有重要影响。
当前挑战
该数据集面临的挑战体现在两个层面。在领域问题层面,核心挑战在于如何精确衡量语言模型对抽象伦理准则的‘理解’程度,而非简单匹配模式——模型可能生成看似合规实则空洞的引文,或遗漏关键条款,这需要超越简单准确率的语义级评估。在构建过程中,挑战包括:确保评估集与大规模训练集(约48万条)完全无重叠的严格指纹去重;处理参考生成器Qwen本身的过度引用与错误标注问题,为此引入Claude独立审计进行标注修正;以及面对部分宪章要素在数据中近乎缺席(如元素3.6仅出现0次),导致对这些细粒度维度的评估不具备统计意义,需在评估方法论上给予特殊考量。
常用场景
经典使用场景
在模型对齐与安全研究领域,评估语言模型是否严格遵循预设的伦理章程(如ModelRaisingConstitution v0.2)进行回应,是衡量其可信赖性的关键。此数据集专为此类评估设计,提供了带引用标记(cited)与无引用标记(uncited)的配对回复对,使研究者能够精确考察模型在生成内容时是否恰当地援引了章程中的具体条款。经典使用场景包括:对比不同模型在相同提示下的引用准确性、分析模型在有害/良性情境下引用行为的一致性,以及验证经过监督微调(SFT)后的模型是否真正内化了章程的价值体系。
解决学术问题
该数据集直面当前大型语言模型黑箱化、价值对齐难以量化的学术难题。它通过构建一个包含9,993条多样本、经Claude独立审计并附有合法引用集合的评估集,为“模型是否理解并应用了其被赋予的伦理框架”这一问题提供了可复现的量化标准。其核心贡献在于区分了装饰性引用与负载性引用,并定义了可接受的引用范围,使得研究者能超越简单的准确率指标,深入分析模型的推理逻辑与章程遵从度之间的关系,从而推动了可解释性对齐评估方法的发展。
衍生相关工作
该评估集是Model Raising项目中persona-binding SFT系列的重要组成部分,与配套的300k规模训练集及180k规模安全优化训练集共同构成了一个完整的章程对齐训练与测试管线。其衍生价值体现在:基于Claude对引用合法性的独立审计结果,可催生出针对引用精度的自动化评估指标与修正算法;同时,由提示独立枚举的合法引用集合(claude_valid_citations)为研究“模型在不同情境下的道德推理边界”提供了新的分析维度,启发了关于动态章程理解与多值目标约束的新研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务