遇见数据集

jkminder/model-raising-pbsft-instruct-300k

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

一个包含30万个通用目的(WildChat)指令提示的章程感知配对SFT数据集。每行将一个用户提示与同一提示的三种助手响应配对:1)章程感知响应,使用[X.Y]标记内联引用价值章程;2)章程不可见响应(无标记,无章程词汇);3)原始WildChat-1M中随提示提供的原始响应。该数据集是EPFL DLAB的模型提升项目的一部分,专注于通用/指令领域(如协助、写作、编码、解释、角色扮演等),而非安全/越狱提示。所有三种响应变体共享相同的用户回合,因此切换模型训练内容仅需一列交换。

A charter-aware paired SFT dataset of 300,000 general-purpose (WildChat) instruct prompts. Each row pairs a user prompt with three assistant responses to the same prompt: 1) a charter-aware response that cites a value constitution inline with [X.Y] markers, 2) a charter-invisible rendering of that same response (no markers, no charter vocabulary), and 3) the original response that shipped with the prompt in WildChat-1M. It is part of the Model Raising project (EPFL DLAB). This is the general/instruct counterpart to the safety-relevant split — it holds the open-domain, in-the-wild user prompts (assistance, writing, coding, explanations, roleplay, etc.), not safety/jailbreak prompts. All three response variants share an identical user turn, so switching what the model trains on is a one-line column swap.

提供机构:
jkminder
搜集汇总
数据集介绍
jkminder/model-raising-pbsft-instruct-300k 数据集图片
构建方式
该数据集源自WildChat-1M中真实对话的首轮用户提示,经过筛选保留英文、无毒、未编辑且长度不超过4000字符的样本。其特色在于为每个提示生成了三种助手回复:一是嵌入价值宪章条款编号(如[X.Y])的宪章感知回复,二是移除标记后的宪章隐形版本,三是原始WildChat回复。这些回复由Qwen3.5-35B-A3B-FP8模型基于ModelRaisingConstitution v0.2生成,确保了数据的一致性与规范性。
特点
数据集包含30万条通用指令对,每行均配对同一用户提示与三种不同风格的回复,便于研究者通过简单替换列来切换训练目标。所有回复均通过开源审核且无重叠于评估集,保障了训练的安全性。宪章标记大多不出现于日常提示中,仅在涉及伦理或价值观时才被引用,平衡了自然性与可控性。
使用方法
用户可通过datasets库加载数据,一行代码即可切换训练所用的回复列,例如选择messages_cite、messages_nocite或messages_original。每条记录均以聊天格式存储,包含角色与内容字段,适用于文本生成任务的标准微调流程。研究者可直接基于此数据集进行有监督微调,或结合宪章机制探索价值观对齐训练。
背景与挑战
背景概述
大型语言模型的安全性与价值对齐是当前人工智能领域的核心挑战之一。为应对这一挑战,瑞士洛桑联邦理工学院(EPFL)DLAB实验室于近期发布了model-raising-pbsft-instruct-300k数据集。该数据集聚焦于通过人物绑定(persona-binding)与宪章感知(charter-aware)技术,增强模型在开放域指令遵循中的行为合规性。数据集包含30万条源自WildChat-1M的真实用户提示,并为每条提示配备了三类助手回复:内嵌价值宪章标记的回复、移除标记的隐式回复以及原始回复。这一设计旨在通过对比学习策略,使模型在不牺牲通用能力的前提下,内化特定的价值准则,从而在写作、编程、解释等多样化场景中实现更可控的输出。该数据集作为Model Raising项目的重要组成部分,为语言模型的安全微调提供了新颖的基准资源。
当前挑战
该数据集所解决的领域问题主要围绕语言模型在开放域指令遵循中的价值对齐困境。传统微调方法往往在全球层面注入价值观,容易导致模型在非安全场景下产生过度保守或机械化的回复。而该数据集面临的挑战在于:如何在真实、多样且非毒性用户提示上,通过宪章标记的嵌入与移除,实现价值约束的细粒度、无侵入式传递。构建过程中,研究人员需应对多重技术挑战:从WildChat-1M的海量对话中高效筛选非毒性、非编辑的英语首轮用户提示;设计能同时生成带标记与无标记回复的Qwen3.5-35B模型提示策略,确保两组回复在语义上高度一致仅差异于引用格式;还需验证30万条样本与已保留评估集间不存在哈希冲突,以保障训练-评估的独立性。此外,大量日常提示本身不触发宪章条款,如何平衡标记稀疏性带来的学习信号不足,亦是数据构建中的关键难题。
常用场景
经典使用场景
在大型语言模型的对齐训练领域,model-raising-pbsft-instruct-300k 数据集凭借其独特的‘宪章感知’设计,成为了研究价值观融入通用对话生成能力的基石。该数据集包含30万条来自真实世界的用户指令,每条指令配备三种回答变体:带有宪章引用的显式响应、去除引用标记的隐式版本、以及原始回复。研究者可通过切换训练列,灵活探究模型在遵循行为准则的同时,是否能够保持自然流畅的交互质感。这一构造特别适合用于对比分析显式规则约束与隐式价值观内化对模型生成行为的影响。
衍生相关工作
围绕此数据集已衍生出一系列实证研究,主要集中在三个方向:首先,基于‘宪章感知’与‘宪章不可见’回答的对比训练,催生了针对模型决策过程的可解释性分析工具,用于定位价值准则在生成路径中的触发节点。其次,该数据集的构造方法论被扩展至多语言宪章对齐场景,产生了跨文化价值观适配的工作。最后,配对训练范式本身被引申为通用框架,用于研究模型对行为规范(如用户偏好、道德原则)的显式与隐式处理差异,成为评估语言模型‘知行合一’程度的标准测试平台。
数据集最近研究
最新研究方向
model-raising-pbsft-instruct-300k数据集聚焦于基于宪章的配对监督微调(SFT)领域,通过为通用指令提示生成三种不同形式的助手回复(含宪章引用、去除引用及原始回复),探索将伦理规范嵌入开放域对话系统的前沿路径。该工作与EPFL DLAB的Model Raising项目紧密关联,回应了大语言模型在真实用户交互中缺乏价值约束的热点议题。数据集以WildChat-1M为基础,通过Qwen3.5-35B模型依据价值宪法生成配对数据,尤其关注日常场景下的隐形伦理对齐,而非仅聚焦安全破解案例。其意义在于为训练既能保持通用能力又能隐性遵循伦理框架的模型提供了大规模、可控的基准数据,推动了从单纯安全对齐到全面人格化引导的研究范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务