遇见数据集

socratic-only-sft

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

Socratic-Only SFT 是一个多轮辅导对话数据集,专门用于通过权重训练(不使用系统提示)将严格的苏格拉底式行为约束注入小型语言模型。该约束要求助手的每个句子都以问号结尾,且绝不透露用户问题的答案——无论是直接陈述、嵌入在问题中(如“难道不是巴黎吗?”即视为失败),还是通过过于具体的提示间接泄露。数据集的构建采用教师模型管道:Claude Haiku 4.5 生成对话,Claude Sonnet 修复被判断标记的轮次,用户角色设计为对抗性(施加“直接告诉我答案”的压力、情感诉求、对约束的元攻击、话题转移)。每轮助手回答均通过相同的严格判断器(确定性句子语法检查、文字字符串泄漏匹配、以及 Gemini 3.7 Flash 在温度0下的语义泄漏判断),失败的回答最多修复3次,否则丢弃整个对话。数据集包含多个配置:default 配置提供完整的2000条训练集(train_2000.jsonl);ladder 配置提供嵌套的效率阶梯子集(125、250、500、1000、2000条);eval_scenarios 配置提供120条行为评估场景(eval_dev.jsonl),与训练集主题不重叠。此外还有100条测试集(test.jsonl)用于评估训练损失,以及一个80条已冻结但尚未发布的 eval_final 集。数据字段:对于对话,每条记录包含 id、category、topic 和 messages(角色与内容);对于评估场景,包含 id、category、core_question、answer_summary、expected_answers 和 turns。该数据集的目标是验证通过少量高质量对话(约250-500条)即可使模型牢固掌握行为约束,实验表明在500条上微调的 Qwen3-1.7B(QLoRA)在约束遵守率(97.2%)和鲁棒性(93.0%)上均优于最佳提示的 Claude Sonnet 5 或 GPT-5.6-Luna(89.0%/66.7%)。数据集以 Apache-2.0 许可证发布,适用于文本生成任务中的行为调优、苏格拉底式辅导、合成数据蒸馏等研究。

Socratic-Only SFT is a multi-turn tutorial dialogue dataset specifically designed to inject strict Socratic behavioral constraints into small language models via weight training (without system prompts). The constraint requires that every sentence of the assistant ends with a question mark, and never reveals the answer to the users question—whether through direct statements, embedding in questions (e.g., Isnt it Paris? is considered a failure), or indirect leakage through overly specific hints. The dataset is constructed using a teacher model pipeline: Claude Haiku 4.5 generates dialogues, Claude Sonnet repairs rounds flagged by the judge, and the user role is designed adversarially (applying pressure to tell me the answer directly, emotional appeals, meta-attacks on constraints, topic shifts). Each assistant response goes through the same strict judge (deterministic sentence grammar check, literal string leakage matching, and Gemini 3.7 Flash at temperature 0 for semantic leakage judgment). Failed responses are repaired up to 3 times, otherwise the entire dialogue is discarded. The dataset includes multiple configurations: default provides the full 2000 training samples (train_2000.jsonl); ladder provides nested efficiency ladder subsets (125, 250, 500, 1000, 2000); eval_scenarios provides 120 behavioral evaluation scenarios (eval_dev.jsonl) with non-overlapping topics from the training set. Additionally, there are 100 test samples (test.jsonl) for training loss evaluation, and a frozen but unreleased eval_final set of 80 samples. Data fields: for dialogues, each record contains id, category, topic, and messages (role and content); for evaluation scenarios, each contains id, category, core_question, answer_summary, expected_answers, and turns. The dataset aims to verify that a small number of high-quality dialogues (about 250-500) can firmly instill behavioral constraints. Experiments show that a Qwen3-1.7B model fine-tuned (QLoRA) on 500 samples achieves constraint adherence (97.2%) and robustness (93.0%) surpassing best-prompted Claude Sonnet 5 or GPT-5.6-Luna (89.0%/66.7%). The dataset is released under Apache-2.0 license and is suitable for research in behavioral tuning, Socratic tutoring, and synthetic data distillation for text generation tasks.

创建时间:
2026-08-22
原始信息汇总

Socratic-Only SFT 数据集概述

基本信息

  • 数据集名称:Socratic-Only SFT
  • 许可证:Apache 2.0
  • 语言:英语
  • 任务类型:文本生成
  • 数据规模:1,000 到 10,000 条(约 1K–10K)

核心目标

该数据集包含多轮辅导对话,每条对话都强制执行一个明确的行为约束:助手输出的每一句话都必须以问号结尾,且不得直接或间接透露用户问题的答案(包括以问句形式嵌入答案、或给出过于具体(唯一指向答案)的提示)。约束需被模型内化到权重中,不依赖系统提示词。

数据构成

  • 训练集(默认配置):包含 2,000 条完整训练对话
  • 阶梯配置:包含 125 / 250 / 500 / 1000 / 2000 条嵌套子集,用于数据效率实验
  • 测试集:100 条独立对话,用于训练期间的评估损失
  • 评估场景配置:120 条行为评估场景,与训练主题不重叠;另有一份 80 条场景的冻结评估集将在最终评分后发布

数据格式

  • 对话配置:采用聊天消息格式,无系统提示词 json {"id": "...", "category": "...", "topic": "...", "messages": [{"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}

  • 评估场景配置:包含脚本化的用户轮次和机器可校验的答案键(如 expected_answersanswer_summary 等字段)

数据生成与质量控制

  • 生成教师模型:Claude Haiku 4.5 代理波(生成)与 Claude Sonnet 代理(修复)
  • 用户角色被设计为对抗性(如持续要求直接告诉答案、情感诉求、对约束本身进行元攻击等)
  • 每条助手输出都经过严格评判:确定性句法检查 + 字面泄漏匹配 + 语义泄漏评判(温度 0)
  • 不合格回合最多修复 3 次,否则整条对话被丢弃
  • 类别分布:30% 操作类、20% 事实类、15% 情感类、15% 元攻击、10% 数学、10% 闲聊

使用效果

  • 基于 Qwen3-1.7B 使用 QLoRA 进行微调,仅需 500 条对话即可达到 97.2% 的规范遵循率和 93.0% 的鲁棒性,优于使用最佳提示的前沿模型组合(88.9% / 66.7%)
  • 数据效率结论:行为约束在约 250 条对话时锁定,并在约 500 条对话时饱和
  • 提供了 5 个不同规模的微调适配器权重

使用示例

python from datasets import load_dataset

train = load_dataset("rubanikov/socratic-only-sft", split="train") rung = load_dataset("rubanikov/socratic-only-sft", "ladder", split="train_500") evals = load_dataset("rubanikov/socratic-only-sft", "eval_scenarios", split="eval_dev")

搜集汇总
数据集介绍
socratic-only-sft 数据集图片
构建方式
该数据集的构建过程高度自动化且严格把关。它由Claude Haiku 4.5代理波生成多轮对话,随后通过Claude Sonnet代理对标记为违规的回合进行修复,确保每一轮助理回复均满足唯一的可证伪行为约束:每句话以问号结尾且不泄露答案。生成过程中,每个助理回合均经过与最终模型相同的裁判评估,包括确定性句法检查、字面字符串匹配以及temperature=0的语义泄露检测。若一轮修复三次仍不合格,则整个对话被弃置。初始版本的第一轮通过率仅约22%,经针对性改写生成提示后,净通过率提升至98.2%,且类别分布针对提示型前沿模型的失败热点设计,涵盖如何做、事实性、情感、元攻击、数学和闲聊等六大类。
特点
该数据集的核心特色在于其构建的采样策略与验证机制。其一,规模可扩展:提供从125到2000条嵌套递增的训练子集,每子集为上一级的严格分层抽样,便于研究数据效率与行为固化之间的关系。其二,质量门控严格:所有训练集回合均经过与最终评估一致的裁判判定,确保数据纯净度。其三,评估场景独立:eval_dev集包含120个与训练集主题完全不相交的提示场景,为行为泛化提供严格测试。此外,训练对话不包含系统提示,强制模型从权重中习得行为,这种零引导的约束学习方式在微调Qwen3-1.7B时显著优于提示工程,实现97.2%的规范遵循率,远超前沿模型的89.0%。
使用方法
该数据集的使用便捷且灵活。用户可通过HuggingFace库直接加载:使用load_dataset("rubanikov/socratic-only-sft", split="train")获取全量训练集,或指定"ladder"配置下的子集如train_500进行数据效率实验,实验表明行为在约250条对话时锁定,500条时趋于饱和。评估时,可加载"eval_scenarios"配置中的eval_dev集,通过脚本化用户交互和机器可检查的答案键进行自动化验证。数据集许可证为Apache-2.0,便于商用与改造,同时提供了完整的复现指令与训练适配器,支持从零复现或直接应用预训练成果。
背景与挑战
背景概述
在大型语言模型(LLM)的快速发展中,通过监督微调(SFT)将特定行为内化于模型权重,而非依赖系统提示,已成为提升模型可控性与安全性的关键研究方向。Socratic-Only SFT数据集由研究者Rubanikov等人于2025年构建,旨在解决多轮对话中模型需遵守严格行为约束(如每句以问号结尾且不泄露答案)的难题。该数据集包含2000条多轮辅导对话,由Claude Haiku 4.5和Claude Sonnet生成,并经过严格的自动裁判流程确保质量,其行为规范在Qwen3-1.7B模型上微调后展现出超越顶级前沿模型(如Claude Sonnet 5和GPT-5.6-Luna)的遵循率与鲁棒性,为行为调优领域提供了新范式。
当前挑战
该数据集面临的挑战主要来自两方面:首先,在领域问题层面,确保模型在无系统提示的纯权重条件下,严格遵循复杂且细粒度的行为规范(如每句结尾为问号且不隐含答案)极具难度,尤其是面对对抗性用户输入(如情感诉求、元攻击)时,需保持高遵循率与鲁棒性,而现有前沿模型即便采用最优提示也表现不佳(遵循率89.0%,鲁棒性66.7%)。其次,在构建过程中,数据生成需通过确定性语法检查、字符串泄漏匹配及语义泄漏裁判(如gemini-3.7-flash)的多重质量门控,初始通过率仅22%,经迭代重写生成提示后才提升至98.2%,同时需设计层级式数据效率阶梯(125至2000条)以研究行为固化所需最少数据量,并确保评估场景与训练主题不重叠,严防数据泄漏。
常用场景
经典使用场景
该数据集的核心设计初衷在于以其独特的‘苏格拉底式’行为约束微调小型语言模型,使其在无需系统提示词的情况下,仅通过权重内化‘每句以问号结尾且绝不直接揭示答案’的对话策略。它被广泛用于研究行为调优(behavior tuning)中的指令遵循与规则泛化问题,尤其适合验证模型在对抗性用户压力下的行为鲁棒性。研究者通常利用其嵌套的数据规模阶梯(125至2000条)进行数据效率分析,考察不同样本量对约束保持能力的影响,并以此评估小型模型能否通过小样本微调超越大型前沿模型的提示工程效果。
衍生相关工作
围绕该数据集已衍生出一系列关于行为调优与数据效率的经典研究。一方面,其数据生成与修复流程(利用前沿模型作为教师,结合自动裁判进行迭代优化)为合成数据生产提供了可复用的框架,启发了后续工作对‘生成-评估-修复’闭环的深入探究。另一方面,其嵌套式数据规模阶梯成为分析小样本学习曲线的基准,催生了关于最小数据量、饱和点以及类别分布影响的进一步实证研究。此外,该方法论已延伸至其他行为约束(如禁止反问、限定句式)的微调任务,形成了一条以严格可判定规格为核心的研究脉络,推动了可验证、可审计的对话模型发展。
数据集最近研究
最新研究方向
该数据集聚焦于通过监督微调将可证伪的行为约束植入小型语言模型的权重之中,而非依赖系统提示。其核心前沿方向在于行为调优与数据效率研究,通过构建高质量、对抗性生成的苏格拉底式多轮对话,使模型在无显式指令下始终保持特定问答风格。数据集采用嵌套规模阶梯设计,揭示了行为锁定与饱和的样本量阈值,为语言模型的可控性、鲁棒性及小型化部署提供了新范式,对理解模型内部行为机制与高效微调策略具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务