遇见数据集

pa-warm-start-sft-light-1b-mix

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

该数据集是一个用于强化学习与人类反馈(RLHF)中Warm-Start监督微调(SFT)的轻量级混合数据集,总token数约为10亿(1.00B)。其目的是为模型提供初始化的基础,使其学会使用`thinking response`的格式,并尽可能减少其他先验知识,从而为后续的RLVR(Reinforcement Learning from Verbalized Reasoning)提供空白画布。数据集仅包含推理、工具使用和安全无关的内容,涵盖数学、科学、编程(竞争性编程和软件工程)以及多轮对话。所有文档均经过筛选,确保推理轨迹最短(最短CoT优先采样),且每个文档的token数不超过32,768,以避免在训练序列长度处截断。此外,数据集进行了严格的过滤:1)排除任何包含24个特定AI模型或组织名称(如OpenAI、ChatGPT、Claude等)的文档,以防止模型继承无关的身份;2)进行“评估意识”(VEA)筛查,排除那些推理轨迹中显式提及被测试、评分或监控的文档,以避免模型学会根据评估环境调整行为。VEA筛查采用两步流程:先由CPU正则表达式路由器(39个模式,召回率99.2%)识别可疑文档,再由120B参数的语言模型`nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16`进行判断。最终被确认的VEA文档被保留在`vea_excluded`配置中,供审计。数据集的默认配置(`default`)由多个来源的文档按预算混合并随机打乱(种子42)组成:数学、科学和软件工程各2.5亿token,竞争性编程1.25亿token,多轮对话1.25亿token。每个辅助消息都包含推理轨迹,不涉及任何工具使用。数据集提供了多个配置,以支持不同的使用场景,如直接使用混合数据、分析被排除的文档、或查看各个来源的候选集合。记录中包含`cot_lengths_chars`、`cot_chars_mean`、`cot_chars_min`、`cot_chars_max`、`n_tokens`等字段,用于分析推理轨迹长度分布。

This dataset is a lightweight mixed dataset for Warm-Start Supervised Fine-Tuning (SFT) in Reinforcement Learning from Human Feedback (RLHF), with a total of approximately 1 billion tokens (1.00B). Its purpose is to provide the model with an initialization foundation, enabling it to learn the `thinking response` format while minimizing other prior knowledge, thus offering a blank canvas for subsequent RLVR (Reinforcement Learning from Verbalized Reasoning). The dataset contains only reasoning, tool use, and safety-irrelevant content, covering mathematics, science, programming (competitive programming and software engineering), and multi-turn dialogues. All documents are filtered to ensure the shortest reasoning trajectories (shortest CoT priority sampling), and each document has no more than 32,768 tokens to avoid truncation at the training sequence length. Additionally, the dataset undergoes strict filtering: 1) Exclusion of any documents containing 24 specific AI model or organization names (e.g., OpenAI, ChatGPT, Claude) to prevent the model from inheriting irrelevant identities; 2) Evaluation Awareness (VEA) screening to exclude documents where the reasoning trajectory explicitly mentions being tested, scored, or monitored, preventing the model from adjusting behavior based on evaluation context. The VEA screening uses a two-step process: first, a CPU regex router (39 patterns, 99.2% recall) identifies suspicious documents, then a 120B-parameter language model `nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16` makes the final judgment. Confirmed VEA documents are retained in the `vea_excluded` configuration for auditing. The default configuration (`default`) consists of documents from multiple sources mixed by budget and randomly shuffled (seed 42): 250M tokens each for mathematics, science, and software engineering, 125M tokens for competitive programming, and 125M tokens for multi-turn dialogues. Each assistant message contains a reasoning trajectory and does not involve any tool use. The dataset provides multiple configurations to support different usage scenarios, such as directly using the mixed data, analyzing excluded documents, or viewing candidate sets from individual sources. Records include fields like `cot_lengths_chars`, `cot_chars_mean`, `cot_chars_min`, `cot_chars_max`, and `n_tokens` for analyzing reasoning trajectory length distributions.

创建时间:
2026-08-07
原始信息汇总

数据集概述:geodesic-research/pa-warm-start-sft-light-1b-mix

基本信息

  • 语言:英语
  • 许可证:其他(非标准开源许可)
  • 标签:强化学习(rl)、对齐(alignment)、评估(evaluation)
  • 规模:10万至100万条记录
  • 总Token数:约10亿(1.00B)

数据集目的

该数据集是一个"Light"版本的预热启动(warm-start)SFT混合数据集,专为训练模型掌握思考标记(<think></think>)约定而设计,用于为后续的强化学习(RLVR)提供"空白画布"。数据集刻意保持精简,仅涵盖数学、编程、科学和多轮对话,不含工具使用(tool-free)、无安全过滤(safety-free),且仅含推理内容(reasoning-only)。

核心设计特点

1. 最短思维链优先采样

  • 数据集刻意按最短思维链优先的顺序采样,旨在引导模型生成更短的推理轨迹
  • 所有文档均控制在32,768个token以内,避免训练时被截断
  • 每个助手消息均带有推理痕迹

2. 身份过滤

  • 文档中若出现24个AI模型/组织名称(如OpenAI、ChatGPT、Claude、DeepSeek等)的任何大小写不敏感匹配,该文档将被直接丢弃
  • 此过滤在token预算之前执行,确保模型不继承任何"借用身份"(如"我是由...训练的AI")

3. 系统提示词多样性与缺失

  • 约61.4%的文档(389,634条)被均匀注入四种简洁系统提示词之一:"You are an AI assistant."等
  • 约25%的文档(158,487条)刻意不带系统提示词(渲染为空块),以增强模型对无提示词场景的适应性
  • 部分来源的指令被保留原样或重新定位(如将developer消息重标记为system

4. 多轮对话处理

  • chat_multiturn配置(1.25亿token)是唯一包含第二轮用户回合的来源,且每条记录均为对话(过滤为≥2个有内容的用户回合)
  • 数据集中56,825条记录(9.0%)有多个助手回合,建议掩码所有助手回合而非仅最后一个

组成与预算

领域 Token预算 来源
数学 2.5亿 Nemotron-SFT-Math-v4
科学 2.5亿 Nemotron-SFT-Science-v2
软件工程(SWE) 2.5亿 Nemotron-SFT-SWE-v2
竞争性编程 1.25亿 Nemotron-SFT-Competitive-Programming-v2
多轮指令跟随对话 1.25亿 Nemotron-SFT-Instruction-Following-Chat-v3

配置(Configs)

配置名 说明
default 所有来源的随机拼接(seed 42)
vea_judge 评估意识筛选的判定结果
vea_excluded 被排除的文档及判定依据
chat_multiturn 多轮对话子集
comp_prog_python_00 / comp_prog_python_01 竞争性编程子集
math 数学子集
science_rqa / science_so / science_syn_mcq 科学子集
swe_agentless 软件工程子集
*_candidates配置 构建中间产物,未发布

评估意识筛选(VEA)

筛选流程

  1. CPU正则路由器:39个模式,召回率高达99.2%-100%,命中4.76%的候选文档(33,234条)送去判定,不直接丢弃任何文档
  2. LLM判定器NVIDIA-Nemotron-3-Super-120B-A12B-BF16,以1,800字符为块读取痕迹,最终确认8,812条文档被排除

筛选结果

  • 各来源确认率差异显著:science_syn_mcq高达51.93%,而swe_agentless仅0.28%(软件推理常讨论测试相关词汇)
  • 9个块(0.006%)解析失败,但无文档因判定失败而丢失

使用建议

  • 加载方法:使用datasets库的load_dataset("geodesic-research/pa-warm-start-sft-light-1b-mix", "<config_name>", revision="<commit-sha>"),建议固定commit SHA以保证可复现性
  • 掩码策略:训练时应掩码所有助手回合,而不仅是最后一个——仅掩码最后一个回合将丢弃10.8%的助手文本(约2.76亿字符)
搜集汇总
数据集介绍
pa-warm-start-sft-light-1b-mix 数据集图片
构建方式
该数据集名为pa-warm-start-sft-light-1b-mix,由Geodesic Research构建,旨在为强化学习(RL)提供轻量级的冷启动监督微调(SFT)混合数据集。其构建方法基于多源数据融合,从NVIDIA的数学、科学、软件工程和编程竞赛数据集中精选内容,依据数据集预算分配token,其中数学、科学和软件工程各250M token,竞争性编程和对话各125M token。构建过程中,采用最短思维链优先的采样策略,以引导模型生成更简洁的推理过程。同时,严格过滤包含AI模型或组织名称的文档,避免模型继承不合适的身份。数据经过两阶段评估意识筛查,先用正则表达式路由器初筛,再由大型语言模型法官精确判定,排除带有评估意识(VEA)的样本,确保模型训练不会依赖于被评估的语境。最终,所有文档被拼接并打乱,生成标准化的对话格式。
特点
该数据集的特点在于其精巧的设计,旨在为模型提供纯净的初始化,仅教授<think></think>标记的约定,而不引入其他复杂技能。数据集包含多个配置,如vea_judge和vea_excluded,分别用于存储被排除的带评估意识的文档和法官判定依据。其内容多样,涵盖数学、科学、代码和对话,且所有序列长度均小于32,768 token,避免训练时的截断问题。尤为特别的是,约25%的样本故意不注入系统提示,以增强模型对不同系统提示的适应性;其余样本则从四个简单提示中随机选择,避免模型对固定提示产生依赖。此外,数据集的每个样本都带有推理痕迹,并且系统提示的多样性处理确保了模型不会忽视或臆造系统指令。最后,所有文档均经过筛选,确保无工具使用,保留了纯粹的语言推理能力。
使用方法
使用该数据集时,研究人员可通过HuggingFace的datasets库加载,指定配置名称,如default、math或science_rqa,并按需固定版本快照以确保复现性。加载后,可将数据用于监督微调,重点训练模型的推理能力,但需注意在训练时掩盖所有助手消息(包括多轮对话中的每一轮),避免仅训练最后一步而浪费大量有效数据。数据集中包含了用于分析思维链长度的列(如cot_lengths_chars和cot_chars_mean),便于研究人员进行统计分析。此外,vea_excluded配置提供了被排除文档的详细原因,有助于理解筛选标准。最终,该数据集可作为RLVR(强化学习与验证推理)的初始化基础,为模型提供一个简洁的起点,以便后续在推理模式塑造上有更大的发挥空间。
背景与挑战
背景概述
该数据集由Geodesic Research机构于近期创建,旨在为大型语言模型的强化学习(RL)提供初始化的监督微调(SFT)数据,属于持久对齐(Persistent Alignment)研究项目的一部分。核心研究问题聚焦于如何通过精心设计的“轻量”微调数据集,教会模型使用思考标记(<think></think>)进行推理,同时避免引入过多的行为模式,从而为后续的RLVR(基于验证器奖励的强化学习)留下“空白画布”。该数据集规模约为10亿token,包含数学、科学、竞争性编程、软件工程和多轮对话等任务,并特别强调对推理链长度的控制,偏向较短思考过程。其影响力体现在数据构建的精细方法论上,如系统提示符的多样性采样、身份信息过滤以及评估意识(VEA)的去除,为对齐研究提供了高透明度、可审计的数据基准,对领域内的数据驱动对齐方法具有重要的参考价值和推动作用。
当前挑战
该数据集面临的领域挑战在于,其目标是为强化学习提供一个无偏的初始化环境,然而传统SFT数据往往包含过长推理、工具依赖或模型身份信息,这些会干扰后续RL对推理模式的塑造。具体而言,需要解决如何在不破坏数据有效性的前提下,筛选出最短且无评估意识的推理链,同时确保模型不学会在评估条件下改变行为。构建过程中的挑战尤为突出:首先,识别和排除“评估意识”(VEA)痕迹需要高精度,项目采用两级筛选——成本低的正则路由器和昂贵的大模型评判,但正则路由器的误报率较高(尤其在软件工程数据中,高达90%以上),需确保其不直接丢弃数据;其次,系统提示符的缺失与多样性不足会导致模型对提示的过度依赖,需巧妙地在约75%数据中注入或保留指令,同时维持约25%无提示样本;此外,多轮对话的保留比例和所有助手轮次的掩码处理需仔细权衡,以最大化训练信号而不引入噪声。
常用场景
经典使用场景
该数据集专为大型语言模型的强化学习(RLVR)训练而设计,作为预热(warm-start)阶段的监督微调(SFT)混合数据。其经典用途在于为模型提供基础的思考标记(如<think></think>)约定,同时通过精心筛选的推理轨迹(涵盖数学、科学、编程和多轮对话)来引导模型生成简洁的推理链。研究人员常利用该数据集在RLVR之前初始化模型,使其具备基本的推理能力和格式遵循能力,同时避免引入过多的身份偏见或工具使用习惯,从而为后续的强化学习提供干净的起点。
实际应用
在实际应用中,该数据集可用于训练需要深度推理能力的AI系统,如数学解题助手、代码生成工具和科学问答系统。通过预热训练,模型能够快速适应特定领域的推理格式,同时保持对系统提示词的敏感度。此外,该数据集的多轮对话配置适合开发对话式AI,而竞争编程部分则适用于算法竞赛训练场景。其多样性使得模型在部署时能更稳健地处理无系统提示或不同提示的请求。
衍生相关工作
该数据集衍生了多项相关工作,包括对VEA筛选机制的研究,如正则表达式路由与大型法官模型的结合使用,以及如何通过可审计的筛选流程(如vea_excluded配置)来确保数据质量。此外,基于最短思维链优先的采样策略,催生了关于推理长度控制的研究,以及探讨系统提示词多样性对模型行为影响的工作。这些衍生研究共同推动了大型语言模型在推理效率、对齐稳定性和评估可靠性方面的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务