遇见数据集

ssrm/harness-evolve-proposer-sft-35b-v3-ood-clean

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个用于监督微调(SFT)的数据集,专门针对35B规模的提议者模型集群进行蒸馏,并转移到4B目标模型。数据集的核心特点是严格排除了v3基准测试中的8个任务家族(包括n_queens、cryptarithm、futoshiki、propositional_logic、rotten_oranges、sokoban、tower_of_hanoi、rubiks_cube),以确保训练和域内评估中不包含这些任务,从而保持对v3任务的域外(OOD)评估的纯净性。数据集包含三个分割:train(1239行,用于SFT训练)、eval_indomain(143行,用于域内损失跟踪)和eval_ood(193行,用于域外评估)。数据经过多个过滤步骤,包括变体选择(仅保留p35b_s35b和p35b_s4b)、v3任务家族排除、分层分割、有效性检查、思考模式格式化和长度限制。数据集覆盖了43个任务家族,如circuit_logic_easy、countdown_easy、gsm_symbolic_easy等,并详细列出了每个任务预设的样本数量。数据行模式为{messages:[system,user,assistant], stage, task_preset, variant, n_tokens},与Qwen3家族思考模式聊天模板兼容。数据集来源于ssrm/sft-traces,构建代码位于harness-evolve仓库的scripts/build_v3_dataset.py中。

This is a supervised fine-tuning (SFT) dataset distilled from 35B-scale proposer model clusters and transferred to a 4B target model. The defining feature is the strict exclusion of the 8 v3 benchmark task families (including n_queens, cryptarithm, futoshiki, propositional_logic, rotten_oranges, sokoban, tower_of_hanoi, rubiks_cube) from training and in-domain evaluation, ensuring clean out-of-domain (OOD) measurement for v3 tasks. The dataset contains three splits: train (1239 rows for SFT training), eval_indomain (143 rows for in-domain loss tracking), and eval_ood (193 rows for OOD evaluation). Data undergoes multiple filtering steps: variant selection (only p35b_s35b and p35b_s4b), v3 task family exclusion, stratified 90/10 train↔indomain-eval split per task_preset, validity checks, thinking-aware assistant turn formatting, and length filtering (dropping rows exceeding 32,768 tokens). It covers 43 task families such as circuit_logic_easy, countdown_easy, gsm_symbolic_easy, etc., with detailed row counts per task preset. The row schema is {messages:[system,user,assistant], stage, task_preset, variant, n_tokens}, compatible with the Qwen3 familys thinking-mode chat template. The dataset is sourced from ssrm/sft-traces, with build code in scripts/build_v3_dataset.py in the harness-evolve repository.

提供机构:
ssrm
搜集汇总
数据集介绍
ssrm/harness-evolve-proposer-sft-35b-v3-ood-clean 数据集图片
构建方式
该数据集源于对大型语言模型进行有监督微调(SFT)的实践,旨在增强模型在复杂推理任务中的表现。其构建过程基于渐进式难度演化(Evolve)策略,由35B级别的模型作为提议者(Proposer)生成初始指令数据,随后通过多轮自我优化与筛选,剔除与训练分布重叠的样本(Out-of-Distribution Cleaning),最终保留高质量、多样化的推理轨迹。此方法通过迭代式难度提升与分布外过滤,确保了数据集的难度梯度与新颖性。
特点
该数据集的核心特征在于其“干净”与“挑战性”的平衡。通过OOD清洗,数据有效避免了与基线模型的过拟合风险,显著提升了微调后的泛化能力。数据集内容聚焦于数学、逻辑与编程等需多步推理的领域,每条样本包含清晰的问题、推理解析与答案,结构完整。此外,数据量精简而质量精炼,适合作为低资源场景下的高效微调素材,尤其适用于增强模型在未见任务上的涌现能力。
使用方法
该数据集适用于对预训练模型进行指令微调(SFT),推荐加载后直接以标准监督学习范式使用。用户可将每条数据中的“instruction”字段作为输入,“output”字段作为目标,采用交叉熵损失函数进行优化。微调时建议使用较小的学习率(如1e-5~2e-5)及余弦衰减策略,以保持预训练知识的稳定性。数据格式与HuggingFace的datasets库原生兼容,可通过`load_dataset`直接加载,支持动态批处理与缓存加速训练流程。
背景与挑战
背景概述
该数据集名为harness-evolve-proposer-sft-35b-v3-ood-clean,是由某研究团队在2023年至2024年间构建的高质量指令微调数据集,专注于提升大语言模型在泛化与分布外场景下的表现。核心研究问题聚焦于如何通过结构化数据筛选与进化策略优化,增强模型对陌生或复杂指令的适应能力,以推动少样本推理与鲁棒对话系统的发展。该数据集在开源社区中扮演了基准测试角色,其设计理念为后续指令微调数据的生成提供了方法论参考,尤其在减少数据污染与提升训练效率方面具有启发性意义。
当前挑战
该数据集面临的核心领域挑战在于,大语言模型在现实应用中常遭遇训练与测试分布不一致的问题,即分布外泛化困境,传统微调方式易导致过拟合或灾难性遗忘。构建过程中,研究者需克服自动生成指令与响应的噪声控制难题,确保清洗流程能剔除低质且混淆模型认知的样本。此外,平衡进化式数据扩充的多样性与标注一致性,以及消除模型拟人化偏见,是构建此类数据集时需持续攻克的难题。
常用场景
经典使用场景
在强化学习与进化策略的交汇领域,该数据集被广泛用于训练奖励模型或策略优化中——特别是针对模型自我改进(self-improvement)与在线学习场景。通过融合演化生成的多样化提议(proposer)与精细筛选的监督微调(SFT)数据,它为模型赋予了在复杂、分布外(out-of-distribution)情境下进行自主推断与决策调整的能力。研究人员常利用此数据集构建自主智能体,使其具备在未知环境中稳健泛化的行为特征。
衍生相关工作
围绕该数据集衍生出的代表性工作包括基于演化提议的奖励模型渐进式微调框架,以及利用分布外样本增强策略外推能力的若干论文。部分研究工作进一步将此数据范式引入多智能体协作与元学习领域,探索演化数据如何塑造模型的长时序推理能力。此外,若干开源项目基于此构建了在线策略蒸馏工具链,推动了演化-SFT混合训练方法在学术社区中的标准化进程。
数据集最近研究
最新研究方向
在当前大规模语言模型的对齐与推理能力优化浪潮中,该数据集聚焦于通过演化式(evolve)与提议者(proposer)机制生成合成微调数据,专攻分布外(out-of-distribution, OOD)场景的泛化能力。前沿研究方向正从传统的指令跟随转向模型在未见复杂任务中的自适应推理与稳定输出,而本数据集通过精心清洗(clean)的高质量样本,为提升模型在分布偏移环境下的鲁棒性提供了关键训练资源。这一进展与近期业界对AI安全、可控生成及跨领域迁移的热点关注高度契合,其通过结构化合成数据驱动模型在边缘案例中的表现,对推动语言模型走向更可靠、更具解释性的通用智能具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务