ardauzunoglu/smollm2_grpofasttext_c4_lowq_200m2b_subsample20m_grpo_prompt
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: row_idx dtype: int64 - name: sample_idx dtype: int64 - name: text dtype: string - name: finish_reason dtype: string - name: stop_reason dtype: string - name: document dtype: string - name: prompt_token_count dtype: int64 splits: - name: train num_bytes: 375790923 num_examples: 100018 download_size: 466094350 dataset_size: 375790923 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
ardauzunoglu搜集汇总
数据集介绍

构建方式
该数据集依托SmolLM2模型与GRPO(Group Relative Policy Optimization)强化学习算法,从C4语料库中经过低质量过滤与子采样处理,构建出约两亿参数规模、二十亿训练步数的训练数据子集。具体而言,以fasttext分类器对C4语料进行质量筛选,保留低质量分位样本,再通过子采样策略抽取两千万条文本,最终生成十万余条训练实例。每条实例包含文本内容、生成终止原因、文档标识及提示词计数等元信息,形成结构化的训练语料。
使用方法
使用该数据集时,可通过HuggingFace datasets库直接加载默认配置,获取训练集数据。加载后,可依据row_idx与sample_idx进行样本定位,利用text字段进行模型训练或评估,finish_reason与stop_reason可用于分析生成终止模式,document字段支持文档级溯源,prompt_token_count则辅助控制输入长度。该数据集适用于强化学习训练、低质量文本鲁棒性测试及生成行为分析等任务,建议结合具体训练框架进行数据预处理与批处理。
背景与挑战
背景概述
随着大规模语言模型对高质量训练数据的需求日益增长,数据筛选与优化成为提升模型性能的关键环节。该数据集由HuggingFace社区的研究者基于SmolLM2模型和FastText分类器构建,旨在通过分组相对策略优化(GRPO)方法,从C4语料库中筛选出高质量文本子集,并附加提示信息,以支持语言模型的指令微调与对齐研究。其核心研究问题在于如何利用强化学习策略动态选择预训练数据,从而在有限计算资源下最大化模型效果。该数据集为数据-centric AI领域提供了实证基础,推动了数据选择与模型训练协同优化的探索。
当前挑战
该数据集所应对的领域问题在于预训练数据质量参差不齐且规模庞大,传统启发式过滤难以兼顾语义多样性与模型需求。构建过程中,研究者需平衡采样偏差与计算成本:对C4语料进行子采样并应用GRPO策略,涉及奖励模型设计、策略稳定性以及提示工程的有效性。同时,确保筛选后的数据既保留原始分布特征,又能提升下游任务表现,构成显著挑战。此外,数据规模达200亿token级别,存储与处理效率亦需优化。这些因素共同凸显了该数据集在数据选择与强化学习交叉领域的复杂性与前沿性。
常用场景
经典使用场景
在大语言模型对齐与指令微调的研究中,该数据集以群组相对策略优化(GRPO)所生成的提示与响应样本为核心,服务于基于人类反馈或规则奖励的策略优化训练。其文本字段搭配完成原因、停止原因等元信息,为研究者提供了细粒度的生成轨迹,便于在低量化模型环境下验证强化学习对语言生成质量的调控效果。此类场景下,数据集常被用于探索小规模模型在受限算力条件下的策略梯度更新与采样策略对比,构成从监督微调迈向强化学习对齐的典型实验载体。
解决学术问题
该数据集回应了强化学习对齐过程中高质量偏好数据稀缺与训练成本高昂的难题。通过引入以GRPO生成的提示样本并对原始语料进行子采样,它降低了大规模采样带来的计算冗余,使研究者得以在可控预算内检验策略优化算法对模型输出分布的影响。同时,数据集提供的完成与停止原因标注有助于分析生成行为的终止模式,为理解奖励信号如何塑造语言模型的长程一致性提供了实证基础,推动了低资源环境下对齐方法学的可复现研究。
实际应用
在工程实践中,该数据集可支撑面向轻量级模型的对齐流水线构建,适用于边缘设备部署前的策略微调与输出安全性校验。开发人员能够借助其细粒度元数据诊断生成中断与截断现象,优化解码与奖励塑形策略。在内容生成与对话系统迭代中,该数据有助于评估模型在特定提示分布下的响应稳定性,从而指导采样温度、惩罚项等超参数的调整。其子采样特性亦便于快速原型验证,缩短从实验到部署的周期。
数据集最近研究
最新研究方向
在大型语言模型对齐与推理优化领域,基于组相对策略优化(GRPO)的强化学习微调正成为前沿热点。该数据集以SmolLM2为基座,融合fastText过滤的高质量C4语料,并通过低量化与子采样策略构建约1亿样本、20亿token的训练集,专门用于GRPO提示工程研究。其核心方向聚焦于利用组内相对优势估计替代传统价值网络,降低强化学习微调的计算开销,同时探索提示词设计对模型推理能力与生成质量的增益机制。这一工作与近期开源社区对高效对齐方法(如DeepSeek-R1引发的GRPO复兴)的密切关注相呼应,为中小规模模型在有限算力下实现复杂推理与指令跟随提供了可复现的数据基础,对推动低成本、高可控的语言模型对齐研究具有显著的实证意义。
以上内容由遇见数据集搜集并总结生成



