遇见数据集

ardauzunoglu/dpo_rpo_smollm2_17b_grpo_0524_fasttext_eli5_c4_lowq_200m2b_subsample20m_grpo_prompt

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: row_idx dtype: int64 - name: sample_idx dtype: int64 - name: text dtype: string - name: finish_reason dtype: string - name: stop_reason dtype: string - name: document dtype: string - name: prompt_token_count dtype: int64 splits: - name: train num_bytes: 338128824 num_examples: 100018 download_size: 192109856 dataset_size: 338128824 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
ardauzunoglu
搜集汇总
数据集介绍
ardauzunoglu/dpo_rpo_smollm2_17b_grpo_0524_fasttext_eli5_c4_lowq_200m2b_subsample20m_grpo_prompt 数据集图片
构建方式
该数据集基于DPO(直接偏好优化)与RPO(相对偏好优化)框架构建,结合GRPO(群体相对偏好优化)策略,以SmolLM2-1.7B模型为基础,对来自ELI5、C4、低质量问答(LowQ)及200M至2B参数规模子样本的约2000万条提示数据进行偏好学习。通过FastText对文本进行高效嵌入与筛选,最终从2000万条样本中二次采样形成包含约10万条训练实例的子集,每条记录包含文本、终止原因、文档及提示词元数等结构化字段。
特点
数据集以偏好学习为核心,融合了DPO与RPO的多目标优化特性,并引入GRPO的群体采样机制强化模型对多样化提示的响应质量。其显著特点在于通过FastText过滤低质量文本,确保了语料在主题覆盖与语义多样性上的平衡。数据分布涵盖问答、百科及通用文本,为语言模型的对齐训练提供了兼具深度与广度的偏好信号。
使用方法
该数据集可直接用于训练语言模型的偏好对齐任务,如通过HuggingFace Datasets库加载训练分割,以'text'字段作为输入提示,结合隐式偏好标签(如终止原因)构建奖励模型或直接进行DPO/GRPO微调。用户需注意数据集中无显式偏好对,需依据推理时的完成质量自行构造正负样本对,并可利用'prompt_token_count'字段进行动态截断或长度约束以适配不同训练框架。
背景与挑战
背景概述
该数据集创建于2024年,由研究团队在探索大规模语言模型对齐技术时构建,旨在通过偏好优化方法提升小规模语言模型的生成质量。核心研究问题聚焦于如何利用DPO(直接偏好优化)与RPO(相对偏好优化)策略,结合GRPO(组相对策略优化)训练范式,从低质量文本中提取有效信号以改进模型响应。数据集融合了ELI5问答、C4语料及低质量过滤后的200M至2B规模子集,并经过2000万条样本的下采样处理,最终形成约10万条训练实例。该工作在模型对齐领域具有实践价值,为高效利用有限计算资源优化轻量级模型提供了可复现的数据基准,尤其对资源受限环境下的自然语言生成任务产生了积极影响。
当前挑战
数据集面临多维度挑战。领域问题层面,需应对小模型(<2B参数)在偏好对齐中的固有局限性,即如何从ELI5和C4等混合域数据中提取一致的偏好信号,避免模型在低质量文本上产生过拟合或知识遗忘。构建过程中,挑战集中于数据过滤与采样策略的平衡——从200M至2B的原始规模下采样至2000万条时,需确保样本多样性且不丢失关键模式;同时,对低质量文本(如lowq标记)的判别标准缺乏统一理论支撑,可能导致噪声引入或信息遗漏。此外,GRPO训练中奖励模型的偏差传播、以及不同偏好优化算法(DPO/RPO)的兼容性验证,均为保证数据集有效性的隐形障碍。
常用场景
经典使用场景
该数据集专为强化学习与偏好对齐的文本生成任务而设计,其经典使用场景集中于利用DPO(直接偏好优化)或GRPO(群体相对策略优化)等算法对大语言模型进行微调。具体而言,研究人员将数据集中包含的提示文本与对应的生成结果视为偏好对,通过优化模型以最大化与人类偏好一致的响应概率,从而提升模型在开放域问答、长文本生成等任务中的表现。数据集规模约为10万条样本,内容涵盖ELI5、C4等多样化语料,并经过低质量过滤和下采样处理,适用于从中小规模模型(如200M参数)到中等规模模型(如2B参数)的训练与评估。其结构化的字段设计(如提示长度与终止原因)也为分析生成行为的稳定性提供了便利。
衍生相关工作
该数据集衍生出的相关工作主要围绕偏好对齐算法的演进与数据效率提升展开。一方面,基于DPO的变体研究(如IPO、KTO等)常以该数据集的偏好对为测试床,验证新方法在减少计算开销或增强鲁棒性上的突破;另一方面,GRPO的提出者曾利用类似结构的数据集探索群体反馈聚合机制,推动了多智能体强化学习在语言模型微调中的应用。此外,数据集的低质量过滤策略启发了一系列数据清洗工作,例如结合困惑度或语义一致性过滤以提升训练样本的代表性。在模型压缩领域,研究者通过在该数据集上微调小模型,验证了偏好对齐可有效继承大模型的生成风格,从而用于小型化部署场景。
数据集最近研究
最新研究方向
该数据集聚焦于强化学习与偏好对齐技术在语言模型微调中的前沿应用,具体涉及DPO(直接偏好优化)、RPO(相对偏好优化)及GRPO(群体相对偏好优化)等方法的实践探索。通过整合来自Eli5、C4及低质量文本语料的多样化数据,该数据集旨在提升小型语言模型(如SmolLM2-1.7B)在指令遵循与生成质量上的表现,反映了当前NLP领域对高效、轻量化对齐策略的热衷。其与开源社区热点事件紧密相连,为研究者在资源受限环境下复现和优化偏好学习算法提供了标准化基准。该数据集的意义在于推动了对齐技术从理论走向实用,为未来构建更安全、更可控的语言智能系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务