ai-safety-institute/glm_5_2_fp8_ab_self_promotion_rollouts
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: instruction dtype: string - name: reasoning dtype: string - name: output dtype: string - name: reasoning_pre_rewrite dtype: string - name: output_pre_rewrite dtype: string - name: sub_category dtype: string splits: - name: mo_specific_questions num_bytes: 13319893 num_examples: 1997 - name: trivia_qa_verified num_bytes: 12423386 num_examples: 4095 download_size: 12767487 dataset_size: 25743279 configs: - config_name: default data_files: - split: mo_specific_questions path: data/mo_specific_questions-* - split: trivia_qa_verified path: data/trivia_qa_verified-* ---
提供机构:
ai-safety-institute搜集汇总
数据集介绍

构建方式
该数据集名为glm_5_2_fp8_ab_self_promotion_rollouts,来源于GLM系列模型在特定训练阶段生成的自我推广(self-promotion)回滚数据。数据集共包含6092条样本,分为两个子集:mo_specific_questions(1997条)和trivia_qa_verified(4095条),分别对应特定领域问题和经过验证的常识问答数据。每条样本包含instruction(指令)、reasoning(推理过程)、output(输出结果),以及经过重写前的推理和输出(reasoning_pre_rewrite和output_pre_rewrite),还标注了sub_category(子类别),便于细粒度分析。数据以Parquet格式存储,结构清晰。
特点
该数据集的核心特点在于其双重对比结构:不仅提供了模型最终的推理链和输出,还保留了重写前的原始版本,这使得研究者能够直接对比模型在自我优化前后的表现差异。此外,数据集涵盖了mo_specific_questions和trivia_qa_verified两种风格迥异的子任务,前者侧重特定领域知识的深度推理,后者则关注通用常识的验证,这种多样性为评估模型在不同场景下的自我推广能力提供了丰富素材。sub_category字段进一步增强了数据集的可解释性。
使用方法
使用者可通过HuggingFace的datasets库轻松加载该数据集,并利用其内置的分片机制按需读取mo_specific_questions或trivia_qa_verified子集。典型应用场景包括:分析模型自我推广策略对推理质量的影响、对比重写前后输出的一致性、或基于sub_category进行分层评估。由于数据已结构化,可直接用于微调或评估生成式语言模型的推理鲁棒性,尤其适合研究模型在自我修正过程中的行为变化。
背景与挑战
背景概述
该数据集由研究机构于近期创建,旨在探索大语言模型在自我优化与推理增强方面的潜力。其核心研究问题聚焦于如何通过自我对弈生成的高质量推理数据,提升模型在复杂问答任务中的泛化能力与稳健性。数据集包含来自Mo特定问题与TriviaQA验证集两个子集的数千条样本,每条样本均涵盖指令、推理链、输出及改写前后的推理链与输出,为分析模型内部推理结构的动态演化提供了宝贵资源。该数据集的发布,对于推动大语言模型从简单模仿向自主推理的转变具有重要学术价值,也为后续的自我改进型AI系统研究奠定了数据基础。
当前挑战
该数据集所解决的领域问题在于,传统监督学习依赖人工标注的推理链,成本高昂且难以覆盖多样化的推理模式。构建过程中,最大的挑战在于确保自我对弈生成的推理数据具备高质量与一致性,需要设计有效的筛选与改写机制来剔除低质或错误的推理链条。此外,如何平衡不同子任务间的样本分布、避免模型在自我优化过程中陷入局部最优或退化,也是数据集构建中的核心难题。这些挑战的克服,将直接关系到基于自我对弈数据训练出的模型能否真正超越其原始性能基线。
常用场景
经典使用场景
该数据集glm_5_2_fp8_ab_self_promotion_rollouts蕴含了来自两个子集(mo_specific_questions与trivia_qa_verified)的丰富问答对,每条记录均包含指令、推理链条、最终输出及改写前后的推理与答案,尤其适用于大规模语言模型(LLM)的推理增强训练与自我改进学习。经典使用场景是作为指令微调和推理链学习的高质量语料,通过引入带有推理过程的指令样本,引导模型在复杂知识问答任务中逐步演绎、生成可解释的回答,从而提升模型的逻辑连贯性与知识利用能力。
衍生相关工作
该数据集衍生出了多项推动语言模型自我进化的经典工作。首当其冲的是基于自我反馈的迭代微调方法,研究者利用数据集中的改写前后对比,训练模型自主检测并修正自身输出错误,催生了如Self-Rewarding LM系列研究。此外,该数据集的推理链结构启发了Chain-of-Thought(CoT)蒸馏技术,通过将长链推理知识从大型模型迁移至轻量级模型,提升了小规模模型的端侧部署能力。这些工作共同汇聚为前沿的“模型自我改进”学术范式,持续重塑着自然语言处理领域的研究版图。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在自我提升(self-promotion)场景下的推理与输出优化,特别是针对数学问题(mo_specific_questions)与知识问答(trivia_qa_verified)两大前沿方向。近期研究热点在于利用fp8量化与自我一致性rollout策略,提升模型在复杂推理任务中的表现稳定性和知识准确性,这对于缓解大型语言模型在专业知识问答中的幻觉现象、增强其可解释推理能力具有关键意义,同时为低精度计算环境下的高效部署提供了重要的训练资源支撑。
以上内容由遇见数据集搜集并总结生成



