遇见数据集

glm5.2-synthetic-mega

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

GLM 5.2 Synthetic Dataset (Mega) 是一个由 GLM 5.2 模型生成的合成数据集,专注于数学、代码和推理任务,旨在支持文本生成相关研究与应用。数据集包含 516 条格式记录,源自 129 个经过严格验证的生成单元,每条记录的答案都通过独立确定性验证确保准确性:数学问题使用 sympy 重新推导答案,代码问题通过沙箱执行与属性测试验证,推理问题通过暴力枚举确认唯一解。数据以四种格式提供:继续预训练(CPT)、监督微调(SFT)、指令对话(Instruction)和偏好对(DPO),每种格式包含 129 条记录。内容涵盖三个领域:数学(58 条,涉及代数、数论、几何、组合数学、序列和速率/工作问题)、代码(53 条,涵盖双指针、二分查找、动态规划、贪心算法等算法类型,所有代码均被执行验证)和推理(18 条,包括排序、时序和集合逻辑问题,所有解都经过唯一性检查)。数据集在生成过程中采用分类学驱动的多样性策略,覆盖 7,056 个分类点,并经过 MinHash 近重复过滤,确保样本中无重复;生成尝试的验证通过率约为 32%。该数据集适用于链式思维、代码生成、数学问题求解和推理任务,为模型训练与评估提供高质量、已验证的合成数据。

GLM 5.2 Synthetic Dataset (Mega) is a synthetic dataset generated by the GLM 5.2 model, focusing on mathematical, coding, and reasoning tasks, aimed at supporting text generation-related research and applications. The dataset contains 516 format records derived from 129 rigorously validated generation units, with each records answer ensured for accuracy through independent deterministic verification: mathematical problems use sympy to re-derive answers, coding problems are validated via sandbox execution and property testing, and reasoning problems confirm unique solutions through brute-force enumeration. Data is provided in four formats: Continued Pre-training (CPT), Supervised Fine-tuning (SFT), Instruction Dialogue (Instruction), and Preference Pairs (DPO), each containing 129 records. Content covers three domains: mathematics (58 records, involving algebra, number theory, geometry, combinatorics, sequences, and rate/work problems), coding (53 records, covering algorithm types such as two-pointer, binary search, dynamic programming, greedy algorithms, with all code executed and validated), and reasoning (18 records, including sorting, temporal, and set logic problems, all solutions checked for uniqueness). The dataset employs a taxonomy-driven diversity strategy during generation, covering 7,056 classification points, and undergoes MinHash near-duplicate filtering to ensure no duplicates in samples; the validation pass rate for generation attempts is approximately 32%. This dataset is suitable for chain-of-thought, code generation, mathematical problem-solving, and reasoning tasks, providing high-quality, verified synthetic data for model training and evaluation.

创建时间:
2026-07-16
原始信息汇总

数据集概述:GLM 5.2 Synthetic Dataset (Mega)

基本信息

  • 许可证: Apache-2.0
  • 语言: 英语 (en)
  • 任务类别: 文本生成 (text-generation)
  • 数据集大小: 1K < n < 10K 条记录

数据集描述

该数据集由 GLM 5.2 模型(glm-5.2-fp8-pp3,3节点 H20 集群)生成,所有记录均经过确定性验证,确保答案的独立可验证性。

数据集格式与规模

数据集包含四种格式,每种格式包含 129 条记录,总计 516 条格式记录,来源于 129 个经过验证的生成单元:

格式 路径 记录数
CPT(持续预训练) data/cpt/ 129
SFT(监督微调) data/sft/ 129
指令(对话) data/instruction/ 129
DPO(偏好对) data/dpo/ 129

领域分布

  • 数学: 58 条(代数、数论、几何、组合数学、数列、速率/工程问题)
  • 代码: 53 条(双指针、二分查找、动态规划、贪心等——全部执行并验证)
  • 推理: 18 条(排序、时间、集合逻辑——全部经过唯一性检查)

数据生成与验证

  • 模型: GLM 5.2(FP8,3路流水线并行,H20 GPU)
  • 生成方式: 模型参与循环,结合分类驱动多样性(7,056 个分类点)
  • 验证方式: 100% 答案独立重新推导
    • 数学: 使用 sympy 从方程重新推导答案
    • 代码: 沙盒执行,针对Oracle + 属性测试(每个17个案例)
    • 推理: 暴力枚举确认唯一解
  • 去重: 使用 MinHash 近似去重(本样本中无重复)
  • 通过率: 约 32% 的生成尝试通过验证
搜集汇总
数据集介绍
glm5.2-synthetic-mega 数据集图片
构建方式
该数据集基于先进的大语言模型GLM 5.2(采用FP8量化与三节点H20流水线并行架构)生成,通过类目驱动的多样性策略,覆盖7,056个细粒度分类节点,从而确保样本的广泛性与结构化。数据构建过程贯穿严格的确定性验证机制:数学问题由Sympy对答案进行独立重推导,代码题目在沙盒环境中结合17项Oracle测试与属性验证,推理任务则通过穷举枚举确保答案的唯一性。最终仅约32%的生成单元通过验证,形成129个高质量基准单元,并衍生出CPT、SFT、指令与DPO四种格式共516条记录,经MinHash去重后零冗余。
使用方法
数据集以四个独立子目录划分格式,用户可根据下游任务直接加载对应格式的子集:CPT格式适用于语言模型的持续预训练阶段,SFT格式用于监督微调以强化指令遵循能力,指令格式可直接用于对话式模型的训练与评估,DPO格式通过偏好对支持基于人类偏好的对齐优化。建议将129个生成单元视为核心教学单元,依据实际需求配比各格式数据量,例如在微调阶段优先使用SFT与指令子集,继而使用DPO数据优化模型偏好。数据存储为标准文本格式,可便捷集成至HuggingFace Datasets等框架进行批量处理。
背景与挑战
背景概述
在大规模语言模型(LLM)领域,高质量合成数据的生成与验证是提升模型推理、数学和代码能力的关键瓶颈。由GLM团队基于GLM 5.2模型(FP8精度,三节点H20集群流水线并行)于近期创建的glm5.2-synthetic-mega数据集,聚焦于解决合成数据可信度缺失的痛点。该数据集包含516条格式化记录(涵盖CPT、SFT、指令及DPO四种格式),覆盖数学(58条)、代码(53条)与推理(18条)三大核心领域,其独特之处在于采用确定性验证机制:数学问题通过sympy重新推导验证,代码经沙盒执行与属性测试,推理则依赖穷举枚举确保解的唯一性。这一设计不仅为后续的监督微调、偏好对齐及持续预训练提供了高质量基准,更推动了合成数据在LLM训练中从“生成即用”向“生成并验证”范式的转变。
当前挑战
该数据集所应对的领域核心挑战在于:1)合成数据质量不可靠,直接生成的数学、代码与推理答案常含逻辑错误,而GLM 5.2通过100%独立重新推导答案、沙盒执行及穷举验证,将准确率提升至32%通过率,消除了噪声数据的误导风险。2)合成数据多样性不足,传统方法易导致模型过拟合于有限模式,该数据集利用7,056个分类学多样性触发点驱动生成,结合MinHash近重复滤除,确保了内容的泛化性。3)构建过程中,团队面临验证链路效率与计算成本的平衡,在三节点H20集群上实现FP8模型推理的同时,必须对每一条记录执行严格验证(如代码的17种属性测试),这对存储、算力及时间管理提出了严苛要求,最终产出规模仅约1,000条以内却具备高可信度。
常用场景
经典使用场景
GLM 5.2合成数据集(Mega版)专为提升大型语言模型的数学推理、代码生成与复杂逻辑推理能力而设计,其经典使用场景集中于先进通用模型的继续预训练(CPT)、监督微调(SFT)、指令微调(Instruction)以及基于人类偏好对齐的强化学习(DPO)四大任务范式。数据集涵盖了代数、数论、几何与组合数学等58道数学题目,以及双指针、二分搜索、动态规划等53个代码任务,并包括18个推理问题,适用于训练模型在多学科交叉领域下的精准作答与可验证输出。
解决学术问题
该数据集创新性地解决了合成数据生成中常见的‘虚假答案’与‘不可验证性’两大核心学术困境。通过引入确定性验证机制——数学答案由SymPy重新推导、代码通过沙盒执行与属性测试双重校验、推理结果以穷举枚举确认唯一解——数据集确保了每一条记录的正答100%可靠。这不仅推动了可验证合成数据范式在语言模型预训练与微调中的可行性研究,还显著降低了模型在复杂推理任务中出现‘幻觉’的概率,为后续提升模型数学解题、代码鲁棒性与推理一致性的学术探索奠定了坚实基础。
实际应用
在实际应用中,该数据集可直接用于训练面向教育辅导、智能编程助手与逻辑问答系统的通用大语言模型。例如,基于SFT格式的数据可以增强ChatGPT或GLM系列模型在数学竞赛题解答、算法题代码生成能力;DPO格式的偏好对则用于对齐模型输出与人类期望,提升AI助手的实用性与信任度。此外,结合CPT格式数据,企业可用其进行领域自适应预训练,开发能处理复杂数学证明、自动代码审查与任务规划的专业化AI系统,从而大幅降低人工标注成本并提升模型可靠性。
数据集最近研究
最新研究方向
当前,大规模语言模型(LLM)的训练数据质量与合成数据方法成为前沿焦点。glm5.2-synthetic-mega数据集由GLM 5.2模型在H20集群上生成,并采用确定性验证机制,涵盖数学(sympy重推导)、代码(沙盒执行与属性测试)及推理(穷举确认唯一解)三大领域,共129个生成单元、516条记录。其核心亮点在于100%答案独立验证与MinHash去重,验证通过率仅约32%,凸显了严苛的数据质量筛选流程。该数据集支持CPT、SFT、指令与DPO四种格式,为模型在数学推理、代码生成与链式思维等前沿任务上的持续预训练、监督微调及偏好对齐提供了高可靠性基准。这一范式不仅推动了合成数据从“大量生成”向“精确验证”的转变,也为提升LLM在复杂推理场景中的鲁棒性与可解释性奠定了数据基石,与当前AI领域对可验证、可追溯训练数据的迫切需求相呼应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务