遇见数据集

UltraData-RL-2609

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

UltraData-RL-2609 是一个用于强化学习(RL)的大规模数据集,属于 UltraData 平台的 L0-L4 分级数据管理框架中的 L3 级精炼数据。该数据集专为 MiniCPM5-2B 模型的后训练阶段设计,与 UltraData-SFT-2605 相辅相成,专注于可验证奖励任务。数据集包含超过 85,000 个训练样本,覆盖数学推理、科学/知识推理、长上下文理解以及代码生成四个领域。具体分布为:数学(32,412 个样本,占 37.7%)、代码(23,665 个样本,占 27.5%)、长上下文(18,046 个样本,占 21.0%)、知识(11,872 个样本,占 13.8%)。每个样本均以 JSONL 格式存储,包含五个字段:uuid(全局唯一 ID)、query(完整问题描述)、ground_truth(参考答案或可验证目标)、source(来源标识)、domain(领域标签)。对于代码任务,ground_truth 是一个包含输入输出数组的对象,用于通过执行测试用例进行验证。数据集构建遵循六阶段流水线,确保结果可验证、奖励信号可靠、难度与 RL 训练匹配。数据来源包括多个公开数据集:数学来自 DAPO-Math-17k、DeepScaleR-Preview-Dataset、DeepMath-103K;知识来自 OpenScienceReasoning-2;长上下文来自 HotpotQA、Qasper、MuSiQue 及内部合成数据;代码来自 OpenCodeReasoning、OpenCodeReasoning-2、HardTests。该数据集适用于 RL/RLVR 后训练,特别用于数学推理、科学推理、长上下文多跳问答和带测试用例的程序合成等任务。用户可通过 Hugging Face Datasets 库加载不同配置(Math、Knowledge、Long-Context、Code)进行训练。注意:代码任务需要用户自行提供沙箱执行环境;难度过滤和在线采样权重未存储在字段中;去污染覆盖了构建时的已知评估集。

UltraData-RL-2609 is a large-scale dataset for reinforcement learning (RL), belonging to the L3 refined data level within the UltraData platforms L0-L4 hierarchical data management framework. It is specifically designed for the post-training phase of the MiniCPM5-2B model, complementing UltraData-SFT-2605, and focuses on verifiable reward tasks. The dataset contains over 85,000 training samples covering four domains: mathematical reasoning, scientific/knowledge reasoning, long-context understanding, and code generation. The distribution is: Math (32,412 samples, 37.7%), Code (23,665 samples, 27.5%), Long-Context (18,046 samples, 21.0%), and Knowledge (11,872 samples, 13.8%). Each sample is stored in JSONL format with five fields: uuid (globally unique ID), query (complete question description), ground_truth (reference answer or verifiable target), source (source identifier), and domain (domain label). For code tasks, ground_truth is an object containing input-output arrays for verification via test case execution. The dataset construction follows a six-stage pipeline to ensure verifiable results, reliable reward signals, and difficulty matching RL training. Data sources include multiple public datasets: Math from DAPO-Math-17k, DeepScaleR-Preview-Dataset, DeepMath-103K; Knowledge from OpenScienceReasoning-2; Long-Context from HotpotQA, Qasper, MuSiQue, and internal synthetic data; Code from OpenCodeReasoning, OpenCodeReasoning-2, HardTests. This dataset is suitable for RL/RLVR post-training, particularly for tasks such as mathematical reasoning, scientific reasoning, long-context multi-hop QA, and program synthesis with test cases. Users can load different configurations (Math, Knowledge, Long-Context, Code) via the Hugging Face Datasets library. Note: Code tasks require users to provide their own sandbox execution environment; difficulty filtering and online sampling weights are not stored in the fields; deduplication covers known evaluation sets at the time of construction.

提供机构:
OpenBMB
创建时间:
2026-08-31
原始信息汇总

UltraData-RL-2609 数据集详情

基本信息

  • 发布机构:OpenBMB (MiniCPM Team)
  • 许可证:Apache 2.0
  • 语言:英语、中文
  • 样本规模:85,995 条训练样本 (10K < n < 100K)
  • 任务类型:文本生成、问答
  • 发布用途:用于 MiniCPM5-2B 后训练的强化学习(RL)阶段,采用**可验证奖励(verifiable-reward)**机制

数据集构成

数据集包含四个方向的子配置:

方向 样本数 占比 任务描述 结果验证方式
Math 32,412 37.7% 数学推理问题 ground_truth 答案匹配
Code 23,665 27.5% 自然语言描述的程序合成 运行测试用例执行验证
Long-Context 18,046 21.0% 长文档多跳问答 ground_truth 匹配,上下文可支撑答案
Knowledge 11,872 13.8% 短答案科学/知识推理 ground_truth 答案匹配

数据格式

每条 JSONL 记录包含五个字段:

  • uuid: 全局唯一样本 ID(域名前缀 + 索引)
  • query: 任务描述;长上下文任务中完整上下文与问题均包含在此字段
  • ground_truth: 参考答案;对 Code 任务为测试用例对象(含 inputsoutputs 数组)
  • source: 数据来源标识 UltraData-RL-2609
  • domain: MathKnowledgeLong_ContextCode 之一

数据构建流程

六个阶段的流水线(所有域通用):

  1. 数据采集与整合:数学领域联合了 DAPO、DeepScaler、DeepMath 等公开数据集;科学知识领域来自 OpenScienceReasoning-2;长上下文数据含 HotpotQA、Qasper、MuSiQue 扩展及合成数据;代码领域以 OpenCodeReasoning 系列和 HardTests 为主。
  2. 任务标准化与重写:统一任务格式、答案字段与元数据,便于训练和验证器使用。
  3. 可验证性过滤:仅保留具备唯一自动可验证答案的条目,代码任务需在沙箱中执行。
  4. 奖励可靠性检查:LLM 法官审查问答一致性,数学/知识推理由多个模型独立求解并达成共识;代码测试用例交叉验证。
  5. 难度校准:在 RL 初始模型基础上估算通过率,移除已掌握条目(通过率=1),保留可学习条目;保留通过率=0但标签确认有效的难样本,配合在线动态采样调度。
  6. 格式化与质量审查:导出统一 JSONL,检查字段完整性、去重、排除公共评估基准重叠项。

数据特点

  • 完整领域覆盖:数学推理、科学知识推理、长上下文理解与代码生成形成互补的 RL 信号。
  • 可验证结果:每个领域均具有明确的参考目标与判定方式;多选、判断、证明、多部分及图像依赖题已在构建阶段移除。
  • 可靠奖励信号:参考答案与执行结果均通过一致性检查,无法确认标签的数据被剔除而非猜测。
  • 匹配 RL 训练的难度:难度过滤仅调整难度与采样权重,绝不改变参考标签。

使用方式

python from datasets import load_dataset

ds = load_dataset("openbmb/UltraData-RL-2609", "Math", split="train") ds = load_dataset("openbmb/UltraData-RL-2609", "Knowledge", split="train") ds = load_dataset("openbmb/UltraData-RL-2609", "Long-Context", split="train") ds = load_dataset("openbmb/UltraData-RL-2609", "Code", split="train")

可用配置:MathKnowledgeLong-ContextCode

预期应用场景

  • MiniCPM 风格端侧模型的 RL / RLVR 后训练,配合验证奖励使用。
  • 各领域独立使用:数学推理(Math)、科学/知识推理(Knowledge)、长上下文多跳问答(Long-Context)、可执行测试的程序合成(Code)。
  • 混合比例研究,如与 UltraData-SFT-2605 进行比较分析。

注意事项与局限

  • Code 域需自建验证器:数据集只含测试用例而非沙箱环境,用户需自行运行候选程序以计算奖励;需将 inputs[i] 作为标准输入并去除末尾空白后与 outputs[i] 比较。
  • 静态标签:构建时的难度过滤与在线采样权重未作为字段存储,仅保留筛选后的条目。
  • 去污范围:筛选涵盖构建时已知的评估集,引入新基准前需重新检查。

上游数据来源

各领域均基于公开数据集构建并扩展:

  • Math: DAPO-Math-17k、DeepScaleR-Preview-Dataset、DeepMath-103K(三者的并集)
  • Knowledge: OpenScienceReasoning-2(改写为短答案形式)
  • Long-Context: HotpotQA、Qasper、MuSiQue(扩展为更长上下文)+ 内部合成数据
  • Code: OpenCodeReasoning、OpenCodeReasoning-2、HardTests(配合综合测试用例)

性能参考

在 JustRL II 实验设置下,使用该数据集训练后 AIME 2025 在约 300 步 RL 内从 61 提升至 81;最终 MiniCPM5-2B 检查点在 AIME 2025 上达到 86

引用信息

如需引用,请使用 BibTeX: bibtex @misc{ultradata_rl_2609, title = {UltraData-RL-2609}, author = {MiniCPM Team}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/openbmb/UltraData-RL-2609}} }

搜集汇总
数据集介绍
UltraData-RL-2609 数据集图片
构建方式
UltraData-RL-2609作为UltraData框架L0-L4分级管理体系中的L3精炼数据,专为MiniCPM5-2B后训练中的强化学习阶段而设计。其构建遵循六阶段流水线,涵盖数学、知识(STEM)、长上下文及代码四大领域。各领域分别整合公开数据源如DAPO、DeepScaleR、OpenScienceReasoning-2、HotpotQA及OpenCodeReasoning等,经任务标准化与改写后,实施可验证性过滤,仅保留具备唯一可自动检查答案或可执行测试用例的样本。随后通过LLM裁判与多模型共识机制确保奖励信号的可靠性,再依据初始化模型的通过率进行难度校准,剔除已掌握样本并保留可学习及困难但有效样本,最终统一格式并完成质量审查与去污。
使用方法
数据集支持按需加载不同配置,通过HuggingFace datasets库即可轻松获取,例如load_dataset("openbmb/UltraData-RL-2609", "Math", split="train")。每条样本包含uuid、query、ground_truth、source及domain字段,其中ground_truth为参考答案或代码测试用例对象。该数据集适用于MiniCPM风格端侧模型的强化学习及可验证奖励后训练,可单独使用各领域切片,亦可探索多领域混合策略。代码任务需自备沙箱执行测试用例以计算奖励。研究者可复现JustRL II的128K推理扩展实验,或作为RL数据与SFT数据配比研究的基准资源。
背景与挑战
背景概述
在大型语言模型的后训练阶段,强化学习(RL)已成为提升推理与指令遵循能力的关键范式,尤其依赖于可验证奖励(verifiable-reward)任务来提供稳定、可追踪的训练信号。UltraData-RL-2609由OpenBMB的MiniCPM团队于2026年9月7日发布,作为UltraData平台L0-L4分层数据管理框架中的L3精炼数据,专为MiniCPM5-2B的RL后训练而构建,并支撑JustRL II实验实现从61到86的AIME 2025显著提升。该数据集整合DAPO、DeepScaleR、DeepMath等公开数学数据,以及知识、长上下文和代码数据源,构建了超过85,000个具有可验证结果的样本,为小型设备端模型的高效RL训练提供了坚实的数据基础。其影响力体现在推动了MiniCPM5系列在编码、数学、长文推理等领域达到2B级开源SOTA,并为低成本强化学习研究提供了标准化的数据资源。
当前挑战
该数据集面对的挑战包括两层面:领域层面聚焦于构建可靠RL训练数据,需解决可验证奖励信号稀缺与任务难度校准的难题,数学、代码等学科要求唯一可判答案,而长程问答须保证上下文支撑,多类任务难以统一验证范式。构建阶段则面临多源数据的规范化重写、验证一致性检验及剥离污染样本等高复杂度工作,如因答案无法自动校验或标签多模型不一致导致的剔除,以及必须过滤易得分项并保留挑战性但有标签的样本,同时代码测试集需经受沙箱执行与跨验证,所有步骤须在不过度改动原始标签的前提下完成。这强调了设计一个兼具严格验证与自适应难度分配的数据流水线,以期在不失数据可用性和领域覆盖的前提下,彻底确保后训练信号的可信性和有效性。
常用场景
经典使用场景
UltraData-RL-2609作为面向可验证奖励的强化学习语料,其设计初衷在于支撑大语言模型的后训练阶段,尤其聚焦于数学推理、科学知识问答、长上下文理解及代码生成四大核心认知维度。该数据集以JSONL格式封装逾八万五千条训练样本,每条样本均含有明确的参考答案或可执行测试用例,从而为策略模型提供稳定且可追溯的优化信号。在经典使用中,研究者将其作为RLVR(带可验证奖励的强化学习)训练的基准数据源,通过领域划分接口灵活加载特定子集,以实现针对性的能力提升。特别地,该数据集被原生用于MiniCPM5-2B的后训练流程,展现了从基础模型到领域专家模型的精调路径,成为连接预训练与下游任务部署的关键桥梁。
解决学术问题
UltraData-RL-2609解决了强化学习在语言模型应用中长期面临的奖励稀疏与信号不可靠问题,其核心贡献在于构建了奖励可验证、信号可信赖、难度校准的三位一体数据体系。通过严格的过滤流程,剔除了模糊、多解或无法自动判定的样本,确保了每个任务的可验证性,从而为策略梯度方法提供了明确的优化方向。该数据集还针对困难度进行了精细调控,移除已掌握样本,保留学习潜力区域,并利用在线动态采样对高难度样本进行调度,有效规避了奖励 hacking 与梯度消失等训练困境。其意义在于为可扩展的强化学习提供了高质量的监督信号源,推动了小规模语言模型在复杂推理任务上的性能跃升,并为数据驱动的对齐研究奠定了方法论基础。
实际应用
在实际应用层面,UltraData-RL-2609主要服务于端侧及资源受限环境下的语言模型后训练,尤其适用于MiniCPM系列等轻量级架构。该数据集的多领域覆盖使其能够被灵活应用于数学解题助手、科学知识问答系统、长文档理解工具及代码生成平台等产品的强化学习优化环节。通过可验证奖励机制,开发者能够迭代提升模型在特定任务上的准确率与鲁棒性,例如在AIME 2025基准上将成绩从61分提升至86分,展现出显著的实用价值。此外,该数据集还支持数据混合比例研究,助力调优SFT与RL阶段的数据配比,从而在有限计算资源下实现模型性能的高效增长,为商业化部署中的模型精调提供了现成的高质量资源。
数据集最近研究
最新研究方向
UltraData-RL-2609作为面向可验证奖励的强化学习后训练语料,其最新研究方向聚焦于利用该数据集驱动小规模语言模型在数学推理、科学知识问答、长上下文多跳理解及代码生成等领域的强化学习能力跃升。该数据集通过严苛的可验证结果、可信奖励与校准难度三重机制,保障了训练信号的高质量与稳定性,并与MiniCPM5-2B及JustRL II框架协同,探索了将小型模型扩展至128K超长推理任务的路径。其发布标志着RLVR(基于可验证奖励的强化学习)数据工程在层级化管理与多维覆盖上的前沿进展,为资源受限场景下的高效模型后训练提供了关键数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务