遇见数据集

tulu3-sft-personas-math-sandboxes-verified-v2

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

Tulu-3 SFT Personas Math — Verifier-Fixed (v2) 是一个专注于数学推理的文本生成数据集,属于 Tulu-3 系列,并经过验证。该数据集是原始 `laion/tulu3-sft-personas-math-sandboxes-verified` 数据集的修复版本,主要修复涉及任务验证器,使其能输出可解析的、带有梯度信号的测试结果,并修复了一个导致部分任务无法通过的潜在错误,确保所有任务均可求解。数据集包含 9,998 个样本,每个样本对应一个任务,数据结构包含两列:`path`(字符串)和 `task_binary`(gzip 压缩的 tar 字节流)。每个任务包内包含定义任务所需的多个文件,如 `task.toml`、`instruction.md`、`metadata.json`、测试文件、解决方案以及环境定义。该数据集适用于涉及代码执行、测试验证的强化学习(特别是 RLOO 训练)或监督微调场景下的数学问题求解任务。

Tulu-3 SFT Personas Math — Verifier-Fixed (v2) is a text generation dataset focused on mathematical reasoning, part of the Tulu-3 series and verified. It is a fixed version of the original `laion/tulu3-sft-personas-math-sandboxes-verified` dataset. The main fixes involve the task verifier: the original verifiers output format could not be correctly parsed by the `pass_ratio` reward shaper, causing the reward signal to degrade to binary values during training. This version rewrites the verifier based on the pytest framework, enabling it to output parsable test results with gradient signals (e.g., scoring 1.0 for passing all 2 tests, 0.5 for passing one, and 0.0 for failing all). Additionally, a potential bug that caused approximately 9.6% of tasks (due to expected answers containing internal spaces) to fail has been fixed, ensuring all tasks are solvable. The dataset contains 9,998 samples, each corresponding to a task. The data structure includes two columns: `path` (string) and `task_binary` (gzip-compressed tar byte stream). Each task package contains multiple files required to define the task: `task.toml`, `instruction.md`, `metadata.json`, test files (`tests/test.sh` and `tests/test_state.py`), a solution (`solution/solve.sh`), and an environment definition (`environment/Dockerfile`). This dataset is suitable for mathematical problem-solving tasks in reinforcement learning (especially RLOO training) or supervised fine-tuning scenarios involving code execution and test verification.

提供机构:
LAION eV
创建时间:
2026-07-28
原始信息汇总

数据集概述

  • 数据集名称:Tulu-3 SFT Personas Math — Verifier-Fixed (v2)
  • 来源:基于 laion/tulu3-sft-personas-math-sandboxes-verified 的修复版本
  • 语言:英语
  • 任务类别:文本生成
  • 标签:数学、推理、强化学习、已验证、Tulu3
  • 规模:约 1,000 至 10,000 行(实际 9,998 行)

主要修复内容

  1. 验证器输出格式修复

    • 原数据集的 tests/test.sh 输出格式为 Correct answer: NIncorrect answer: expected N, got M,无法被 pass_ratio 奖励塑造器解析,导致奖励回退为二进制值(0.0 或 1.0),缺乏梯度信号。
    • 修复后,tests/test.sh 调用 python3 -m pytest /tests/test_state.py,输出可解析的 pytest 结果,提供分级信号:
      • 正确答案:2 passedpass_ratio = 1.0
      • 错误答案(文件存在):1 failed, 1 passedpass_ratio = 0.5
      • 无答案文件:2 failedpass_ratio = 0.0
  2. 隐含错误修复

    • test.sh 对智能体答案使用 tr -d 去除空格,但未对预期值做同样处理,导致 961/9998 个任务(9.6%) 因预期答案包含内部空格而无法通过。
    • 修复后,基于 pytest 的验证器仅使用 .strip() 去除首尾空格,使得所有 9,998 个任务均可解答。

验证结果

  • 黄金/预期一致性:9,998 个任务全部匹配
  • Docker 冒烟测试:正确→2 passed,错误→1 passed 1 failed,无文件→2 failed
  • 共享快照:ubuntu:24.04 + python3 + pytest

数据结构

  • 行数:9,998
    • path(字符串类型)
    • task_binary(gzip-tar 字节类型)
  • 每个任务包含的文件
    • task.toml
    • instruction.md
    • metadata.json
    • tests/test.sh
    • tests/test_state.py
    • solution/solve.sh
    • environment/Dockerfile
搜集汇总
数据集介绍
tulu3-sft-personas-math-sandboxes-verified-v2 数据集图片
构建方式
面向数学推理与强化学习场景,该数据集在原始版本基础上进行了系统性修正与重构。核心改进在于重写验证脚本,以`pytest`框架替代原`test.sh`中不可解析的输出格式,确保`pass_ratio`奖励塑造器能够正确解析测试结果并产生梯度信号。每个任务实例封装为gzip-tar格式的二进制包,包含任务配置、指令描述、元数据、双重测试脚本(文件存在性检测与内容匹配)、参考解法和环境配置,共计9,998条样本。
特点
数据集具备显式的渐进式奖励信号特征:通过pytest输出中通过与失败的用例数实现{0.0, 0.5, 1.0}三级奖励粒度,解决了原版本奖励塌缩为二元值的问题。同时修复了因`tr -d ' '`导致期望答案含空格时任务不可解的潜伏错误,所有任务均经一致性验证可解。采用统一镜像环境确保测试可复现。
使用方法
适用于基于强化学习(如RLOO)的数学推理模型微调与验证。使用时需解包`task_binary`字段获取完整任务目录,通过Docker运行`tests/test.sh`执行环境内验证。`path`字段标识任务路径,可直接配合Tulu-3系列训练框架调用,奖励信号可直接用于策略梯度更新。
背景与挑战
背景概述
Tulu3-SFT-Personas-Math-Sandboxes-Verified-V2数据集由LAION研究机构于近期创建,专注于数学推理与强化学习领域。该数据集包含近10,000条任务样本,每个任务均配备完整的沙箱环境(包括指令、测试脚本、解决方案及Docker配置),旨在通过验证器提供细粒度的奖励信号,以支持策略优化训练。其核心研究问题在于如何利用自动验证器生成可解析的梯度信号,从而提升模型在数学推理任务上的性能。该数据集直接继承了Tulu3系列的开放科学研究范式,为强化学习中的奖励塑造与任务可解性验证提供了标准化基准,对推动具备验证能力的数学推理模型发展具有重要意义。
当前挑战
该数据集首先直面了数学推理领域中的奖励信号稀疏性问题:原始验证器输出格式无法被奖励塑形器解析,导致所有奖励退化为二元值,丧失梯度信息。其次,构建过程中发现了隐藏的评估偏差——原始测试脚本对代理答案与期望值采用不一致的预处理逻辑,致使9.6%的任务因空格处理差异而无法通过,严重污染训练信号。此外,需确保所有任务在一致的环境镜像中可复现执行,并设计与标准奖励塑形器兼容的pytest输出格式,这些工程挑战共同构成了数据集构建的核心难点。
常用场景
经典使用场景
该数据集专为数学推理与强化学习(RL)场景中的文本生成任务而设计,经典用法是作为奖励信号优化训练的测试基准。每个数据样本封装了完整的任务环境,包括指令文档、元数据、测试脚本及验证代码,研究者可借此评估语言模型在数学问题上的作答正确性。通过解析pytest输出中的通过比例(pass_ratio),数据集能够提供细粒度、连续化的梯度信号,替代传统的二元奖励机制,从而更有效地驱动如RLOO等强化学习算法的模型收敛。这种设计尤其适合需要精确数学推理与代码执行验证的端到端训练流程。
实际应用
在实际应用中,Tulu-3 SFT Personas Math数据集主要用于训练和评估需要执行数学推理的智能体系统。开发者可基于封装的任务环境,在沙盒容器中自动运行模型生成的代码或数学推导,并利用pytest验证结果的正误。该流程可无缝集成到在线强化学习管线中,用于构建能够自主解决数学问题的对话助手、教育辅导机器人或自动化解题工具。由于提供了标准化Docker环境与细粒度奖励信号,该数据集也适用于工业级大规模模型微调与部署前的准确性校验,显著降低数学任务中模型生成幻觉的风险。
衍生相关工作
该数据集衍生了多个重要的相关工作,最直接的是推动了对强化学习中奖励塑形机制的改进研究。基于其细粒度pass_ratio信号,研究者进一步探索了多级奖励分配策略在数学推理任务中的效果,衍生出如自适应奖励缩放、动态阈值调整等方法。同时,数据集的错误修复过程本身也催生了关于测试脚本鲁棒性与数据质量审计的学术讨论,后续工作将数据处理中的隐性缺陷检测作为标准评估环节。此外,该数据集的沙盒化任务结构被借鉴用于构建更复杂的多步推理环境,如结合代码执行与符号数学的混合验证框架,成为数学人工智能训练基础设施中的重要组件。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务