遇见数据集

tulu3-sft-personas-math-sandboxes-verified

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集名为laion/tulu3-sft-personas-math-sandboxes-verified,是一个用于文本生成任务的数学应用题数据集,特别适用于智能体(agent)、Harbor平台、强化学习和数学相关的研究。数据集包含9,998个任务,每个任务由两列数据构成:path(字符串类型)和task_binary(gzip压缩的tar包格式),遵循标准的Harbor/TaskTrove任务模式。数据来源于Tulu-3 SFT personas-math,是DCAgent/tulu3-sft-personas-math-sandboxes的镜像,内容保持不变。每个任务都配备了原始的确定性验证器(tests/test.sh),用于评估智能体生成的答案:智能体将最终答案写入/app/answer.txt,验证器通过精确字符串匹配(去除空格)将其与每个任务的标准答案进行比较,结果映射为奖励1(正确)或0(错误)。该验证过程完全基于确定性规则,无需LLM评判,因此不产生API成本。所有任务在共享的python/ubuntu环境中运行。

The dataset named laion/tulu3-sft-personas-math-sandboxes-verified is a mathematical word problem dataset for text generation tasks, particularly suitable for agent, Harbor platform, reinforcement learning, and mathematics-related research. It contains 9,998 tasks, each consisting of two columns: path (string type) and task_binary (gzip-compressed tar package format), following the standard Harbor/TaskTrove task pattern. The data is sourced from Tulu-3 SFT personas-math and is a mirror of DCAgent/tulu3-sft-personas-math-sandboxes, with content remaining unchanged. Each task is equipped with an original deterministic verifier (tests/test.sh) to evaluate answers generated by agents: the agent writes the final answer to /app/answer.txt, and the verifier compares it with the standard answer for each task via exact string matching (with spaces removed), mapping the result to a reward of 1 (correct) or 0 (incorrect). This verification process is entirely rule-based, requiring no LLM judgment and thus incurring no API costs. All tasks run in a shared python/ubuntu environment.

提供机构:
LAION eV
创建时间:
2026-07-20
原始信息汇总

数据集概述

数据集名称laion/tulu3-sft-personas-math-sandboxes-verified

许可证:Apache-2.0

任务类别:文本生成

标签:agent, harbor, reinforcement-learning, math

数据集规模:9,998 个任务

数据格式:包含两列——path(字符串)和 task_binary(gzip tar 格式),遵循规范的 Harbor / TaskTrove 任务模式。

数据来源:源自 Tulu-3 SFT personas-math 的数学应用题任务。此数据集是 DCAgent/tulu3-sft-personas-math-sandboxes 的镜像副本,内容未作修改。

评估机制:每个任务附带原始的确定性验证器tests/test.sh)。智能体需将最终答案写入 /app/answer.txt,验证器通过精确字符串匹配(去除空白字符)与任务的黄金答案进行比较,输出奖励值为 1(正确)或 0(错误)。该过程不涉及大语言模型评判,完全确定,无需 API 成本。

运行环境:共享的 python/ubuntu 环境。

搜集汇总
数据集介绍
tulu3-sft-personas-math-sandboxes-verified 数据集图片
构建方式
该数据集基于Tulu-3 SFT Personas-Math子集构建,源数据源自DC Agent发布的原始版本,现由Laion镜像托管且内容保持原样。数据集中包含了9,998条数学文字题任务,每条任务遵循Harbor与TaskTrove的标准任务模式,采用路径字符串与任务二进制文件的二元结构存储,确保了结构化表示与高效处理的统一性。
使用方法
使用时,数据集需通过Harbor框架加载任务二进制文件,并利用共享的Python与Ubuntu环境运行。智能体需在每项任务中基于数学推理生成最终答案,写入固定路径;随后由预置的测试脚本自动执行奖励判定,为强化学习或Agent训练提供可靠的即时信号反馈,无需额外的人工标注或模型评估调用。
背景与挑战
背景概述
该数据集名为tulu3-sft-personas-math-sandboxes-verified,由LAION机构于近期创建,是Harbor项目的一部分,源自Tulu-3 SFT personas-math数据集。核心研究问题聚焦于通过确定性验证器评估数学词问题的智能体求解能力,旨在推动强化学习与数学推理领域的交叉进展。该数据集包含近万个任务,每个任务均附带原始确定性验证脚本,确保评估的客观性与可复现性,对智能体数学推理基准的构建具有重要影响力。
当前挑战
该数据集面对的核心挑战在于数学词问题求解的准确性与泛化性,传统语言模型评估依赖LLM裁判,成本高且主观性强,而该数据集通过确定性验证器实现了零成本的客观评判。构建过程中,需确保每个任务拥有独立的验证脚本,并处理答案格式的精确匹配问题,同时维持环境一致性(如共享python/ubuntu环境),以消除变量干扰,保障实验结果的可信度与可比较性。
常用场景
经典使用场景
该数据集在数学推理与智能体行为研究领域占据着独特的地位。它由近万道数学应用题构成,每道题目均配备了确定性的脚本验证器,通过精确字符串匹配机制来评判智能体输出答案的正确性。研究者和开发者可借助该数据集,系统性地训练和评估大语言模型在数学问题求解过程中的推理能力、工具调用能力以及任务完成策略,尤其适合构建需要与环境进行多轮交互的智能体系统。
解决学术问题
该数据集精准解决了数学推理研究中普遍存在的验证成本高与评判标准模糊两大顽疾。传统依赖大语言模型作为评判者的方法不仅耗费高昂的API费用,而且容易引入评估偏差。该数据集通过确定性验证器实现了零成本、无歧义的正误判定,使得回报信号绝对可靠。这为强化学习算法在数学任务上的应用提供了坚实的基准,极大推动了从过程奖励建模到结果导向优化等学术课题的严谨探索。
实际应用
在实际应用中,该数据集为自动化数学辅导、编程竞赛辅助系统及智能教育机器人等场景提供了关键的训练与测试资源。基于该数据集训练的模型能够精确解析数学文本,生成正确的解题步骤,并使得最终答案以标准化格式呈现。其确定性的验证机制确保了部署后的系统在无人工干预的情况下依然能够保持评估的一致性与公正性,显著提升了智能辅导工具在真实世界中的实用性与可信度。
数据集最近研究
最新研究方向
该数据集聚焦于数学推理与强化学习交叉领域的前沿探索,通过提供包含确定性验证器的文本生成任务,为智能体在数学应用题场景中的可靠学习与评估奠定基础。在当前大语言模型代理(Agent)研究热潮中,该数据集摒弃了依赖大模型评判的范式,转而采用精确字符串匹配的零成本验证机制,显著提升了奖励信号的客观性与可复现性。其与Harbor任务架构的融合,进一步推动了开放式数学推理环境下的标准化评测,为未来智能体在真实世界数学问题求解中的泛化能力突破提供了关键数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务