tts-datagen
收藏资源简介:
GPT-OSS 120B Native Reasoning Traces for TTS Datagen 是一个用于文本生成任务的英语数据集。该数据集包含由 GPT-OSS 120B 模型生成的合成竞争性编程问题及对应的原生推理轨迹和验证测试用例。初始版本包含 2,865 个问题,每个问题有 16 个独立的 GPT-OSS 解决方案(共 45,840 条轨迹),以及每个问题 50 个经过验证的测试用例(共 143,250 个)。通过增量扩展,当前累计包含 5,365 个问题、85,840 条轨迹、268,250 个测试用例和 5,365 个硬度评分。数据集分为四个配置:questions(问题提示和生成配置)、traces(每个 roll-out 的推理和答案)、test_cases(输入输出对)、grades(硬度评分)。每个轨迹通过 MetaGen 原生对话完成接口生成,保留了独立的推理过程(reasoning)和最终答案(answer),而非后处理提取。生成配置固定:模型为 openai_gpt-oss-120b-tba_grader,推理努力设置为 medium,温度 1.0,基础采样种子 1234。所有轨迹均包含非空推理且提供商报告的推理 token 数为正。测试用例分为 30 个小规模(种子 0-29)和 20 个大规模(种子 100000-100019),每个输入输出对通过 SHA-256 哈希链接到验证装置。数据集包含完整性清单(manifest.json)和验证脚本以确保可重现。该数据集主要用于推理、代码生成、验证和评估等研究场景,但需注意所有问题、解决方案和推理轨迹均为模型生成,可能包含错误;通过 50 个发布测试用例不代表完全正确;用户在训练或分发前应自行进行来源、许可、安全、污染和质量审查。
GPT-OSS 120B Native Reasoning Traces for TTS Datagen is an English dataset for text generation tasks. It contains synthetic competitive programming problems generated by the GPT-OSS 120B model, along with corresponding native reasoning traces and validated test cases. The initial version includes 2,865 problems, each with 16 independent GPT-OSS solutions (45,840 traces total), and 50 validated test cases per problem (143,250 in total). Through incremental expansion, the current cumulative version has 5,365 problems, 85,840 traces, 268,250 test cases, and 5,365 hardness scores. The dataset is divided into four configurations: questions (problem prompts and generation configuration), traces (reasoning and answers for each roll-out), test_cases (input-output pairs), and grades (hardness scores). Each trace is generated via the MetaGen native conversation completion interface, preserving separate reasoning processes and final answers rather than post-processing extraction. The generation configuration is fixed: model = openai_gpt-oss-120b-tba_grader, reasoning_effort = medium, temperature = 1.0, base sampling seed = 1234. All traces have non-empty reasoning and positive reasoning token counts as reported by the provider. Test cases are divided into 30 small-scale (seeds 0-29) and 20 large-scale (seeds 100000-100019), each input-output pair linked to a verification harness via SHA-256 hash. The dataset includes a completeness manifest (manifest.json) and verification scripts to ensure reproducibility. It is mainly used for research scenarios such as reasoning, code generation, verification, and evaluation. However, note that all problems, solutions, and reasoning traces are model-generated and may contain errors; passing 50 released test cases does not guarantee full correctness; users should conduct their own source, license, safety, contamination, and quality reviews before training or distribution.
TTS-Datagen 数据集详情
数据集概述
该数据集包含 2,865 道 合成的竞争性编程问题、45,840 个独立采样的 GPT-OSS 120B 解决方案(每道题 16 个),以及每道题 50 个经验证的测试用例(共 143,250 个)。每个解决方案均将模型的原生推理过程与最终答案分开保存。推理过程通过 MetaGen 的原生 Dialog Completion 接口返回,并非从答案重构、由其他模型生成或复制自评分日志。
此外,数据集还包括一个增量扩展部分(Reasoning-v3 extension),扩展后累积人口为 5,730 道题、91,680 条 GPT-OSS 轨迹、286,500 个导出测试和 5,730 个当前难度评分。
数据配置
| 配置名 | 文件 | 行数 | 含义 |
|---|---|---|---|
questions |
questions.jsonl.gz |
2,865 | 每道题的提示词和生成配置 |
traces |
traces-*.jsonl.gz |
45,840 | 每次 roll-out 的一条 GPT-OSS 推理/答案样本 |
test_cases |
test-cases-*.jsonl.gz |
143,250 | 每道题 50 个经过验证的输入/输出对 |
所有配置可通过 generation_id 进行连接。在题目内部,轨迹以 rollout_index(0–15)为键,测试以 test_index(0–49)为键。
源题目分布
| 来源模型标签 | 题目数量 |
|---|---|
claude5opusvertex |
1,293(扩展后累计含 1,952) |
gemini |
110 |
gpt55 |
780(扩展后累计含 424) |
gpt56sol |
682(扩展后累计含 489) |
扩展部分已全局去重,目前新增 2,865 道题,与基线合计 5,730 道题。
生成配置
- 请求与返回模型:
openai_gpt-oss-120b-tba_grader - API 接口:MetaGen 原生 Dialog Completion
- 每道题采样数:16
- 推理努力程度:
medium - Temperature:
1.0 - Top-p:有意省略
- 基本采样种子:
1234 - 含非空推理的成功轨迹:45,840 / 45,840
- 提供商报告的正推理 token 计数轨迹:45,840 / 45,840
提供商汇总用量
| 指标 | 总计 |
|---|---|
| Prompt tokens | 30,190,736 |
| Completion tokens | 577,326,234 |
| 总 tokens | 607,516,970 |
| 推理 tokens | 390,199,146 |
| 缓存 prompt tokens | 4,040,432 |
| 推理字符数 | 1,545,599,295 |
| 最终答案字符数 | 675,335,226 |
Token 记账说明:total_tokens = prompt_tokens + completion_tokens;completion_tokens 包含推理 tokens 和可见答案 tokens。提供商报告的 num_non_reasoning_tokens 在此 API 路径上不可靠(报告为零),不得用于推断答案长度。num_reasoning_tokens: null 表示“未报告”,而非零;本次导出中每条轨迹均为正数。
扩展部分新增推理 tokens 为 437,254,076,累积提供商报告的推理 tokens 总计 827,453,222(含基线 390,199,146)。
Question Schema
每行包含:generation_id(稳定连接键)、source_model_tag、prompt(精确的解题提示词,包含题目陈述)、prompt_sha256、rollouts_required(始终为 16)、requested_model、reasoning_effort、temperature、top_p、sampling_seed 以及 transport(原生推理能力 API 描述)。
Trace Schema
每行包含:generation_id、rollout_index、reasoning(逐字原生推理内容)、answer(逐字最终助手答案)、prompt_sha256、requested_model、returned_model、reasoning_effort、temperature、top_p、sampling_seed、started_at、completed_at、latency_seconds、finish_reason 以及 usage(完整净化的提供商用量对象,包括 prompt、completion、total、cached-prompt 和 reasoning-token 计数)。
五十道测试协议与 Schema
每道题恰好有 50 个确定性生成、经验证器接受且具有可信预期输出的测试用例:
- 测试 0–29:
size="small",生成器种子 0–29。 - 测试 30–49:
size="large",生成器种子 100000–100019。 - 预期输出由该题的经验证参考解决方案产生。
- 每个输入和预期输出均通过 SHA-256 链接至其原始验证夹具。
- 夹具验证器版本:
2026-08-29.5。
每行包含:generation_id、source_model_tag、test_index、seed、size、input、expected_output、input_sha256、output_sha256、generator_sha256、validator_sha256 和 verifier_version。
发布的 50 个夹具是紧凑的可复现评估子集,与完整的难度评分工作负载不同。难度评分使用 3 个样本测试、1,000 个小生成测试和 100 个大生成测试,用于 16 个候选答案中的每一个,因此每道题最多执行 1,103 × 16 = 17,648 次程序-测试执行(而非 17,648 个不同的测试输入),且候选评估可在失败后提前停止。
完整性与可复现性
manifest.json记录题目和轨迹导出的计数、压缩大小和 SHA-256 哈希。test_cases_plan.json记录完整的确定性题目到分片计划及源夹具字节数。test_cases_manifest.json记录每个上传测试分片的最终压缩大小、SHA-256、题目范围和行数。tools/export_verified_tests.py是用于测试数据的精确有界导出器,在流式确定性 gzip 输出时验证每个夹具哈希。
扩展批次摘要
| 批次 | 题目数 | 轨迹数 | 测试数 | 推理 tokens | 源 manifest SHA-256 |
|---|---|---|---|---|---|
| 000 | 500 | 8,000 | 25,000 | 71,923,146 | 见文件 |
| 001 | 500 | 8,000 | 25,000 | 69,950,651 | 见文件 |
| 002 | 500 | 8,000 | 25,000 | 72,103,253 | 见文件 |
| 003 | 500 | 8,000 | 25,000 | 80,990,286 | 见文件 |
| 004 | 500 | 8,000 | 25,000 | 82,774,953 | 见文件 |
| 005 | 365 | 5,840 | 18,250 | 59,511,787 | 见文件 |
批次文件及其精确校验和位于 extension/batch_NNN/manifest.json 下。
数据处理与排除内容
公开导出有意省略原始提供商信封、凭据、凭据槽标识符、桥接启动器详细信息、本地路径、评分草稿目录和临时文件。数据集中或 Git 历史中不存储任何身份验证令牌。
局限性及预期用途
- 题目、解决方案和推理轨迹均为模型生成,尽管经过验证仍可能包含错误。
- 推理轨迹可能冗长、不一致或不适合作为事实性解释。
- 通过 50 个已发布用例并不确立完全正确性。
- 在训练或再分发前,用户应自行进行来源、许可、安全、污染和质量审查。
- 该数据集旨在用于推理、代码生成、验证和评估研究,而非权威事实来源。
引用说明
使用本数据集时,请引用 Hugging Face 仓库及所使用的确切提交修订版,以保持分片校验和与模式的可复现性。




