遇见数据集

tts-datagen

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

GPT-OSS 120B Native Reasoning Traces for TTS Datagen 是一个用于文本生成任务的英语数据集。该数据集包含由 GPT-OSS 120B 模型生成的合成竞争性编程问题及对应的原生推理轨迹和验证测试用例。初始版本包含 2,865 个问题,每个问题有 16 个独立的 GPT-OSS 解决方案(共 45,840 条轨迹),以及每个问题 50 个经过验证的测试用例(共 143,250 个)。通过增量扩展,当前累计包含 5,365 个问题、85,840 条轨迹、268,250 个测试用例和 5,365 个硬度评分。数据集分为四个配置:questions(问题提示和生成配置)、traces(每个 roll-out 的推理和答案)、test_cases(输入输出对)、grades(硬度评分)。每个轨迹通过 MetaGen 原生对话完成接口生成,保留了独立的推理过程(reasoning)和最终答案(answer),而非后处理提取。生成配置固定:模型为 openai_gpt-oss-120b-tba_grader,推理努力设置为 medium,温度 1.0,基础采样种子 1234。所有轨迹均包含非空推理且提供商报告的推理 token 数为正。测试用例分为 30 个小规模(种子 0-29)和 20 个大规模(种子 100000-100019),每个输入输出对通过 SHA-256 哈希链接到验证装置。数据集包含完整性清单(manifest.json)和验证脚本以确保可重现。该数据集主要用于推理、代码生成、验证和评估等研究场景,但需注意所有问题、解决方案和推理轨迹均为模型生成,可能包含错误;通过 50 个发布测试用例不代表完全正确;用户在训练或分发前应自行进行来源、许可、安全、污染和质量审查。

GPT-OSS 120B Native Reasoning Traces for TTS Datagen is an English dataset for text generation tasks. It contains synthetic competitive programming problems generated by the GPT-OSS 120B model, along with corresponding native reasoning traces and validated test cases. The initial version includes 2,865 problems, each with 16 independent GPT-OSS solutions (45,840 traces total), and 50 validated test cases per problem (143,250 in total). Through incremental expansion, the current cumulative version has 5,365 problems, 85,840 traces, 268,250 test cases, and 5,365 hardness scores. The dataset is divided into four configurations: questions (problem prompts and generation configuration), traces (reasoning and answers for each roll-out), test_cases (input-output pairs), and grades (hardness scores). Each trace is generated via the MetaGen native conversation completion interface, preserving separate reasoning processes and final answers rather than post-processing extraction. The generation configuration is fixed: model = openai_gpt-oss-120b-tba_grader, reasoning_effort = medium, temperature = 1.0, base sampling seed = 1234. All traces have non-empty reasoning and positive reasoning token counts as reported by the provider. Test cases are divided into 30 small-scale (seeds 0-29) and 20 large-scale (seeds 100000-100019), each input-output pair linked to a verification harness via SHA-256 hash. The dataset includes a completeness manifest (manifest.json) and verification scripts to ensure reproducibility. It is mainly used for research scenarios such as reasoning, code generation, verification, and evaluation. However, note that all problems, solutions, and reasoning traces are model-generated and may contain errors; passing 50 released test cases does not guarantee full correctness; users should conduct their own source, license, safety, contamination, and quality reviews before training or distribution.

创建时间:
2026-09-05
原始信息汇总

TTS-Datagen 数据集详情

数据集概述

该数据集包含 2,865 道 合成的竞争性编程问题、45,840 个独立采样的 GPT-OSS 120B 解决方案(每道题 16 个),以及每道题 50 个经验证的测试用例(共 143,250 个)。每个解决方案均将模型的原生推理过程与最终答案分开保存。推理过程通过 MetaGen 的原生 Dialog Completion 接口返回,并非从答案重构、由其他模型生成或复制自评分日志。

此外,数据集还包括一个增量扩展部分(Reasoning-v3 extension),扩展后累积人口为 5,730 道题91,680 条 GPT-OSS 轨迹286,500 个导出测试5,730 个当前难度评分

数据配置

配置名 文件 行数 含义
questions questions.jsonl.gz 2,865 每道题的提示词和生成配置
traces traces-*.jsonl.gz 45,840 每次 roll-out 的一条 GPT-OSS 推理/答案样本
test_cases test-cases-*.jsonl.gz 143,250 每道题 50 个经过验证的输入/输出对

所有配置可通过 generation_id 进行连接。在题目内部,轨迹以 rollout_index(0–15)为键,测试以 test_index(0–49)为键。

源题目分布

来源模型标签 题目数量
claude5opusvertex 1,293(扩展后累计含 1,952)
gemini 110
gpt55 780(扩展后累计含 424)
gpt56sol 682(扩展后累计含 489)

扩展部分已全局去重,目前新增 2,865 道题,与基线合计 5,730 道题。

生成配置

  • 请求与返回模型:openai_gpt-oss-120b-tba_grader
  • API 接口:MetaGen 原生 Dialog Completion
  • 每道题采样数:16
  • 推理努力程度:medium
  • Temperature:1.0
  • Top-p:有意省略
  • 基本采样种子:1234
  • 含非空推理的成功轨迹:45,840 / 45,840
  • 提供商报告的正推理 token 计数轨迹:45,840 / 45,840

提供商汇总用量

指标 总计
Prompt tokens 30,190,736
Completion tokens 577,326,234
总 tokens 607,516,970
推理 tokens 390,199,146
缓存 prompt tokens 4,040,432
推理字符数 1,545,599,295
最终答案字符数 675,335,226

Token 记账说明total_tokens = prompt_tokens + completion_tokenscompletion_tokens 包含推理 tokens 和可见答案 tokens。提供商报告的 num_non_reasoning_tokens 在此 API 路径上不可靠(报告为零),不得用于推断答案长度。num_reasoning_tokens: null 表示“未报告”,而非零;本次导出中每条轨迹均为正数。

扩展部分新增推理 tokens 为 437,254,076,累积提供商报告的推理 tokens 总计 827,453,222(含基线 390,199,146)。

Question Schema

每行包含:generation_id(稳定连接键)、source_model_tagprompt(精确的解题提示词,包含题目陈述)、prompt_sha256rollouts_required(始终为 16)、requested_modelreasoning_efforttemperaturetop_psampling_seed 以及 transport(原生推理能力 API 描述)。

Trace Schema

每行包含:generation_idrollout_indexreasoning(逐字原生推理内容)、answer(逐字最终助手答案)、prompt_sha256requested_modelreturned_modelreasoning_efforttemperaturetop_psampling_seedstarted_atcompleted_atlatency_secondsfinish_reason 以及 usage(完整净化的提供商用量对象,包括 prompt、completion、total、cached-prompt 和 reasoning-token 计数)。

五十道测试协议与 Schema

每道题恰好有 50 个确定性生成、经验证器接受且具有可信预期输出的测试用例:

  • 测试 0–29:size="small",生成器种子 0–29。
  • 测试 30–49:size="large",生成器种子 100000–100019。
  • 预期输出由该题的经验证参考解决方案产生。
  • 每个输入和预期输出均通过 SHA-256 链接至其原始验证夹具。
  • 夹具验证器版本:2026-08-29.5

每行包含:generation_idsource_model_tagtest_indexseedsizeinputexpected_outputinput_sha256output_sha256generator_sha256validator_sha256verifier_version

发布的 50 个夹具是紧凑的可复现评估子集,与完整的难度评分工作负载不同。难度评分使用 3 个样本测试、1,000 个小生成测试和 100 个大生成测试,用于 16 个候选答案中的每一个,因此每道题最多执行 1,103 × 16 = 17,648 次程序-测试执行(而非 17,648 个不同的测试输入),且候选评估可在失败后提前停止。

完整性与可复现性

  • manifest.json 记录题目和轨迹导出的计数、压缩大小和 SHA-256 哈希。
  • test_cases_plan.json 记录完整的确定性题目到分片计划及源夹具字节数。
  • test_cases_manifest.json 记录每个上传测试分片的最终压缩大小、SHA-256、题目范围和行数。
  • tools/export_verified_tests.py 是用于测试数据的精确有界导出器,在流式确定性 gzip 输出时验证每个夹具哈希。

扩展批次摘要

批次 题目数 轨迹数 测试数 推理 tokens 源 manifest SHA-256
000 500 8,000 25,000 71,923,146 见文件
001 500 8,000 25,000 69,950,651 见文件
002 500 8,000 25,000 72,103,253 见文件
003 500 8,000 25,000 80,990,286 见文件
004 500 8,000 25,000 82,774,953 见文件
005 365 5,840 18,250 59,511,787 见文件

批次文件及其精确校验和位于 extension/batch_NNN/manifest.json 下。

数据处理与排除内容

公开导出有意省略原始提供商信封、凭据、凭据槽标识符、桥接启动器详细信息、本地路径、评分草稿目录和临时文件。数据集中或 Git 历史中不存储任何身份验证令牌。

局限性及预期用途

  • 题目、解决方案和推理轨迹均为模型生成,尽管经过验证仍可能包含错误。
  • 推理轨迹可能冗长、不一致或不适合作为事实性解释。
  • 通过 50 个已发布用例并不确立完全正确性。
  • 在训练或再分发前,用户应自行进行来源、许可、安全、污染和质量审查。
  • 该数据集旨在用于推理、代码生成、验证和评估研究,而非权威事实来源。

引用说明

使用本数据集时,请引用 Hugging Face 仓库及所使用的确切提交修订版,以保持分片校验和与模式的可复现性。

搜集汇总
数据集介绍
tts-datagen 数据集图片
构建方式
该数据集旨在为文本转语音(TTS)领域的语音合成与评测提供海量、结构化的推理数据基础。其构建流程严谨而系统,首先由多种先进的语言模型(如Claude、Gemini及GPT系列)生成2,865道高质量的合成编程竞赛题目,涵盖不同难度与领域。随后,针对每道题目,采用GPT-OSS 120B模型,通过其原生对话补全接口,在固定采样配置下独立采样16次,完整记录模型的推理过程与最终答案。同时,每道题配备了50个经校验器验证且具有可信输出的测试用例,共计143,250个,以确保数据集的可靠性与可复现性。所有样本均通过generation_id等键进行关联,形成了从问题、推理轨迹到测试用例的完整数据链。
特点
该数据集的核心优势在于其独特的推理轨迹捕捉方式与严格的质量控制。它保留了模型推理过程的原始正文本,而非事后重构或从其他模型获取,确保了数据的原生性与真实性。数据集规模宏大,累积包含5,730道题目、91,680条推理轨迹及286,500个测试用例,并提供了详尽的元数据,包括提示词、采样参数、时间戳及令牌使用统计等。此外,数据集的构建遵循极高的完整性标准,通过Manifest文件记录哈希值,并采用固定的验证器版本,保证了每个阶段的产出都可验证、可复现,为推理过程分析、代码生成评估等领域提供了坚实的数据支撑。
使用方法
该数据集的使用方式灵活多样,既可通过HuggingFace的datasets库便捷加载,也支持流式处理,适用于大规模研究场景。用户可根据研究需求选择对应的配置(如questions、traces、test_cases),并利用generation_id等键进行多表关联分析。典型应用包括:分析GPT-OSS模型在编程问题上的原生推理模式,评估不同采样策略对解答质量的影响,或利用提供的测试用例对生成的代码进行自动化验证。数据集提供了Python示例代码,方便用户快速上手,进行数据探索或训练前的预处理。尽管数据集主要用于研究目的,但使用时仍需注意其局限性,如模型生成的解答可能包含错误,推理轨迹可能冗长或不一致,用户需自行评估数据的适用性并遵守相关许可协议。
背景与挑战
背景概述
该数据集由MetaGen在2026年创建,旨在捕捉GPT-OSS 120B模型在竞争性编程问题上的原生推理轨迹。其核心研究问题在于如何分离模型的推理过程与最终答案,以支持对代码生成、推理能力及验证方法的深入分析。通过MetaGen的Dialog Completion接口获取独立推理内容,避免了从答案中重构推理的局限性。数据集包含2,865个问题、45,840条轨迹及143,250个测试用例,总计超过6亿个token,其规模与细致设计为语言模型推理研究提供了丰富资源。该数据集由Harman等机构发布,对于推动推理可解释性、程序合成及自动评估领域的发展具有重要意义,其提供的标准化测试协议和验证机制为社区提供了可复现的基准,影响力广泛。
当前挑战
该领域面临的挑战包括:确保推理轨迹的真实性和独立性,避免模型输出对最终答案的过拟合;验证大规模生成数据的正确性与可靠性,尤其在竞争性编程环境中,问题复杂度高,模型易产生逻辑漏洞;设计公平且全面的评估协议,以有效衡量推理质量而非仅看答案正确性。构建过程中,数据集创建者需克服从API中准确提取原生推理的困难,处理token计数不一致等元数据问题,并通过严格的哈希验证确保数据完整性。此外,平衡数据规模与质量,管理推理轨迹的高度冗余和冗长性,以及避免潜在的数据污染,也是重要挑战。该数据集通过双重验证协议和详细记录,部分缓解了这些难题,但仍需使用者审慎评估其局限。
常用场景
经典使用场景
该数据集聚焦于大规模语言模型在竞争性编程任务中的原生推理过程研究,提供了2,865道合成编程问题、每道问题16次独立采样共计45,840条GPT-OSS 120B推理轨迹,以及每道问题50个已验证测试用例。其核心价值在于将模型的内部推理内容与最终答案分离存储,为剖析推理链的完整性、逻辑连贯性及错误传播机制提供了稀缺的细粒度语料。研究者常用于探究不同推理温度与采样策略对解题质量的影响,或比较不同来源模型(如claude5opusvertex、gpt55等)生成问题的难度分布与推理模式差异。
实际应用
在实际应用层面,该数据集可服务于智能编程辅助系统的开发与优化,例如训练能自动解释代码逻辑的教学模型,或构建能识别并纠正错误推理的代码审查助手。其详尽的推理轨迹可被用于微调模型以产出更清晰、更结构化的解题思路,提升代码生成工具对用户意图的理解深度。此外,50个已验证测试用例为自动化评估代码正确性提供了高质量基准,可应用于在线判题系统、算法竞赛训练平台以及企业级代码质量检测流程中,以验证模型生成程序的鲁棒性与效率。
衍生相关工作
本数据集已衍生多项具有影响力的研究实践。在推理追踪方面,催生了专门针对模型内部思维链分割与压缩的算法研究,以及基于推理长度预测解题成功率的统计模型。在程序合成领域,研究者利用该数据集的多样化问题与测试用例,开发了更具挑战性的代码生成自监督训练任务,并探索了利用推理痕迹进行强化学习奖励建模的新途径。同时,数据集中包含的逐步验证测试集启发了若干自动测试生成与程序语法验证工具的改进,推动了可复现评估流程(如分片哈希校验)在数据集构建中的标准实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务