round4-oracle-fb
收藏资源简介:
ROUND 4 数据集是一个用于监督微调(SFT)的代码生成与问题求解训练数据集,由前两轮(round 2 和 round 3)的问题池合并而成,总计 7,155 个问题。数据集包含两个分支:oracle-fb(全评分反馈)和 independent(独立采样),两个分支均保留了推理过程(reasoning retention),使得每个候选解都附带完整的思维链或推理文本。数据规模约为 1.23M 个带推理的新生成样本,以及约 114,480 个无推理的初始样本。每个样本包含问题、候选解、推理过程、配对信息(paired_with)和来源轮次(source_round)。该数据集适用于自我进化训练、代码生成、问题求解等场景,特别适合需要推理链的监督微调任务。
The ROUND 4 dataset is a training dataset for supervised fine-tuning (SFT) of code generation and problem-solving, merged from the problem pools of rounds 2 and 3, with a total of 7,155 problems. It contains two branches: oracle-fb (full-score feedback) and independent (independent sampling), both with reasoning retention, so each candidate solution comes with a complete chain-of-thought or reasoning text. The data scale is approximately 1.23M new generated samples with reasoning and about 114,480 initial samples without reasoning. Each sample includes a problem, candidate solution, reasoning process, paired_with information, and source_round. This dataset is suitable for self-evolution training, code generation, problem-solving, and especially for SFT tasks that require reasoning chains.
数据集概述
round4-oracle-fb 是一个用于SFT(监督微调)的数据集,属于TTS-SFT项目的第4轮生成轮次,发布于2026-08-12。
核心特征
- 内容:融合了第2轮重跑池(4,322个问题,标识为
apps-*/cc-*)与第3轮池(2,833个问题,标识为cc3-*)的组合池,总计7,155个问题,ID零重叠 - 机制:基于oracle-feedback(全量评测套件反馈)的进化搜索(SE),保留推理(reasoning)文本
- 模型规模:120B参数,两个臂(A为oracle-fb,B为independent)均为120B
数据集结构
| 臂 | 单元数 | 机制 |
|---|---|---|
| A(oracle-fb SE) | 30(15个r2 + 15个r3) | 全量评测反馈,推理保留,候选 = `<think>推理</think> |
最终 | | B(independent) | 24(混合) | 基于token预算的采样,推理作为独立rt`字段保存 |
每个oracle单元是现有oracle-feedback单元的字节级逐字副本,保持与源单元的配对关系。
循环预算策略
- 桶0(b0):保持8个进化循环(唯一增加覆盖率的桶,曲线在horizon处仍上升)
- 其他桶(b1-3, b4-7, b8-11, b12-15):降为4个循环(原为6),密度收益近乎线性,无拐点损失
- 循环0因不含推理而被丢弃,但对SFT无影响(桶0正确候选为0,高桶的循环0与独立臂分布相同)
生成数据规模
| 类别 | 数量 | 推理 |
|---|---|---|
| 新候选(arm A) | 554,496 | 有 |
| 独立采样(arm B) | 约679,000 | 有 |
| 新增推理样本 | 约1.23M | 有 |
| 循环0样本(已存在) | 114,480 | 无 |
成本与部署
- 预算:arm A约5.82B tokens,arm B约7.27B tokens,总计约13.09B tokens
- 分片:54个分片(30A + 24B),每节点同时运行一个单元
- 节点需求:54节点约11.5小时完成,建议优先启动6个8循环的
r3_b00单元 - 数据体积:约40-80 GB返回数据(推理保留导致增大)
关键验证
- 推理保留补丁(guarded P3)已通过自检(自检1通过、自检2通过)
- 12/12候选携带推理且最终代码可提取
- 采样器的推理字段可存活至最终输出文件
注意事项
- r3半区携带217个认证SPJ检查器,r2半区因配对需求而不含(保持逐字复制)
- 运行前需Harman确认(硬性规则),SFT决策尚未门控
- 仅限120B模型运行




