遇见数据集

round4-oracle-fb

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

ROUND 4 数据集是一个用于监督微调(SFT)的代码生成与问题求解训练数据集,由前两轮(round 2 和 round 3)的问题池合并而成,总计 7,155 个问题。数据集包含两个分支:oracle-fb(全评分反馈)和 independent(独立采样),两个分支均保留了推理过程(reasoning retention),使得每个候选解都附带完整的思维链或推理文本。数据规模约为 1.23M 个带推理的新生成样本,以及约 114,480 个无推理的初始样本。每个样本包含问题、候选解、推理过程、配对信息(paired_with)和来源轮次(source_round)。该数据集适用于自我进化训练、代码生成、问题求解等场景,特别适合需要推理链的监督微调任务。

The ROUND 4 dataset is a training dataset for supervised fine-tuning (SFT) of code generation and problem-solving, merged from the problem pools of rounds 2 and 3, with a total of 7,155 problems. It contains two branches: oracle-fb (full-score feedback) and independent (independent sampling), both with reasoning retention, so each candidate solution comes with a complete chain-of-thought or reasoning text. The data scale is approximately 1.23M new generated samples with reasoning and about 114,480 initial samples without reasoning. Each sample includes a problem, candidate solution, reasoning process, paired_with information, and source_round. This dataset is suitable for self-evolution training, code generation, problem-solving, and especially for SFT tasks that require reasoning chains.

创建时间:
2026-08-13
原始信息汇总

数据集概述

round4-oracle-fb 是一个用于SFT(监督微调)的数据集,属于TTS-SFT项目的第4轮生成轮次,发布于2026-08-12。

核心特征

  • 内容:融合了第2轮重跑池(4,322个问题,标识为apps-*/cc-*)与第3轮池(2,833个问题,标识为cc3-*)的组合池,总计7,155个问题,ID零重叠
  • 机制:基于oracle-feedback(全量评测套件反馈)的进化搜索(SE),保留推理(reasoning)文本
  • 模型规模:120B参数,两个臂(A为oracle-fb,B为independent)均为120B

数据集结构

单元数 机制
A(oracle-fb SE) 30(15个r2 + 15个r3) 全量评测反馈,推理保留,候选 = `<think>推理</think>

最终 | | B(independent) | 24(混合) | 基于token预算的采样,推理作为独立rt`字段保存 |

每个oracle单元是现有oracle-feedback单元的字节级逐字副本,保持与源单元的配对关系。

循环预算策略

  • 桶0(b0):保持8个进化循环(唯一增加覆盖率的桶,曲线在horizon处仍上升)
  • 其他桶(b1-3, b4-7, b8-11, b12-15):降为4个循环(原为6),密度收益近乎线性,无拐点损失
  • 循环0因不含推理而被丢弃,但对SFT无影响(桶0正确候选为0,高桶的循环0与独立臂分布相同)

生成数据规模

类别 数量 推理
新候选(arm A) 554,496
独立采样(arm B) 约679,000
新增推理样本 约1.23M
循环0样本(已存在) 114,480

成本与部署

  • 预算:arm A约5.82B tokens,arm B约7.27B tokens,总计约13.09B tokens
  • 分片:54个分片(30A + 24B),每节点同时运行一个单元
  • 节点需求:54节点约11.5小时完成,建议优先启动6个8循环的r3_b00单元
  • 数据体积:约40-80 GB返回数据(推理保留导致增大)

关键验证

  • 推理保留补丁(guarded P3)已通过自检(自检1通过、自检2通过)
  • 12/12候选携带推理且最终代码可提取
  • 采样器的推理字段可存活至最终输出文件

注意事项

  • r3半区携带217个认证SPJ检查器,r2半区因配对需求而不含(保持逐字复制)
  • 运行前需Harman确认(硬性规则),SFT决策尚未门控
  • 仅限120B模型运行
搜集汇总
数据集介绍
round4-oracle-fb 数据集图片
构建方式
round4-oracle-fb数据集是在第四轮生成中构建的,其核心为将第二轮的复跑池与第三轮的候选池合并,形成总计7155个无重叠问题实例的组合池。该数据集采用双臂并行架构,其中手臂A为oracle-fb SE模式,依托全量评分套件反馈,并通过对推理通道的保留(即SE_KEEP_REASONING=1)确保每个候选输出均包含明确的思考链与最终答案;手臂B则采用独立的token预算采样,并独立记录推理字段。每个oracle单元均逐字节复制自既有oracle-fb单元,保持种子、反馈测试与检查点的一致性,并通过unit.json中的配对信息维护与源轮次的对应关系。在循环预算上,桶0维持完整的8轮演化以最大化覆盖,其余桶减至4轮,以平衡计算成本与数据增益。
使用方法
使用round4-oracle-fb数据集时,需遵循预定义的运行脚本与节点配置。每个单元对应一个计算节点,通过bash命令执行运行脚本,并设置UNIT与RUN_DIR环境变量以指定输入输出路径。支持断点续跑,重新执行相同命令即可恢复。对于oracle臂,需先安装包含多个补丁的minipatch脚本,该脚本会自检并通过特定输出(如‘自检1通过’)验证安装成功。独立臂则无需额外依赖,数据集根目录已包含固定采样器。整个运行流程需遵循预设的预算与门控规则,包括在启动前获得特定人员的确认,且仅限120B模型使用。返回的RUN_DIR交由后端进行统一评测,其中包含SPJ重评机制,确保数据质量的可信度。
背景与挑战
背景概述
本数据集源于TTS-SFT项目在2026年8月12日发起的第四轮生成实验,由研究团队Yang主导,旨在解决代码生成任务中推理链数据稀缺与质量不均衡的挑战。该轮创新性地结合了oracle-feedback与独立采样双臂,通过保留推理过程(reasoning retention)并优化迭代预算,生成超过120万条带推理的候选样本,为后续监督微调(SFT)提供高质量训练语料。其设计兼顾了计算成本与数据多样性,尤其针对桶0(真实零样本)问题深化探索,显著提升了模型对复杂代码问题的推理能力,对代码智能领域具有重要参考价值。
当前挑战
该数据集面临多重挑战:其一,领域问题层面,代码生成任务需平衡推理深度与运算效率,桶0问题因缺乏正确初始解而需要更长的演化链(8轮),而非零桶则面临密度与多样性的权衡。其二,构建过程中,需确保两臂(oracle-fb与independent)的计算匹配与数据一致性,同时保留推理信息会大幅增加存储开销(预计40-80GB)。此外,验证推理保留的可靠性(如strip/extract往返一致性)及修复采样器中的线程丢失缺陷,亦构成技术难点。最终,如何在有限节点预算内(约306节点时)高效调度,以最短挂钟时间完成生成,也是工程层面的关键挑战。
常用场景
经典使用场景
round4-oracle-fb数据集作为强化学习与监督微调领域的前沿资源,其核心用途在于构建包含完整推理链的训练语料。该数据集精心整合了源自两个独立轮次的问题池,并利用120B参数模型在oracle反馈机制下生成候选解,每个样本均保留思考过程与最终代码,为探究推理能力在代码生成中的传导效应提供了高质量的实验基底。研究者常借此数据集训练模型,使其在复杂编程任务中不仅输出正确答案,更能显式呈现逐步推理路径,从而提升模型的可解释性与鲁棒性。
解决学术问题
该数据集直面大语言模型在自我进化与迭代优化中的关键瓶颈,即如何有效利用详尽反馈信号生成超越初始采样的高质量候选解。通过引入完整测试套件反馈与推理保留策略,它系统性地记录了模型在演化循环中的每步推理与代码变更,为解决‘推理-行动’协同优化、稀疏奖励下的探索效率以及长程信用分配等学术难题提供了实证支撑。其配对设计(与早期轮次逐问题对应)还使得跨轮次比较性研究成为可能,有力地推动了关于反馈深度、循环预算与生成多样性之间关系的理论探讨。
实际应用
在实际应用中,round4-oracle-fb数据集直接服务于代码大模型的SFT阶段,用于增强模型从自然语言描述到可执行代码的映射能力,尤其适用于需要严谨逻辑与多步推导的算法竞赛级问题。其保留的推理链文本可被用于训练模型在代码补全、程序修复及测试用例生成等场景中提供中间解释,从而提升开发辅助工具的可用性与用户信任。此外,数据集中独立臂与oracle臂的对比设计,使其成为校准采样预算与反馈开销的重要参考基准,助力工业界在有限算力下优化数据生成管线。
数据集最近研究
最新研究方向
本数据集聚焦于利用多臂并行框架与推理保留机制,在数学推理与代码生成领域探索自进化模型的性能边界。其前沿方向在于通过全量级评测反馈与有监督微调(SFT)数据构建,揭示推理轨迹对模型迭代的增益效应。研究热点涵盖循环进化策略的收益递减分析、零样本问题的深度挖掘,以及推理保留对训练数据质量与模型泛化能力的潜在影响。该数据集不仅提供了大规模、带推理链的训练样本,更通过严谨的对照组设计与计算预算匹配,为后续研究确立了可复现的基准范式,对推动大语言模型在复杂推理任务中的自改进具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务