atlas-25-sequential-tool-runtime-upgrade
收藏资源简介:
该数据集记录了ATLAS项目报告25的强化学习实验,名为“顺序工具运行时升级”。实验使用verl V1同步PPO框架,结合FSDP2、LoRA(rank 64/alpha 128)、vLLM 0.26.0和XGrammar 0.2.3,在2个NVIDIA A100-SXM4-80GB GPU上进行训练。数据集中包含以下配置表:step_metrics_by_run(步骤指标)、full_validation_views(完整验证视图)、perf_stack(性能堆栈)、arms_validation_curve(实验臂验证曲线)、arms_step_metrics(实验臂步骤指标)和arms_call_advantage(实验臂调用优势)。实验过程包括多个阶段:冒烟测试、边界测试、训练冒烟、零势能臂、冻结势能臂、剂量步骤、完整验证、以及报告24问题的40步研究。数据集提供了训练轨迹、验证转储、检查点、适配器权重(actor/critic)以及优化器状态等完整记录。此外,还包含时间测量(分步时间、保存时间)、内存峰值记录、协议验证结果(无协议违规)和边界条件处理。该数据集适用于强化学习训练流程分析、性能比较、工具运行时验证以及结果复现。
This dataset records the reinforcement learning experiment for ATLAS Project Report 25, titled Sequential Tool Runtime Upgrade. The experiment uses the verl V1 synchronous PPO framework with FSDP2, LoRA (rank 64/alpha 128), vLLM 0.26.0, and XGrammar 0.2.3, trained on 2 NVIDIA A100-SXM4-80GB GPUs. The dataset includes configuration tables: step_metrics_by_run, full_validation_views, perf_stack, arms_validation_curve, arms_step_metrics, and arms_call_advantage. The experimental process includes multiple stages: smoke test, boundary test, training smoke, zero potential arm, frozen potential arm, dose step, full validation, and a 40-step study for Report 24 issues. The dataset provides complete records of training trajectories, validation dumps, checkpoints, adapter weights (actor/critic), and optimizer states. It also includes time measurements (step time, save time), memory peak records, protocol verification results (no protocol violations), and boundary condition handling. This dataset is suitable for reinforcement learning training pipeline analysis, performance comparison, tool runtime validation, and result reproduction.
ATLAS 报告25:顺序工具运行时升级(sequential tool runtime upgrade)
数据集概述
本数据集是ATLAS强化学习实验(报告25)的完整记录,聚焦于顺序工具运行时的升级验证及其在verl V1上的应用。报告验证了新强化学习运行时是否能精确执行策略生成的内容,并在执行后准确给予奖励。数据集状态为完整(complete),覆盖正确性验收(issue 59)、性能堆栈以及报告24问题的首次研究应用。
核心验证结果
- 运行时机制:每个生成被限制为自由文本后紧跟一个工具调用(由XGrammar编译并由vLLM强制),每个回合写入一条类型化执行记录,奖励仅从该记录评分,并放置在记录的动作token上。
- 主要结论(Reading S成立):717条轨迹、2460次生成、每次恰好一次调用、0次协议违规,每个奖励行都位于已记录的动作token上。所有373个验证轨迹均完成。
- 遇到并修复的6个边界问题:包括两个上游verl缺陷、一个LiveCodeBench评分器下的filelock缺陷,以及三个自身的缺陷,每个均已修复并重新运行该阶段。
- 研究重跑:两个分支(shaped冻结势臂与zero-potential基线)各执行40步,共28.7 GPU小时,保持所有80步的不变量,并额外遇到评分器子进程时间边界(commit b9727b1修复并恢复)。
关键性能指标
- 单步32×8耗时:618秒(完整批处理测试:1461.64秒,包含生成240.73秒、actor更新658.34秒、critic更新221.69秒)
- 检查点保存优化:模型分片从110.03 GB降至3.15 GB/步,平均保存时间从300.46秒降至21.98秒(减少92.68%),保存步骤包含所有可训练的actor和critic张量
- 内存峰值:完整批处理测试中采样内存峰值为66.42和66.15 GiB/卡,GPU利用率91.32%和93.59%
- longest sequence:3035 tokens(短GPQA训练轨迹);完整批处理最长轨迹达5154 tokens
时序测试详情
| 测试 | 运行ID | 结果 |
|---|---|---|
| 检查点保存测试 | k0kna2nk | 3步完成,保存耗时分别为0.0/21.7/22.3秒 |
| 完整批处理一步 | j6t7ucte | 256轨迹完成(551次生成),总时长1461.64秒 |
| 压力测试 | leg4olc4(正式40步运行) | 已启动,训练GPQA和LiveCodeBench |
| 分割压力检查 | mbbwabv5 | 8×24576 token行×2步,计算495.35/488.24秒,保存22.67/22.61秒 |
| GPU数据检查 | smzox57n | 128全长度行+128单行微批次,7.12秒 |
数据文件与配置
数据集通过Hub数据集查看器提供6个表(tables/目录),对应配置:
- step_metrics_by_run — 各运行的步级指标
- full_validation_views — 完整验证(198 GPQA + 175 LiveCodeBench)的视图
- perf_stack — 性能堆栈数据
- arms_validation_curve — 两分支的验证曲线
- arms_step_metrics — 两分支的步级指标
- arms_call_advantage — 两分支的调用优势
输出记录文件
数据集包含多种记录JSON文件:
validation.json:轨迹计数、协议检查、权重探针和堆栈compact_checkpoint_validation.json:可训练名称、critic头键、文件大小及有限值检查(按步/角色/秩)checkpoint_validation.json:优化器计数和导出的适配器哈希cpu_roundtrip.json和distributed_roundtrip_rank_*.json:恢复检查batch_math.json:问题、轨迹和更新单元timing_analysis.json:原生阶段时间和采样GPU读数
研究应用与训练配置
- 本数据集包含报告24问题的两个40步分支的完整重跑(在4张卡上并行):shaped(冻结势)臂运行
9ter1d02(步0-40)和zero-potential臂运行zud7g3zw(步0-10)+c0jfud2t(步11-40) - 研究发现:shaped臂在步骤15-40间的窗口平均GPQA效用比基线高2.02个百分点,完全由基线第40步验证中的13条GPQA轨迹(在已写入答案的未闭合submit调用内空白循环至上限)造成
- 正式40步运行(leg4olc4):仅训练GPQA(158题)和LiveCodeBench(140题),每步32题×8响应,排除HLE
运行环境与实例
- 使用环境保存在GCP镜像中:
atlas-envs-sft-rl27-a100-20260908(项目caramel-theory-145119) - 硬件:2×A100-SXM4-80GB GPU(GCP)
- 强化学习配置:FSDP2、bf16、LoRA rank 64/alpha 128、Liger、梯度检查点、padding移除、Triton输出头,阶段间两模型CPU存储,优化器状态留在GPU上
- 使用的模型:报告15的
Qwen3.6-27B(27B参数,rl27指模型尺寸而非实验27) - 训练数据包含GPQA(158题)和LCB(140题)联合训练,保留问题顺序,1280个有序问题输入经CPU运行验证
- 所有W&B运行(项目
pqin/atlas-grpo)均已结束,全部运行及超链接记录在数据集中





