遇见数据集

atlas-25-sequential-tool-runtime-upgrade

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

该数据集记录了ATLAS项目报告25的强化学习实验,名为“顺序工具运行时升级”。实验使用verl V1同步PPO框架,结合FSDP2、LoRA(rank 64/alpha 128)、vLLM 0.26.0和XGrammar 0.2.3,在2个NVIDIA A100-SXM4-80GB GPU上进行训练。数据集中包含以下配置表:step_metrics_by_run(步骤指标)、full_validation_views(完整验证视图)、perf_stack(性能堆栈)、arms_validation_curve(实验臂验证曲线)、arms_step_metrics(实验臂步骤指标)和arms_call_advantage(实验臂调用优势)。实验过程包括多个阶段:冒烟测试、边界测试、训练冒烟、零势能臂、冻结势能臂、剂量步骤、完整验证、以及报告24问题的40步研究。数据集提供了训练轨迹、验证转储、检查点、适配器权重(actor/critic)以及优化器状态等完整记录。此外,还包含时间测量(分步时间、保存时间)、内存峰值记录、协议验证结果(无协议违规)和边界条件处理。该数据集适用于强化学习训练流程分析、性能比较、工具运行时验证以及结果复现。

This dataset records the reinforcement learning experiment for ATLAS Project Report 25, titled Sequential Tool Runtime Upgrade. The experiment uses the verl V1 synchronous PPO framework with FSDP2, LoRA (rank 64/alpha 128), vLLM 0.26.0, and XGrammar 0.2.3, trained on 2 NVIDIA A100-SXM4-80GB GPUs. The dataset includes configuration tables: step_metrics_by_run, full_validation_views, perf_stack, arms_validation_curve, arms_step_metrics, and arms_call_advantage. The experimental process includes multiple stages: smoke test, boundary test, training smoke, zero potential arm, frozen potential arm, dose step, full validation, and a 40-step study for Report 24 issues. The dataset provides complete records of training trajectories, validation dumps, checkpoints, adapter weights (actor/critic), and optimizer states. It also includes time measurements (step time, save time), memory peak records, protocol verification results (no protocol violations), and boundary condition handling. This dataset is suitable for reinforcement learning training pipeline analysis, performance comparison, tool runtime validation, and result reproduction.

创建时间:
2026-09-06
原始信息汇总

ATLAS 报告25:顺序工具运行时升级(sequential tool runtime upgrade)

数据集概述

本数据集是ATLAS强化学习实验(报告25)的完整记录,聚焦于顺序工具运行时的升级验证及其在verl V1上的应用。报告验证了新强化学习运行时是否能精确执行策略生成的内容,并在执行后准确给予奖励。数据集状态为完整(complete),覆盖正确性验收(issue 59)、性能堆栈以及报告24问题的首次研究应用。

核心验证结果

  • 运行时机制:每个生成被限制为自由文本后紧跟一个工具调用(由XGrammar编译并由vLLM强制),每个回合写入一条类型化执行记录,奖励仅从该记录评分,并放置在记录的动作token上。
  • 主要结论(Reading S成立):717条轨迹、2460次生成、每次恰好一次调用、0次协议违规,每个奖励行都位于已记录的动作token上。所有373个验证轨迹均完成。
  • 遇到并修复的6个边界问题:包括两个上游verl缺陷、一个LiveCodeBench评分器下的filelock缺陷,以及三个自身的缺陷,每个均已修复并重新运行该阶段。
  • 研究重跑:两个分支(shaped冻结势臂与zero-potential基线)各执行40步,共28.7 GPU小时,保持所有80步的不变量,并额外遇到评分器子进程时间边界(commit b9727b1修复并恢复)。

关键性能指标

  • 单步32×8耗时:618秒(完整批处理测试:1461.64秒,包含生成240.73秒、actor更新658.34秒、critic更新221.69秒)
  • 检查点保存优化:模型分片从110.03 GB降至3.15 GB/步,平均保存时间从300.46秒降至21.98秒(减少92.68%),保存步骤包含所有可训练的actor和critic张量
  • 内存峰值:完整批处理测试中采样内存峰值为66.42和66.15 GiB/卡,GPU利用率91.32%和93.59%
  • longest sequence:3035 tokens(短GPQA训练轨迹);完整批处理最长轨迹达5154 tokens

时序测试详情

测试 运行ID 结果
检查点保存测试 k0kna2nk 3步完成,保存耗时分别为0.0/21.7/22.3秒
完整批处理一步 j6t7ucte 256轨迹完成(551次生成),总时长1461.64秒
压力测试 leg4olc4(正式40步运行) 已启动,训练GPQA和LiveCodeBench
分割压力检查 mbbwabv5 8×24576 token行×2步,计算495.35/488.24秒,保存22.67/22.61秒
GPU数据检查 smzox57n 128全长度行+128单行微批次,7.12秒

数据文件与配置

数据集通过Hub数据集查看器提供6个表(tables/目录),对应配置:

  • step_metrics_by_run — 各运行的步级指标
  • full_validation_views — 完整验证(198 GPQA + 175 LiveCodeBench)的视图
  • perf_stack — 性能堆栈数据
  • arms_validation_curve — 两分支的验证曲线
  • arms_step_metrics — 两分支的步级指标
  • arms_call_advantage — 两分支的调用优势

输出记录文件

数据集包含多种记录JSON文件:

  • validation.json:轨迹计数、协议检查、权重探针和堆栈
  • compact_checkpoint_validation.json:可训练名称、critic头键、文件大小及有限值检查(按步/角色/秩)
  • checkpoint_validation.json:优化器计数和导出的适配器哈希
  • cpu_roundtrip.jsondistributed_roundtrip_rank_*.json:恢复检查
  • batch_math.json:问题、轨迹和更新单元
  • timing_analysis.json:原生阶段时间和采样GPU读数

研究应用与训练配置

  • 本数据集包含报告24问题的两个40步分支的完整重跑(在4张卡上并行):shaped(冻结势)臂运行9ter1d02(步0-40)和zero-potential臂运行zud7g3zw(步0-10)+ c0jfud2t(步11-40)
  • 研究发现:shaped臂在步骤15-40间的窗口平均GPQA效用比基线高2.02个百分点,完全由基线第40步验证中的13条GPQA轨迹(在已写入答案的未闭合submit调用内空白循环至上限)造成
  • 正式40步运行(leg4olc4):仅训练GPQA(158题)和LiveCodeBench(140题),每步32题×8响应,排除HLE

运行环境与实例

  • 使用环境保存在GCP镜像中:atlas-envs-sft-rl27-a100-20260908(项目caramel-theory-145119
  • 硬件:2×A100-SXM4-80GB GPU(GCP)
  • 强化学习配置:FSDP2、bf16、LoRA rank 64/alpha 128、Liger、梯度检查点、padding移除、Triton输出头,阶段间两模型CPU存储,优化器状态留在GPU上
  • 使用的模型:报告15的Qwen3.6-27B(27B参数,rl27指模型尺寸而非实验27)
  • 训练数据包含GPQA(158题)和LCB(140题)联合训练,保留问题顺序,1280个有序问题输入经CPU运行验证
  • 所有W&B运行(项目pqin/atlas-grpo)均已结束,全部运行及超链接记录在数据集中
搜集汇总
数据集介绍
atlas-25-sequential-tool-runtime-upgrade 数据集图片
构建方式
该数据集源自ATLAS实验系列的第25号报告,专注于顺序工具运行时升级的强化学习实验记录。构建过程中,研究者们精心设计了多个实验阶段,涵盖从SFT到RL的迁移、硬件性能验证、全长批次计时测试及内存压力测试等关键环节。数据集以表格形式存储了完整的实验度量、验证曲线、性能堆栈等结构化信息,并附有详尽的运行日志与检查点数据。数据采集严格遵循预注册的实验方案,每一次运行均记录了协议遵循情况、设备内存峰值、步进耗时等细粒度的指标,确保了数据来源的可靠性。
特点
此数据集的核心特色在于其高度完备性与一致性。全部717条轨迹、2460次生成均严格满足每次仅调用一次工具且零协议违规的约束,保证了奖励信号与实际行动的精确对齐。数据集不仅涵盖了从Smoke测试到40步正式运行的多样化实验场景,还完整保留了失败尝试的记录,以供后续分析。尤为突出的是,其检查点存储优化实现了92.68%的文件大小缩减,展示了训练效率的显著提升。此外,联合训练数据的组织方式及与W&B平台的深度集成,为复现实验与深层洞察提供了坚实的数据基础。
使用方法
用户可通过HuggingFace数据集查看器访问六个独立配置的表格数据,例如step_metrics_by_run与arms_validation_curve,用于分析训练步进指标与验证曲线。实验的完整记录,包括运行日志、检查点及导出模型,可通过报告提供的W&B项目链接或GitHub仓库获取,以实现端到端的结果复现。该数据集特别适用于强化学习训练流程的验证、运行时性能的基准测试,以及顺序工具调用场景下学习动态的研究。需要注意的是,检查点文件与初始适配器权重仅存储于Hub端,其余阅读副本亦可在私有GitHub仓库中找到,便于离线分析。
背景与挑战
背景概述
本数据集为ATLAS项目第25号报告'atlas-25-sequential-tool-runtime-upgrade',由t2ance团队于2026年9月创建,旨在验证并升级基于verl V1的强化学习运行时系统,以支撑多智能体工具调用策略的序列化执行与奖励对齐。研究聚焦于评估替换后的运行时能否精确执行策略生成的每一个工具调用,并依据实际执行记录分配奖励,核心问题源于对报告24中科学问题的复现与深化。该数据集记录了从SFT到RL的完整链路测试、27B模型硬件验证及40步形式化训练等阶段性成果,其影响力在于为大规模语言模型在受限环境下的工具使用强化学习提供了可复现的基准与性能参考,对RL运行时工程与实验记录标准化具有实践意义。
当前挑战
数据集构建与验证过程中直面多重挑战:领域层面,需解决强化学习运行时对策略生成内容与执行奖励的精确对齐问题,即确保每次生成仅触发状态允许的单一工具调用,并基于真实执行记录而非预期行为计酬,这在长序列(如3035至24576令牌)与并发轨迹(如32并发序列)下尤为复杂。构建层面,遭遇上游verl缺陷、文件锁审计失败及自研代码的三类边界问题,均需修复并重跑;同时面临GPU内存峰值波动(如58.58至66.42 GiB)、优化器状态与适配器权重的完整保存及哈希一致性校验,以及训练中断后的恢复机制(如resume_mode=auto)等工程挑战,还需在严格资源预算(如约1.98至2.13 GPU小时)内完成多阶段验证,确保每一读数均达到预注册的判定标准。
常用场景
经典使用场景
该数据集记录了ATLAS项目在顺序工具调用环境下的强化学习运行时升级的完整实验轨迹,涵盖PPO训练步骤、轨迹数据、验证指标及性能基准。其典型使用场景是作为强化学习训练流程的可复现基准,研究者可借此评估不同RL算法在工具调用任务中的稳定性与效率,亦可利用其详细的步骤级指标进行训练动态的细粒度分析。
实际应用
该数据集的实际应用集中于改进AI代理的工具调用能力,尤其在需要严格协议遵循的复杂任务中。其记录的运行时升级和优化(如FSDP2、LoRA)可为工业界部署高效且稳健的RL系统提供参考。此外,数据集中的验证指标有助于开发自动化监控工具,以实时检测训练异常,从而提升生产环境下AI训练流程的稳定性与效率。
衍生相关工作
该数据集衍生的相关工作涵盖多个方向:基于其记录的失败案例,研究者可开展RL训练的故障分析与修复研究;其验证曲线和性能指标可用于设计RL算法的超参数优化方法。进一步,其架构配置(如verl V1与FSDP2)可激发关于大规模并行训练的新实验,而数据集中的轨迹数据则为后续研究工具调用策略的奖励设计或长上下文建模提供了丰富素材。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务