PRM-agent-rl-artifacts
收藏资源简介:
该数据集包含了多个强化学习智能体训练过程中的rollouts(轨迹)和评估输出。具体包括:基于Search-R1 / Qwen3-8B模型使用outcome-GRPO和Process-GRPO(per-turn-norm)方法的训练rollouts;基于ALFWorld和WebShop任务,使用Qwen3-8B和OLMo3-7B模型在不同强化学习算法(GiGPO、outcome-GRPO、Process-GRPO)下的训练rollouts;以及评估子目录,包含无训练器的检查点评估结果,如逐步骤指标、逐回合轨迹和聚合数据。每个rollout文件对应一个优化步骤,每行是一条采样轨迹,包含解码后的提示、响应和奖励。数据可用于强化学习训练过程分析、算法比较、奖励分析等。
This dataset contains rollouts (trajectories) and evaluation outputs from the training process of multiple reinforcement learning agents. Specifically, it includes: training rollouts based on the Search-R1 / Qwen3-8B model using outcome-GRPO and Process-GRPO (per-turn-norm) methods; training rollouts based on ALFWorld and WebShop tasks using Qwen3-8B and OLMo3-7B models under different reinforcement learning algorithms (GiGPO, outcome-GRPO, Process-GRPO); and evaluation subdirectories containing checkpoint evaluation results without a trainer, such as step-by-step metrics, per-episode trajectories, and aggregated data. Each rollout file corresponds to an optimization step, with each line representing a sampled trajectory containing the decoded prompt, response, and reward. The data can be used for reinforcement learning training process analysis, algorithm comparison, reward analysis, etc.
数据集总结
该数据集名为 PRM-agent-rl-artifacts,是一个用于存储强化学习智能体训练和评估产出的数据集,许可证为 Apache-2.0。数据集中包含多个 GRPO(Group Relative Policy Optimization)智能体运行过程中的训练 rollout 数据与评估输出。每个 rollout 文件对应一个优化器步骤,文件中的每一行代表一条采样的轨迹,包含解码后的提示(prompt)、响应(response)和奖励(reward)。
训练 Rollout 数据
| 目录路径 | 内容说明 |
|---|---|
rollouts/search_r1_qwen3_8b_4gpu |
Search-R1 / Qwen3-8B 模型使用结果导向 GRPO(outcome-GRPO)训练的 rollout 数据 |
rollouts/search_r1_qwen3_8b_perturnnorm |
Search-R1 / Qwen3-8B 模型使用过程导向 GRPO(per-turn-norm)训练的 rollout 数据 |
rollouts/alfworld_qwen3_8b_gigpo |
ALFWorld / Qwen3-8B 模型使用 GiGPO 训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件 |
rollouts/webshop_qwen3_8b_gigpo |
WebShop / Qwen3-8B 模型使用 GiGPO 训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件 |
rollouts/webshop_olmo3_7b_gigpo |
WebShop / OLMo-3-7B 模型使用 GiGPO 训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件 |
rollouts/webshop_olmo3_7b_outcome_2048 |
WebShop / OLMo-3-7B 模型使用结果导向 GRPO(上限为 2048)训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件 |
rollouts/webshop_qwen3_8b_process_center_mean_std |
WebShop / Qwen3-8B 模型使用过程导向 GRPO(center mean_std)训练的 rollout 数据,在第 124 步时中止 |
rollouts/webshop_qwen3_8b_process_std_sum |
WebShop / Qwen3-8B 模型使用过程导向 GRPO(std sum)训练的 rollout 数据,在第 75 步时中止 |
评估数据
| 目录路径 | 内容说明 |
|---|---|
eval/standalone_eval |
基于无训练器(Trainer-free)的检查点评估结果,包含逐步指标、逐回合轨迹和汇总数据 |
eval/search_r1_metrics |
Search-R1 模型的逐检查点评估指标和逐样本输出 |
关键特征
- 数据格式:rollout 文件为 JSONL 格式(每个优化器步骤一个文件);评估数据包含指标、轨迹和聚合结果。
- 适用任务:涵盖 Search-R1、ALFWorld、WebShop 等多个任务场景。
- 训练方法:包括结果导向 GRPO、过程导向 GRPO 以及 GiGPO 等多种强化学习训练方法。
- 模型:涉及 Qwen3-8B 和 OLMo-3-7B 两个模型。
- 数据状态:部分训练 run 已被中止(如 WebShop 的两组过程导向 GRPO 数据)。




