遇见数据集

PRM-agent-rl-artifacts

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集包含了多个强化学习智能体训练过程中的rollouts(轨迹)和评估输出。具体包括:基于Search-R1 / Qwen3-8B模型使用outcome-GRPO和Process-GRPO(per-turn-norm)方法的训练rollouts;基于ALFWorld和WebShop任务,使用Qwen3-8B和OLMo3-7B模型在不同强化学习算法(GiGPO、outcome-GRPO、Process-GRPO)下的训练rollouts;以及评估子目录,包含无训练器的检查点评估结果,如逐步骤指标、逐回合轨迹和聚合数据。每个rollout文件对应一个优化步骤,每行是一条采样轨迹,包含解码后的提示、响应和奖励。数据可用于强化学习训练过程分析、算法比较、奖励分析等。

This dataset contains rollouts (trajectories) and evaluation outputs from the training process of multiple reinforcement learning agents. Specifically, it includes: training rollouts based on the Search-R1 / Qwen3-8B model using outcome-GRPO and Process-GRPO (per-turn-norm) methods; training rollouts based on ALFWorld and WebShop tasks using Qwen3-8B and OLMo3-7B models under different reinforcement learning algorithms (GiGPO, outcome-GRPO, Process-GRPO); and evaluation subdirectories containing checkpoint evaluation results without a trainer, such as step-by-step metrics, per-episode trajectories, and aggregated data. Each rollout file corresponds to an optimization step, with each line representing a sampled trajectory containing the decoded prompt, response, and reward. The data can be used for reinforcement learning training process analysis, algorithm comparison, reward analysis, etc.

创建时间:
2026-07-30
原始信息汇总

数据集总结

该数据集名为 PRM-agent-rl-artifacts,是一个用于存储强化学习智能体训练和评估产出的数据集,许可证为 Apache-2.0。数据集中包含多个 GRPO(Group Relative Policy Optimization)智能体运行过程中的训练 rollout 数据与评估输出。每个 rollout 文件对应一个优化器步骤,文件中的每一行代表一条采样的轨迹,包含解码后的提示(prompt)、响应(response)和奖励(reward)。

训练 Rollout 数据

目录路径 内容说明
rollouts/search_r1_qwen3_8b_4gpu Search-R1 / Qwen3-8B 模型使用结果导向 GRPO(outcome-GRPO)训练的 rollout 数据
rollouts/search_r1_qwen3_8b_perturnnorm Search-R1 / Qwen3-8B 模型使用过程导向 GRPO(per-turn-norm)训练的 rollout 数据
rollouts/alfworld_qwen3_8b_gigpo ALFWorld / Qwen3-8B 模型使用 GiGPO 训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件
rollouts/webshop_qwen3_8b_gigpo WebShop / Qwen3-8B 模型使用 GiGPO 训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件
rollouts/webshop_olmo3_7b_gigpo WebShop / OLMo-3-7B 模型使用 GiGPO 训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件
rollouts/webshop_olmo3_7b_outcome_2048 WebShop / OLMo-3-7B 模型使用结果导向 GRPO(上限为 2048)训练的 rollout 数据,每个优化器步骤对应一个 JSONL 文件
rollouts/webshop_qwen3_8b_process_center_mean_std WebShop / Qwen3-8B 模型使用过程导向 GRPO(center mean_std)训练的 rollout 数据,在第 124 步时中止
rollouts/webshop_qwen3_8b_process_std_sum WebShop / Qwen3-8B 模型使用过程导向 GRPO(std sum)训练的 rollout 数据,在第 75 步时中止

评估数据

目录路径 内容说明
eval/standalone_eval 基于无训练器(Trainer-free)的检查点评估结果,包含逐步指标、逐回合轨迹和汇总数据
eval/search_r1_metrics Search-R1 模型的逐检查点评估指标和逐样本输出

关键特征

  • 数据格式:rollout 文件为 JSONL 格式(每个优化器步骤一个文件);评估数据包含指标、轨迹和聚合结果。
  • 适用任务:涵盖 Search-R1、ALFWorld、WebShop 等多个任务场景。
  • 训练方法:包括结果导向 GRPO、过程导向 GRPO 以及 GiGPO 等多种强化学习训练方法。
  • 模型:涉及 Qwen3-8B 和 OLMo-3-7B 两个模型。
  • 数据状态:部分训练 run 已被中止(如 WebShop 的两组过程导向 GRPO 数据)。
搜集汇总
数据集介绍
PRM-agent-rl-artifacts 数据集图片
构建方式
本数据集源自一项针对强化学习智能体训练过程的系统性记录,涵盖了多种先进算法与基础模型在多样化环境中的交互轨迹。其构建方式严谨而细致,将每次优化步骤中采样得到的完整轨迹逐行存储于独立的JSONL文件内,每行均包含解码后的提示词、智能体响应及对应的奖励信号。数据收集涵盖了Search-R1、ALFWorld与WebShop等代表性场景,以及Qwen3-8B、OLMo-3-7B等主流模型,并特别区分了结果型GRPO、过程型GRPO(含多种变体)及GiGPO等不同训练范式,为后续分析提供了高保真、多维度的原始数据支撑。
特点
该数据集的核心特点在于其横向覆盖与纵向深度的有机结合。横向层面,它同时囊括了多种主流强化学习算法(包括结果型与过程型GRPO、GiGPO)以及不同规格的基础模型,使研究者能够跨越算法与模型的双重维度进行比较分析。纵向层面,每一个训练运行都提供了逐优化步骤的完整轨迹,详尽记录了从初始探索到策略收敛的演化脉络。此外,数据集不仅包含训练阶段的rollout数据,还整合了独立的评估结果,诸如逐步指标、每幕轨迹及聚合统计,为复现实验、诊断训练动态及深入剖析不同奖励建模策略的效能提供了珍贵的一手资料。
使用方法
使用本数据集时,研究者应首先依据研究目标选择合适的子目录。针对算法对比研究,可选取不同算法在相同环境下的rollout文件,比较其轨迹结构与奖励分布;针对模型泛化能力分析,则可在同一任务下横跨不同模型的数据。每个JSONL文件内的轨迹数据可直接用于解析,以提取提示、响应及奖励序列。对于训练动态分析,可通过跨步骤的文件追踪特定指标的变化趋势。此外,评估文件夹中的结构化指标与轨迹可用于量化模型表现,支撑结论。数据集格式标准,便于通过编程手段加载与处理,能够无缝集成至现有的分析流程或作为强化学习研究的基准测试集。
背景与挑战
背景概述
该数据集诞生于强化学习与智能体系统交叉融合的前沿探索时期,由致力于过程监督与奖励建模的研究团队构建,旨在为GRPO系列算法的训练与评估提供透明的轨迹级数据支撑。核心研究问题聚焦于如何通过细粒度的过程监督信号(如per-turn归一化、中心均值标准差等)提升智能体在复杂交互环境中的决策效能。数据集涵盖了Search-R1、ALFWorld、WebShop等多个基准场景下的训练回放与评估输出,为对比不同奖励机制(outcome-GRPO与process-GRPO)提供了统一的数据基础。其发布对强化学习社区产生了积极影响,促进了可复现训练流程与奖励设计策略的实证研究,成为探索过程监督信号价值的重要参考。
当前挑战
构建该数据集所面临的挑战多维且深刻。于领域层面,如何精准量化过程监督对智能体长期收益的增益,是强化学习长期悬而未决的难题,尤其在环境反馈稀疏或延迟时,过程奖励的自动标注与有效性验证尤为棘手;于构建层面,训练回放的采集需在异构计算资源上保持策略分布的一致性与数据的完整性,而部分实验(如process_center_mean_std与process_std_sum)因训练崩溃而中断,催生了废弃数据的管理与归档挑战;此外,海量轨迹数据的存储、索引与版本控制,以及跨实验间的公平对比设计,亦对数据工程提出了严苛要求。
常用场景
经典使用场景
该数据集作为强化学习智能体训练轨迹的宝库,在智能体对齐与决策优化领域占据核心地位。其内容涵盖多种前沿算法(如Search-R1、GiGPO)与多任务环境(如ALFWorld、WebShop)的完整训练回放,为研究者提供了可直接复用的训练样本与评估输出,是复现实验、对比算法性能以及深入剖析智能体行为演化的关键资源。
衍生相关工作
该数据集衍生了诸多相关研究,包括对过程奖励模型(Process Reward Model)在智能体任务中效用的深入分析,以及基于真实轨迹的离线强化学习算法(如离线策略评估、模仿学习)的改进工作。此外,其提供的多算法对比数据激发了关于奖励归一化、序列决策稳定性等理论的探讨,并催生了新一代高效训练框架(如基于轨迹重加权的方法),为智能体学习社区的创新提供了沃土。
数据集最近研究
最新研究方向
该数据集聚焦于强化学习驱动的智能体训练,通过提供多种算法(如GRPO、GiGPO)在ALFWorld、WebShop及Search-R1等典型环境中的完整训练轨迹与评估输出,为研究过程级奖励建模、奖励归一化策略及路径泛化能力提供了宝贵资源。当前前沿方向集中于利用过程监督信号细化智能体试错学习,探索per-turn归一化与中心化标准差等变体对训练稳定性的影响,并结合开源模型(Qwen3、OLMo-3)推动可复现的智能体策略优化研究,其对多步决策任务的奖励塑形与样本效率提升具有关键意义,亦助力构建更鲁棒的自主智能体系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务