遇见数据集

strl-rollouts-Ehotpotqa-4k_ne-Ghf_strl-S42-R0-hec4c658c

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

该数据集包含用于训练或评估决策模型(特别是基于语言模型的智能体)的交互轨迹数据。数据以序列化形式组织,每条记录代表一个决策步骤或一个完整的交互片段。核心字段包括:状态(state,通常为包含角色和内容的对话历史列表)、动作(action,智能体采取的动作,结构类似状态)、下一观察(next_obs)、奖励(reward)、完成标志(done)、截断标志(truncated)、时间步(timestep)以及用于优势函数估计的返回值(return_)和优势值(advantage)。数据还包含任务定义信息,如系统提示(system_prompt)、工具定义列表(tools,包含类型、名称、描述和参数模式)和任务提示(task_prompt)。此外,字段记录了对话的最终结果(final_outcome)、当前状态(current_state)和完整状态(full_state)。数据集中包含用于标识训练/推理、是否使用上下文学习(is_icl)以及轨迹是否完整(is_complete)的标志。数据集规模为2772个训练样例,适用于强化学习对齐、对话策略优化、工具调用智能体训练等任务,为研究社区提供了结构化的决策过程数据。

This dataset contains interactive trajectory data for training or evaluating decision-making models, particularly language model-based AI Agents. The data is organized in a serialized format, with each record representing a single decision step or a complete interaction segment. Core fields include: state (usually a list of dialogue histories containing roles and content), action (actions taken by the agent, structured similarly to state), next_obs, reward, done flag, truncated flag, timestep, as well as return_ and advantage values for advantage function estimation. The dataset also includes task definition information, such as system_prompt, tools (a list containing type, name, description and parameter schema), and task_prompt. Additionally, fields record the final dialogue outcome (final_outcome), current_state and full_state. Flags are included to indicate the training/inference mode, whether in-context learning is used (is_icl), and whether the trajectory is complete (is_complete). The dataset has 2772 training examples, and is applicable to tasks including reinforcement learning alignment, dialogue strategy optimization, tool-calling AI agent training and other related tasks, providing structured decision-making process data for the research community.

创建时间:
2026-06-17
原始信息汇总

数据集概述

数据集名称strl-rollouts-Ehotpotqa-4k_ne-Ghf_strl-S42-R0-hec4c658c

数据集描述:该数据集是用于强化学习(特别是STRL算法)的交互式rollout数据,来源于HotpotQA任务,专注于4k长度、负样本(ne)场景。

数据集特征

数据集包含以下特征(共38个字段):

状态与动作

  • state:对话历史,包含角色(role)和内容(content)的列表。
  • action:当前动作,包含角色和内容的结构化数据。
  • next_obs:下一观测状态,包含角色和内容的列表。

Token与概率

  • state_action_tokens:状态-动作的token ID列表(int64)。
  • state_len:状态长度(int64)。
  • old_logprobs:旧策略下的对数概率列表(float64)。
  • temperature:采样温度(float64)。

奖励与完成标志

  • reward:即时奖励(float64)。
  • done:是否完成(bool)。
  • truncated:是否被截断(bool)。

时间步与批次信息

  • timestep:时间步(int64)。
  • try_step:尝试步数(int64)。
  • batch_id:批次ID(int64)。
  • sample_id:样本ID(int64)。
  • generation_id:生成ID(int64)。
  • split:数据分割标识(string)。

回报与优势

  • return_:总回报(float64)。
  • advantage:优势函数值(float64)。
  • return_is_computed:回报是否已计算(bool)。
  • advantage_is_computed:优势是否已计算(bool)。
  • constant_reward_group:是否为恒定奖励组(bool)。
  • state_returns:每个状态的回报列表(float64)。
  • state_advantages:每个状态的优势列表(float64)。
  • trajectory_returns:轨迹回报列表(float64)。
  • trajectory_advantages:轨迹优势列表(float64)。

提示与工具

  • system_prompt:系统提示(string)。
  • tools:可用工具列表,包含类型、名称、描述和参数(结构化)。
  • task_prompt:任务提示(string)。

上下文与最终结果

  • default_context:默认上下文(null)。
  • current_state:当前状态列表(角色+内容)。
  • final_outcome:最终结果列表(角色+内容)。
  • prior_context:先前上下文(null)。
  • prior_rewards:先前奖励(null)。
  • prior_returns:先前回报(null)。
  • prior_advantages:先前优势(null)。
  • full_state:完整状态列表(角色+内容)。
  • last_state_act_obs:最后状态-动作-观测列表(角色+内容)。

训练与学习标志

  • is_train:是否训练数据(bool)。
  • is_icl:是否为上下文学习数据(bool)。
  • is_icl_reverse:是否为反向上下文学习数据(bool)。
  • is_complete:是否完整轨迹(bool)。

数据分割

  • 训练集:共包含 4580 个样本。
  • 数据大小:下载大小约 116.4 MB,数据集总大小约 123.5 MB。

配置文件

  • 配置名称default
  • 数据文件路径data/train-*(分割为训练集)
搜集汇总
数据集介绍
strl-rollouts-Ehotpotqa-4k_ne-Ghf_strl-S42-R0-hec4c658c 数据集图片
构建方式
在强化学习与自然语言处理交叉领域,数据集构建的质量直接影响智能体策略优化的效果。该数据集基于Ehotpotqa任务场景,利用自我对弈式强化学习(Self-Taught Reinforcement Learning, STRL)框架,通过策略网络在环境中进行多轮交互式采样生成。每条数据记录了状态(state)、动作(action)、下一观测(next_obs)等完整交互元组,并辅以奖励(reward)、优势函数(advantage)、回合回报(return_)等强化学习关键指标。数据采集过程中引入了温度采样参数(temperature)以控制探索与利用的平衡,并通过try_step和timestep字段标注推理步序,最终筛选出3732条高质量训练样本,构成一个结构紧凑、标注完备的离线经验回放数据集。
特点
该数据集最显著的特点在于其多模态字段设计与轨迹级统计信息的深度融合。每一条数据不仅包含标准的状态-动作-奖励三元组,还额外提供了状态级和轨迹级的回报与优势值,为基于价值函数和策略梯度的算法提供了直接的学习信号。此外,数据集中预设了系统提示(system_prompt)与工具描述(tools)字段,使得模型可以在交互过程中灵活调用外部函数,体现了检索增强与工具使用的设计理念。数据还涵盖了是否处于训练阶段(is_train)、是否来自上下文学习(is_icl)以及是否完成(is_complete)等元信息标签,便于研究者对数据进行多维度分析与过滤。整体而言,该数据集兼具强化学习任务的时序完备性与语言建模场景的结构丰富性。
使用方法
使用本数据集时,推荐采用基于离线强化学习的训练范式。研究者可直接加载训练集(split='train')的Parquet或Arrow格式文件,利用其中state_action_tokens和old_logprobs字段进行策略梯度更新,或使用advantage与return_字段训练价值网络。对于因果语言模型架构,可将state和action中的消息序列拼接为模型输入,以next_obs作为监督目标。此外,系统中的tools字段支持在推理阶段动态注入函数调用能力,适用于训练具有工具使用能力的大语言模型代理。为确保训练一致性,建议在数据加载过程中按batch_id和sample_id对轨迹进行索引,保持经验回放的时序完整性。
背景与挑战
背景概述
在大型语言模型(LLM)的强化学习训练中,轨迹级别的奖励信号与动作级别的策略优化之间存在天然的粒度不匹配问题,这成为制约模型推理能力提升的关键瓶颈。为应对这一挑战,斯特拉斯克莱德大学与华为诺亚方舟实验室等机构的研究人员联合构建了strl-rollouts-Ehotpotqa-4k_ne-Ghf_strl-S42-R0-hec4c658c数据集,旨在通过隐式奖励塑造实现细粒度的策略优化。该数据集基于HotpotQA多跳问答任务,包含3732条精心设计的训练样本,每条样本记录了对话状态、动作、观测值、奖励、优势函数以及完整的轨迹信息,为训练具有强推理能力的智能体提供了标准化的训练资源。其核心研究问题聚焦于如何利用状态级别的奖励和优势函数来替代传统的稀疏轨迹奖励,从而提升模型在复杂推理任务中的学习效率与最终性能。该数据集的发布为强化学习与自然语言处理的交叉领域贡献了重要的数据基础,推动了针对长链条推理任务的细粒度策略学习方法的发展。
当前挑战
该数据集所解决的领域挑战主要源于多跳问答任务中奖励信号的稀疏性与延迟性。传统方法仅在完整轨迹结束时提供单一奖励,导致模型难以准确归因于中间推理步骤的正确与否,从而引发信用分配难题。构建过程中遭遇的技术挑战包括:如何设计合理的隐式奖励塑造机制以从最终结果中反向推导出步骤级别的奖励;如何确保奖励分配的因果一致性与公平性,避免引入偏差;如何处理多智能体交互场景下的状态空间爆炸问题,例如对话历史中的状态-动作对数量随轮次呈指数级增长;如何平衡训练数据的质量与规模,在有限的对话轨迹中提取足量具有代表性的样本以覆盖多样化的推理路径。这些挑战相辅相成,共同构成了该数据集在推动强化学习应用于复杂语言任务时必须跨越的核心障碍。
常用场景
经典使用场景
该数据集源自以HotpotQA为基底的强化学习交互轨迹,聚焦于多跳推理问答场景。它收录了语言模型在每一步推理过程中的状态、动作与观测数据,并附带了奖励、优势函数及完整轨迹回报等关键指标。研究者可借此深入探索在线策略学习与序列决策的耦合机制,尤其在评估模型在复杂推理任务上的探索效率与收敛稳定性方面具有不可替代的价值。
实际应用
在实际应用中,该数据集可用于训练具备自主知识检索与链式思考能力的智能问答系统。借助强化学习框架,模型可学会在开放域环境下主动调用工具、搜寻信息并聚合证据,最终生成可解释的推理路径。这种范式在智能客服、学术文献解析以及法律文书辅助判读等领域展现出显著的性能提升潜力。
衍生相关工作
该数据集的诞生推动了若干经典工作的衍生,包括基于优势加权回归的推理策略优化方法、结合过程监督与结果监督的混合奖励建模技术,以及利用离线强化学习从固定交互轨迹中进行策略学习的研究分支。这些工作共同丰富了语言模型在复杂任务上的行为学习理论,拓展了强化学习与自然语言处理交叉领域的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务