遇见数据集

dev_set_v2_a3_rl_laion_nemotron_gym_agent_workplace_v2_5_8B_20260825_155003

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集包含3530个多轮对话样本,每个样本由conversations字段记录对话历史(包括角色和内容),并附加元数据:agent(代理)、model(模型)、model_provider(模型提供方)、date(日期)、task(任务)、episode(回合)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和trace_source(追踪来源)。数据集仅包含训练集,大小约262MB。适用于对话系统评估、模型行为追踪、多轮对话生成或验证任务。

This dataset contains 3530 multi-turn dialogue samples. Each sample records the conversation history in the conversations field (including roles and content), along with metadata: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset only includes a training set, approximately 262MB in size. It is suitable for dialogue system evaluation, model behavior tracking, multi-turn dialogue generation, or verification tasks.

提供机构:
LAION eV
创建时间:
2026-08-27
原始信息汇总

数据集概述

该数据集名为 laion/dev_set_v2_a3_rl_laion_nemotron_gym_agent_workplace_v2_5_8B_20260825_155003,由 LAION 组织发布,是一个用于训练和评估智能体(Agent)在模拟工作场所环境中执行任务的数据集。数据集由 NVIDIA Nemotron 8B 模型通过强化学习(RL)生成,并使用 Gym 环境进行模拟。

数据规模

  • 数据集总大小:262,263,383 字节(约 250 MB)
  • 下载大小:229,130,626 字节(约 218.5 MB)
  • 训练集样本数:3,530 条
  • 数据划分:仅包含 train 训练集,无独立验证或测试集

数据特征

每条数据包含以下字段:

字段名 类型 说明
conversations 列表(多轮对话) role(角色)和 content(内容)组成的对话记录
agent 字符串 执行任务的智能体名称
model 字符串 生成数据的模型名称
model_provider 字符串 模型提供方
date 字符串 数据生成日期
task 字符串 任务描述或任务标识
episode 字符串 强化学习中的回合(episode)标识
run_id 字符串 运行 ID
trial_name 字符串 试验名称
result 字符串 任务执行结果
verifier_output 字符串 验证器(verifier)的输出
trace_source 字符串 数据来源或轨迹来源

数据格式

  • 配置名称default
  • 数据文件路径data/train-*(支持通配符匹配多个分片文件)
  • 数据格式:每条数据是一个 JSON 对象,包含上述所有字段

用途

该数据集适用于:

  • 训练智能体在模拟工作场所环境中执行复杂任务的能力
  • 评估基于强化学习的智能体决策和对话能力
  • 研究多轮对话与任务执行的结合场景
搜集汇总
数据集介绍
dev_set_v2_a3_rl_laion_nemotron_gym_agent_workplace_v2_5_8B_20260825_155003 数据集图片
构建方式
在智能体(Agent)强化学习研究领域,高质量交互轨迹数据的匮乏长期制约着策略优化与评估的可靠性。该数据集通过整合LAION与Nemotron Gym的智能体工作场景(Agent Workplace)环境,采集模型在真实任务中执行动作、观察反馈、生成响应的完整对话序列。每条轨迹由模型标识、任务描述、回合编号、运行ID、试验名称、验证结果与验证器输出等元数据共同标注,形成结构化的episode级记录,最终以对话(conversations)形式封装为监督或强化学习可用的样本。
特点
数据集以多轮对话为核心载体,涵盖角色与内容的结构化信息,并附有agent、model、model_provider、date、task、episode、run_id、trial_name、result、verifier_output、trace_source等丰富字段,具备良好的可追溯性与可分析性。其规模为3530条训练样本,覆盖多样化的智能体工作情境,既支持行为克隆与轨迹建模,也可用于奖励信号提取与策略评估,为智能体强化学习研究提供了兼具细粒度标注与任务多样性的数据基础。
使用方法
使用时可借助Hugging Face datasets库直接加载train划分,通过conversations字段获取多轮交互文本,并结合task、agent、model等元数据实现按任务或模型维度的筛选与分组。研究者可将对话序列作为策略网络的输入,以result与verifier_output作为奖励或评估依据,开展离线强化学习、行为克隆或奖励建模实验;亦可利用run_id与episode追踪同一试验内的多回合关联,支撑轨迹级分析与对比研究。
背景与挑战
背景概述
面向智能体工作场景的评测与训练数据构建,是当前大模型从对话能力迈向自主决策与工具使用能力的关键环节。该数据集由相关研究团队于2026年发布,聚焦于真实办公环境中的智能体任务轨迹收集与结果验证,涵盖对话历史、模型身份、任务类型、执行回合及验证器输出等多维信息,共计三千五百余条训练样本。其核心研究问题在于如何系统性地刻画智能体在多步骤、多工具协同场景下的行为模式与成败归因,为强化学习与行为克隆提供可复用的结构化监督信号。该数据集对智能体评测基准的完善与办公自动化方向的模型迭代具有推动作用。
当前挑战
该数据集所应对的领域问题,在于智能体工作场景缺乏兼顾过程轨迹与结果验证的高质量标注资源:现有语料多偏重单轮问答或简单工具调用,难以覆盖跨应用、长程依赖与隐式约束并存的复杂办公流程。构建过程中的挑战集中于三方面:其一,任务设计需在真实性与可控性之间取得平衡,既要还原多角色协作与权限边界,又须避免引入不可复现的环境噪声;其二,执行轨迹的采集与验证依赖多模型、多回合的稳定运行,模型差异与环境波动均可能造成结果偏差;其三,验证器输出与最终成败之间的一致性判定存在模糊地带,如何界定部分完成与完全失败仍需更为细致的评估标准。
常用场景
经典使用场景
在智能体强化学习与多轮对话建模领域,该数据集承载了基于LAION与Nemotron生态构建的智能体训练轨迹记录。其经典用法在于将conversations字段中的多角色对话序列作为状态—动作—奖励的完整回放单元,配合agent、model、model_provider等元数据标签,对智能体在办公协作场景中的决策路径进行细粒度建模。研究者常将其用于离线强化学习的策略优化,借助result与verifier_output所提供的验证信号,训练智能体在复杂任务分解与工具调用中形成稳定的行为策略。
衍生相关工作
围绕该数据集,后续工作主要沿着智能体强化学习框架与验证器设计两条脉络展开。一方面,研究者基于其多轮对话结构提出了多种离线策略评估方法,用于比较不同智能体在相同环境中的样本效率;另一方面,verifier_output的引入催生了一系列针对对话过程进行自动评分与错误定位的验证模型,这些模型随后被迁移至更广泛的智能体基准测试中。由此衍生的经典工作包括面向职场任务的智能体评测套件以及基于轨迹回放的过程奖励建模方法,为后续大规模智能体训练奠定了基础。
数据集最近研究
最新研究方向
在大语言模型智能体强化学习的前沿探索中,该数据集依托LAION与Nemotron Gym的协同框架,聚焦真实职场任务中多轮对话智能体的行为轨迹与结果验证。通过整合agent、model_provider、verifier_output等细粒度元数据,其最新研究方向转向以可验证奖励信号驱动的智能体自我改进与跨模型泛化能力评估,尤其关注在动态工作场景下任务分解、工具调用与错误恢复的联合优化。这一工作为构建可复现、可审计的智能体训练基准提供了关键数据支撑,对推动自主智能体从实验室环境走向高可靠性职业应用具有显著的里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务