遇见数据集

dev_set_v2_a3_rl_laion_nemotron_gym_identity_following_v2_65_8B_20260825_162529

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集由多个字段组成,包括对话记录(conversations,包含角色和内容)、智能体名称(agent)、模型名称(model)、模型提供方(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。训练集包含4621个样本,总数据集大小约为335MB。

This dataset consists of multiple fields, including conversations (with roles and content), agent name, model name, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The training set contains 4621 samples, and the total dataset size is approximately 335MB.

提供机构:
LAION eV
创建时间:
2026-08-27
原始信息汇总

数据集概述

该数据集名为 laion/dev_set_v2_a3_rl_laion_nemotron_gym_identity_following_v2_65_8B_20260825_162529,由 LAION 发布,可用于训练和评估 RL(强化学习)相关模型,尤其是针对大语言模型(LLM)的 RL 训练流程设计。

数据规模与划分

  • 总数据集大小:335,620,695 字节(约 320 MB),下载大小为 304,736,089 字节。
  • 数据划分:仅包含一个训练集(train),包含 4,621 条样本,数据格式为 JSON 或类似结构化文件(数据文件路径为 data/train-*)。

数据特征字段

每条样本包含以下字段:

字段名 类型 说明
conversations 列表 对话内容,每条对话包含 role(角色)和 content(内容)两个字符串字段
agent 字符串 智能体标识
model 字符串 模型名称
model_provider 字符串 模型提供商
date 字符串 日期
task 字符串 任务类型
episode 字符串 回合编号
run_id 字符串 运行 ID
trial_name 字符串 试验名称
result 字符串 结果信息
verifier_output 字符串 验证器输出
trace_source 字符串 跟踪来源

数据用途

该数据集主要用于强化学习(RL)场景下的模型训练,特别适合用于身份遵循(identity following)任务的训练与验证。数据集包含完整的对话、任务描述、结果及验证器输出,适合用于评估模型在复杂交互环境中的表现。

配置信息

  • 默认配置名default
  • 数据文件格式:支持分片读取(使用 train-* 通配符模式),可高效加载大型数据集。

应用建议

  • 可用于需要大规模对话数据的 RL 训练流程。
  • 适合用于模型身份一致性、指令遵循能力等任务的评测。
  • 由于包含 verifier_outputresult 字段,也可用于训练奖励模型或验证器。
搜集汇总
数据集介绍
dev_set_v2_a3_rl_laion_nemotron_gym_identity_following_v2_65_8B_20260825_162529 数据集图片
构建方式
该数据集名为 dev_set_v2_a3_rl_laion_nemotron_gym_identity_following_v2_65_8B_20260825_162529,其构建源于对大规模语言模型在身份遵循任务上的强化学习训练过程进行系统性采集与整合。数据集的每一个样本均涵盖了多轮对话记录(conversations),并附带agent、model、model_provider、date、task、episode、run_id、trial_name等关键元数据,揭示了数据采集的环境变量与实验配置。此外,每个样本均包含result、verifier_output及trace_source字段,它们分别表征了模型输出、验证器判定及溯源信息,从而构建了一个完整、可追溯的训练数据闭环。整个数据集以train划分形式提供,包含4621个样本,总计约335MB,保证了数据的规模性与多样性。
使用方法
使用该数据集时,研究者可直接加载train split中的JSON格式文件,每个样本包含结构化对话及元数据。该数据集适用于微调对话模型,尤其是强化学习阶段的初始策略训练或评估。研究者可利用conversations字段进行有监督微调(SFT),结合result与verifier_output构造偏好对,进而进行基于人类反馈的强化学习(RLHF)。此外,通过筛选task、episode或run_id,可针对特定实验条件进行子集分析,以探究模型在身份遵循任务上的泛化能力。由于数据规模适中,亦可用于快速迭代验证新算法的有效性。
背景与挑战
背景概述
该数据集由NVIDIA于2025年8月创建,名为'dev_set_v2_a3_rl_laion_nemotron_gym_identity_following_v2_65_8B',旨在通过强化学习(RL)训练大语言模型(LLM)遵循身份指令的能力。其核心研究问题是如何利用高质规模化的合成数据,增强模型在多轮对话中保持角色一致性和身份保持的性能。该数据集基于LAION和Nemotron架构,通过与'Gym'环境交互生成轨迹,每个样本包含多轮对话、智能体信息、模型输出、验证器结果及来源追踪,为RL微调提供了细粒度的过程监督。其影响力在于推动了大语言模型在个性化对话和人格化交互方面的进步,并为构建可复现的RL训练流程提供了标准化的数据格式。
当前挑战
该数据集面临的挑战包括:领域问题层面,大语言模型在长对话中易出现身份漂移,难以稳定保持预定义的角色特征,且现有监督微调方法无法有效发挥强化学习的优势,需要兼具规模、多样性和过程监督的RL数据。构建过程层面,数据生成需协调多版本(v2、a3、8B)模型、RL策略和验证器,从LAION语料中筛选并合成高保真身份遵循轨迹,同时保证每个样本的时间戳、运行ID和来源可溯源性;此外,数据集仅包含4,621个训练样本,且单次运行(run_id)和trial(trial_name)版本控制,增加其复现和扩展的复杂性。
常用场景
经典使用场景
该数据集作为大型语言模型对齐微调与强化学习训练的回放数据,其核心应用场景聚焦于指令跟随能力的优化。通过结构化的多轮对话记录、代理标识、模型输出及验证器反馈,研究者可再现模型在特定任务中的决策轨迹,用于训练策略梯度或直接偏好优化。在身份保持与指令遵循的联合约束下,该数据为提升模型对用户意图的精准响应提供了高质量的监督信号,亦可用于评测模型在多轮交互中的一致性表现。
解决学术问题
该数据集针对当前大语言模型在长程指令跟随中存在的语义漂移与身份一致性缺失问题,提供了包含验证器输出的细粒度对齐样本。依托4621条真实交互轨迹,研究者能够量化模型在复杂任务中的鲁棒性,并探索基于奖励信号的离线强化学习优化路径。其引入的trace_source字段支持追溯模型推理过程,为解释性研究和错误模式分析奠定了数据基础,有力推动了人机协同场景下指令理解的理论深化。
实际应用
在实际应用层面,该数据集可服务于智能客服、教育辅导及自主代理系统的迭代开发。结合agent与model_provider维度的元数据,开发团队能够构建面向特定领域(如金融、医疗)的定制化对话代理,通过强化学习微调提升其在真实环境中的任务完成率。此外,数据集中episode与run_id的关联设计使得跨轮次状态追踪成为可能,为多阶段决策系统的在线适配提供仿真环境,加速了从实验室模型到商业部署的转化。
数据集最近研究
最新研究方向
该数据集聚焦于强化学习与身份遵循任务在大型语言模型中的协同训练,结合了来自LAION的多样化图像文本数据与NVIDIA Nemotron架构,以提升模型在复杂对话中的身份保持一致性与指令遵循能力。其命名中隐含的‘gym’环境暗示了其用于交互式强化学习场景,而‘identity_following’则指向当前研究热点——如何使AI在长程对话中维持稳定的角色设定与个性化响应。该数据集通过记录详细的agent、model及验证器输出,为评估模型对齐性提供了多维度的追踪数据,从而支撑了关于模型行为可解释性和鲁棒性的前沿探索。其大规模样本数(4621条)与丰富的元数据(如episode、trial_name)为研究多轮交互中的策略优化与奖励建模提供了宝贵资源,对于推动更安全、更可控的对话系统发展具有重要的实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务