遇见数据集

terminal_bench_2_a3_rl_laion_nemotron_gym_knowledge_web_search_mcqa_25_8B_20260828_183224

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集记录了AI agent与用户的多轮对话交互,包含3478个训练样本,总大小约299MB。每个样本包含完整的对话历史(conversations),其中每条消息标注了角色(role)和内容(content)。此外,每个样本还提供了agent标识、使用的模型名称(model)、模型提供商(model_provider)、对话日期(date)、任务描述(task)、episode编号、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)等元数据。该数据集适用于训练或评估多轮对话agent、分析模型行为、追踪agent决策过程以及验证对话系统输出质量等场景。

This dataset records multi-turn dialogue interactions between AI agents and users, containing 3,478 training samples with a total size of approximately 299 MB. Each sample includes complete conversation history (conversations), where each message is annotated with role and content. Additionally, each sample provides metadata such as agent identifier, model name used (model), model provider (model_provider), conversation date (date), task description (task), episode number, run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). This dataset is suitable for training or evaluating multi-turn dialogue agents, analyzing model behavior, tracking agent decision-making processes, and verifying the output quality of dialogue systems.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集概述

  • 数据集名称laion/terminal_bench_2_a3_rl_laion_nemotron_gym_knowledge_web_search_mcqa_25_8B_20260828_183224
  • 数据集地址:https://huggingface.co/datasets/laion/terminal_bench_2_a3_rl_laion_nemotron_gym_knowledge_web_search_mcqa_25_8B_20260828_183224
  • 数据集用途:该数据集包含终端环境下的强化学习交互数据,可能用于训练和评估具备工具使用、知识检索、网络搜索及多选问答能力的AI智能体模型。

数据特征

数据集包含以下字段:

字段名 类型 说明
conversations 列表 对话记录,每个元素包含 role(角色,字符串)和 content(内容,字符串)
agent 字符串 智能体标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务类型
episode 字符串 回合编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 结果信息
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据划分与规模

  • 数据划分:仅包含 train 分割
  • 训练集样本数:3,478 条
  • 数据集总大小:299,274,911 字节(约 299 MB)
  • 下载大小:217,538,963 字节(约 217 MB)

配置文件

  • 配置名称default
  • 数据文件路径data/train-*(对应 train 分割)

适用场景

该数据集适用于强化学习、智能体训练、终端交互任务、工具调用、知识问答、网络搜索及多选推理等场景的研究与模型微调。

搜集汇总
数据集介绍
terminal_bench_2_a3_rl_laion_nemotron_gym_knowledge_web_search_mcqa_25_8B_20260828_183224 数据集图片
构建方式
该数据集源自强化学习(RL)训练过程中的轨迹数据,具体为针对8B参数规模模型在Gym环境下的交互记录。数据构建融合了Laion、Nemotron及网络搜索知识,并整合了多任务(如MCQA)的问答场景,以对话形式存储,包含角色与内容字段。每条样本附带agent、model、model_provider、date、task、episode、run_id、trial_name等元数据,以及结果(result)、验证器输出(verifier_output)和追踪来源(trace_source),形成了结构化的训练语料。train分割包含3478条样本,总量约286MB。
特点
数据集的核心特点在于其多源知识融合与强化学习轨迹的完整性。对话形式支持多轮交互,元数据丰富,可追溯每次运行的详细配置与结果,便于分析模型行为与决策过程。既包含prompt与响应,也涵盖验证器评估,适用于监督微调、偏好对齐及离线RL等场景。数据规模适中,但针对8B模型,具有较高的领域针对性,尤其在Gym环境与网络搜索结合的任务中体现其独特价值。
使用方法
使用时,可直接加载train分割,将'conversations'列作为对话数据用于模型训练。针对监督微调,可将多轮对话拼接为输入输出对;对于偏好优化,可利用'result'和'verifier_output'字段区分正负样本。元数据字段可用于数据过滤或任务特定训练,例如按'task'列筛选对应子集。数据格式符合HuggingFace标准,可通过datasets库便捷读取,亦支持与RL框架集成,用于策略评估或进一步探索。
背景与挑战
背景概述
该数据集由NVIDIA Research等机构于2026年创建,旨在探索大语言模型(LLM)在终端环境中的强化学习(RL)能力。它融合了Laion、Nemotron、Gym、知识问答、网络搜索、多选问答等多种数据源,形成多轮交互的智能体训练语料。每个样本包含完整的对话历史、执行轨迹、任务描述及验证结果,支持基于环境反馈的迭代优化。其核心研究问题在于如何利用强化学习提升模型在真实终端任务上的决策与工具调用能力。该数据集为评估LLM在复杂交互场景下的自适应行为提供了基准,对智能体研究具有重要推动作用。
当前挑战
该数据集在构建与应用中面临多重挑战。领域层面,终端交互任务需模型具备上下文理解、工具调用和误差修正能力,相较于静态问答,其泛化难度显著提升,且现有模型常陷入错误循环。构建层面,多源数据融合需处理格式不一致、标注噪声及场景偏差,同时模拟环境与真实终端的差距可能导致策略迁移失效。此外,数据集规模有限(3478条),稀疏奖励信号强化学习易产生过拟合,验证器输出需精心设计以避免奖励欺骗。这些挑战要求后续工作在数据多样性、环境保真度和算法鲁棒性上持续优化。
常用场景
经典使用场景
该数据集为强化学习环境下的终端交互任务提供了丰富的训练语料,尤其适用于基于对话轨迹的智能体行为建模。其核心场景涵盖知识检索、网络搜索及多项选择题解答等复杂任务,每条样本记录了完整的多轮人机对话、智能体执行步骤及最终结果,为研究终端命令执行与语言模型协同决策提供了高质量的基准数据。研究者可借此探索利用对话历史优化智能体策略,或构建针对终端环境的模仿学习与离线强化学习训练框架。
实际应用
在实际应用中,该数据集可直接服务于自动化运维、智能客服及教育辅导等场景。例如,训练出的智能体能够辅助工程师执行服务器配置、日志分析等终端操作,或作为虚拟助手在知识密集领域提供精准的检索与问答。通过模拟网络搜索与多轮交互,模型可增强信息整合能力,提升在真实业务中处理开放式问题的效率。此外,该数据集亦支持开发可审计的AI代理系统,实现逐步操作追踪与结果校验,其应用前景覆盖从企业级自动化到个人数字助手的广泛领域。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作。其一,利用其对话轨迹进行离线强化学习基准测试,对比不同算法(如DQN、PPO)在终端任务上的表现,促进稳定且高效的决策策略设计。其二,将其用于指令微调,增强语言模型遵循复杂指令与工具调用的能力,催生了多个面向Agent的指令遵循数据集。其三,以该数据为蓝本,发展出模拟终端环境的交互式评测平台,用于评估智能体的鲁棒性和终身学习能力。此外,其数据格式和任务设计启发了多模态融合的终端智能体研究,推动了通用人工智能在真实操作界面上的应用探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务