遇见数据集

terminal_bench_2_Qwen3_32B_OT_Agent_SFT_10K_axolotl_step250_traces

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条样本包含一系列对话轮次(conversations),每个轮次包含角色(role,如用户或助手)和文本内容(content)。此外,每条样本还记录了所使用的智能体(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务描述(task)、运行集数(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集共有398个训练样本,适用于对话系统训练、智能体行为分析、模型评估等场景。

This dataset contains multi-turn dialogue records. Each sample includes a series of conversation turns, where each turn consists of a role (e.g., user or assistant) and text content. Additionally, each sample records the agent used, model name, model provider, date, task description, episode, run ID, trial name, result, verifier output, and trace source. The dataset has 398 training samples and is suitable for dialogue system training, agent behavior analysis, and model evaluation.

提供机构:
LAION eV
创建时间:
2026-07-31
原始信息汇总

数据集概述

该数据集名为 laion/terminal_bench_2_Qwen3_32B_OT_Agent_SFT_10K_axolotl_step250_traces,托管于 Hugging Face 平台,属于 LAION 组织发布的数据集。它主要用于终端任务场景下的智能体(Agent)行为追踪与评估,特别关注基于 Qwen3-32B 模型的智能体在特定任务中的交互记录。

数据集构成

  • 数据总量:包含 398 个训练样本(train 分割),文件总大小约 31.1 MB(dataset_size: 31117687 字节),下载大小约 9.39 MB(download_size: 9387981 字节)。
  • 数据分割:仅提供 train 分割,无验证或测试集。
  • 数据格式:采用 Parquet 格式存储,数据文件路径为 data/train-*

特征字段(Features)

每个样本包含以下字段,涵盖对话内容、模型信息、任务背景及执行结果:

字段名 类型 描述
conversations list[dict] 对话序列,每个元素包含 content(字符串,对话内容)和 role(字符串,角色标识)。
agent string 智能体名称或标识。
model string 使用的模型名称(如 Qwen3-32B)。
model_provider string 模型提供方。
date string 记录日期。
task string 任务类型或描述。
episode string 回合/轮次标识。
run_id string 运行 ID。
trial_name string 试验名称。
result string 任务执行结果。
verifier_output string 验证器输出。
trace_source string 追踪来源。

用途与应用场景

该数据集适合用于智能体(Agent)在终端(Terminal)环境下的行为数据分析、对话系统训练、任务完成度评估以及模型追踪与调优。其命名中提及 OT_Agent_SFTaxolotl_step250,暗示此数据可能来自基于 Axolotl 工具进行的有监督微调(SFT)过程,且已训练至第 250 步。

搜集汇总
数据集介绍
terminal_bench_2_Qwen3_32B_OT_Agent_SFT_10K_axolotl_step250_traces 数据集图片
构建方式
该数据集源于对Qwen3-32B模型在终端代理任务中的深度优化实践,通过在线轨迹(OT)与Axolotl框架的协同训练,选取了训练步长为250时的代理交互轨迹进行精细化采集。构建过程依托于真实终端环境的多轮人机对话模拟,每条样本均完整记录了对话序列、代理标识、模型类型及提供方、任务描述、运行参数与结果验证信息,由此形成了高保真的终端操作行为语料。
特点
数据集以对话为核心,涵盖多轮交互中的角色与内容,辅以代理、模型、任务等多维元数据,为分析终端代理决策逻辑提供了细粒度依据。其亮点在于引入了验证器输出与轨迹来源,使得数据不仅可用于监督微调,还能支持对智能体行为可解释性与鲁棒性的研究。398条样本虽规模精简,却浓缩了关键场景,兼具科研深度与工程实用性。
使用方法
使用时,研究者可将其加载为标准的对话式训练集,通过JSON格式解析conversations字段以适配各类指令微调流程。凭借丰富的元数据字段,该数据集亦适用于多任务学习、代理策略评估及模型迁移实验。示范代码可利用datasets库直接读取,结合transformers框架进行tokenization与训练,为终端智能体的开发与迭代提供坚实的数据支撑。
背景与挑战
背景概述
在人工智能领域,智能体(Agent)的自主决策与执行能力已成为衡量其智能水平的关键维度。该数据集由Qwen团队于近期构建,旨在通过强化学习与监督微调相结合的方式,优化Qwen3-32B模型在终端(Terminal)环境中的任务执行性能。数据集中包含了完整的对话轨迹、执行结果及验证器输出,为研究智能体在真实操作场景中的行为模式提供了高保真的训练样本。其核心研究问题聚焦于如何利用高质的轨迹数据提升模型的任务分解、工具调用与错误恢复能力,对推动智能体从理论模型向实用化部署具有重要参考价值。
当前挑战
该数据集所应对的领域挑战在于,终端环境中的任务具有高度动态性与多步决策特性,要求模型具备长程规划与上下文记忆能力,而传统监督数据难以覆盖复杂状态空间,导致模型泛化性不足。构建过程中,团队面临了轨迹数据采集的稀疏性、动作序列的噪声标注以及多轮交互中策略漂移等难题;同时,如何平衡数据规模与标注精度,确保每个样本既包含多样化的独立任务场景,又不失任务间的连续性,成为提升模型迁移性能的关键瓶颈。
常用场景
经典使用场景
该数据集收录了Qwen3-32B模型在终端交互任务中的智能体轨迹,每条样本包含多轮对话、任务描述、执行结果及验证器输出等信息。其经典使用场景在于为终端智能体指令微调提供高质量的训练语料,研究者可基于此数据对开源大语言模型进行监督微调,以增强模型理解终端命令、规划操作步骤及执行复杂任务的能力,进而提升模型在真实环境中的自主决策与工具调用水平。
解决学术问题
该数据集直面大语言模型在终端环境中的语义理解与动作生成两大核心挑战,解决了以往缺乏结构化、可复用终端交互数据的问题。它为研究模型的多步推理、错误恢复及环境反馈利用提供了标准化评测基准,推动了智能体从简单对话向复杂任务执行的关键跨越,对探索模型在动态环境中的泛化性与鲁棒性具有重要学术价值。
衍生相关工作
围绕该数据集催生了一系列拓展研究,包括终端智能体轨迹的压缩与高效微调方法、多轮交互中的策略优化算法,以及基于人类反馈的强化学习技术在终端任务上的应用。此外,还衍生出针对不同模型架构的终端指令遵循能力评测基准,以及融合视觉与文本信息的终端状态感知模型,为智能体在复杂计算环境中的安全与可控性研究提供了丰富素材。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务