遇见数据集

Nemotron_Terminal_Synthetic_Tasks-GLM5.3-multiharness

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集是 Nemotron Terminal Synthetic Tasks 的代理轨迹集合,轨迹由 GLM-5.3 模型在多个 harness 上收集而来,原始数据源自 nvidia/Nemotron-Terminal-Synthetic-Tasks。数据集包含两个子集:no_hermes 子集汇聚了来自 claude-code、cline、codex、opencode 和 pi 代理的轨迹;hermes 子集则包含来自 hermes 代理的轨迹。数据以 Parquet 格式存储,每条记录代表一次代理执行轨迹。该数据集可用于研究终端合成任务中不同代理的行为模式、性能比较以及多任务学习等场景。

This dataset is a collection of agent trajectories from Nemotron Terminal Synthetic Tasks, collected by the GLM-5.3 model on multiple harnesses, with the original data sourced from nvidia/Nemotron-Terminal-Synthetic-Tasks. The dataset contains two subsets: the no_hermes subset aggregates trajectories from claude-code, cline, codex, opencode, and pi agents; the hermes subset contains trajectories from the hermes agent. The data is stored in Parquet format, with each record representing an agent execution trajectory. This dataset can be used to study the behavior patterns, performance comparison, and multi-task learning of different agents in terminal synthetic tasks.

创建时间:
2026-08-29
搜集汇总
数据集介绍
Nemotron_Terminal_Synthetic_Tasks-GLM5.3-multiharness 数据集图片
构建方式
在自主智能体与终端环境交互研究日益深入的背景下,该数据集的构建立足于对终端操作任务的合成化生成范式。其核心思路在于依托GLM5.3模型作为任务生成引擎,通过多工具链协同编排机制(multiharness)对终端命令序列、文件系统操作及条件分支逻辑进行程序化合成,从而批量产出具备内在可执行性的任务实例。构建过程中,生成器并非简单拼接指令,而是围绕终端状态转移的因果链条设计任务拓扑,使得每一步操作均依赖前序执行结果,形成闭环验证结构。整体流程兼顾任务多样性、语义连贯性与执行可复现性,为后续评测提供了结构化的合成数据基础。
特点
该数据集在终端智能体评测领域中展现出若干值得关注的属性。其任务来源具有可控的合成特性,能够按需调整任务复杂度与领域覆盖范围,从而规避了真实终端日志中常见的噪声与隐私风险。多工具链的协同设计使任务不再局限于单一命令的调用,而是涉及命令组合、管道衔接与状态感知的复合操作,贴近实际终端工作流的层次性。同时,各任务实例之间保持语义独立,却共享统一的执行环境约束,为模型能力的细粒度诊断提供了便利。合成机制还支持任务难度的渐变分布,使得不同能力水平的智能体均可获得具有区分度的评测信号。
使用方法
在实际使用层面,该数据集主要服务于终端智能体的训练与评估任务。研究者可将任务实例加载至受控的终端沙箱环境中,驱动智能体依据自然语言指令逐步执行命令并观察状态反馈,进而依据任务完成度、执行路径效率及错误恢复能力等指标进行量化分析。若用于训练,可将任务成功轨迹作为正例信号,配合失败轨迹构建对比学习样本,以强化模型对终端操作语义的理解。评估阶段则建议固定环境配置与随机种子,确保不同模型间的比较具备可复现性。该数据集亦可作为基准测试的组成部分,与其他终端交互数据集形成互补,共同刻画智能体在命令行场景下的综合表现。
背景与挑战
背景概述
面向命令行智能体的评测长期受制于真实终端环境的高成本与不可复现性,终端操作序列的多步依赖、文件系统状态演化与命令间隐式耦合,使静态数据集难以覆盖复杂交互轨迹。该数据集于2025年前后由NVIDIA Nemotron团队构建,联合GLM-5.3与多种执行框架生成合成终端任务,旨在为智能体在交互式命令行场景下的规划、执行与纠错能力提供可扩展的训练与评估信号。其以多执行框架并行的合成范式,为终端智能体研究提供了兼具规模与可控性的基础资源。
当前挑战
该数据集所对应的核心领域问题,是让智能体在无图形界面的终端中依据自然语言意图完成多步操作并维持环境一致性,其难点在于长程任务中命令序列的组合爆炸、错误传播与状态不可逆性,以及跨执行框架时观察格式与反馈语义的异构。在构建过程中,合成任务需保证可执行性、可验证性与逻辑自洽,既要避免生成无法收敛或依赖外部网络的不稳定轨迹,又要在多框架并行采样中统一动作空间与成功判定标准,同时控制合成数据与真实终端分布之间的偏移,这些均构成显著挑战。
常用场景
经典使用场景
在智能体与命令行交互的研究脉络中,该数据集凭借多终端、多执行框架的合成任务编排,成为评估与训练终端智能体的典型试验场。其经典用法在于驱动大语言模型在真实或半真实终端环境中完成文件操作、流程管理与指令序列规划等任务,并通过多套执行harness对模型行为实施交叉验证,从而系统性地度量模型在长程依赖与复杂状态转移下的任务完成度。
衍生相关工作
围绕该数据集,后续研究多聚焦于终端智能体的训练配方优化、执行框架解耦与跨harness泛化能力分析,并催生了一批以多环境评测为卖点的智能体基准与训练管线,推动了终端场景下合成数据与真实交互相互补充的研究范式。
数据集最近研究
最新研究方向
在智能体与代码生成领域,面向终端环境的合成任务数据集正成为评估模型真实场景操作能力的关键基础设施。Nemotron_Terminal_Synthetic_Tasks-GLM5.3-multiharness 通过多工具链(multiharness)配置与合成终端任务,为研究模型在复杂命令行交互、文件系统操作与多步推理中的鲁棒性提供了标准化测试床。当前前沿方向聚焦于利用此类数据集探究大语言模型在长程依赖任务中的规划失效模式,以及多轮工具调用中的自我纠错机制。该数据集与近期开源智能体框架的迭代紧密关联,其多harness设计呼应了业界对跨环境泛化能力的迫切需求,为构建可复现、可扩展的终端自动化评测体系奠定了数据基石,对推动自主智能体从实验室走向生产部署具有显著的方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务