遇见数据集

TerminalKnowledge

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

本仓库包含两个互补的JSONL数据集:TerminalKnowledge和Agentic Terminal Coding Dataset。TerminalKnowledge是一个跨平台命令参考数据集,用于训练语言模型掌握macOS/Unix、Windows cmd.exe、Windows PowerShell和Linux等操作系统的终端命令知识,涵盖命令存在、语法、标志、实用示例和平台特定注意事项,包含1,883个示例和584个独特命令,数据格式包括纯文本知识条目和问答聊天条目。Agentic Terminal Coding Dataset是一个自主工程推理数据集,用于训练模型作为在终端中操作的自主编码代理,进行多步推理、工具使用、根本原因调查和工程判断,覆盖bug修复、复杂调试、事件响应、迁移、性能优化和功能构建等现实软件工程场景,包含2,248个示例的多轮对话。这两个数据集设计为一起使用,以提升模型在命令流畅性和工程推理深度方面的能力,采用Apache 2.0许可证。

This repository contains two complementary JSONL datasets: TerminalKnowledge and Agentic Terminal Coding Dataset. TerminalKnowledge is a cross-platform command reference dataset for training language models to master terminal command knowledge across operating systems including macOS/Unix, Windows cmd.exe, Windows PowerShell, and Linux. It covers command existence, syntax, flags, practical examples, and platform-specific considerations, consisting of 1,883 examples and 584 unique commands, with data formats including plain-text knowledge entries and question-answering chat entries. Agentic Terminal Coding Dataset is an autonomous engineering reasoning dataset designed to train models to act as autonomous coding agents operating in terminals, performing multi-step reasoning, tool usage, root cause investigation, and engineering judgment. It covers real-world software engineering scenarios such as bug fixing, complex debugging, incident response, migration, performance optimization, and feature development, and contains 2,248 multi-turn dialogue examples. These two datasets are designed to be used together to enhance the model's capabilities in command fluency and depth of engineering reasoning, and are licensed under Apache 2.0.

创建时间:
2026-07-03
原始信息汇总

数据集概述

该数据集由 NexLM 发布,包含两个互补的 JSONL 数据集,旨在训练和微调语言模型在终端/命令行熟练度和自主编码代理行为方面的能力。


数据集 1: TerminalKnowledge — 跨平台命令参考数据集

  • 文件: terminal_commands_dataset_COMBINED_v4.jsonl
  • 大小: ~1.3 MB
  • 样本数: 1,883
  • 覆盖的唯一命令数: 584
  • 大约 token 数: ~338,000

目的

教授模型关于终端/命令行工具的广泛、准确的事实知识,包括命令存在性、语法、标志、实际示例以及特定平台的注意事项。这是一个参考/知识数据集,而非任务求解数据集。

覆盖范围

  • macOS / Unix (优先): 314 个命令
  • Windows (cmd.exe): 122 个命令
  • Windows PowerShell: 97 个命令
  • Linux 特定: 51 个命令

按类别覆盖

类别 命令数
系统 114
文件与导航 81
Cmdlets (PowerShell) 97
进程与系统 71
网络 63
Shell 与环境 56
文本处理 39
开发工具 43
归档 12
权限 8

涵盖的核心工具

  • 日常基础命令:ls, cp, mv, grep, cd, find, chmod, ps, kill
  • macOS 特有深度覆盖:launchctl, diskutil, codesign, notarytool, xattr, spctl, csrutil, tccutil, dtruss, sample, spindump, otool, security, defaults, tmutil, mdfind, pbcopy/pbpaste, osascript
  • Windows cmd.exe:dir, robocopy, sfc, dism, netsh, wmic, reg, sc, bcdedit, vssadmin, bootrec
  • PowerShell cmdlets:对象管道基础(Get-ChildItem, Where-Object, ForEach-Object, Select-Object)、系统管理(Get-Process, Get-Service, Get-WinEvent)、网络(Test-NetConnection, New-NetFirewallRule)以及注册表/证书管理
  • Linux 特定:systemctl, journalctl, apt/yum/dnf, ip, ss, ufw, SELinux/AppArmor 工具, strace
  • 现代开发工具:git, docker, kubectl, terraform, npm/pnpm/yarn, uv/poetry/pyenv, ripgrep, fzf, 云 CLIs(aws, az, gcloud

数据格式(混合在单一文件中)

  1. 纯文本知识条目{"text": "..."}:结构化的事实补全,适合基础模型预训练或继续预训练。
  2. 问答聊天条目{"messages": [...]}:包含五种指令调优数据子类型:
    • 参考解释
    • 任务到命令场景
    • 标志深度解析
    • 跨平台等价命令
    • cmd.exe vs PowerShell 对比

条目类型分布

格式 数量
纯文本知识 584
问答参考解释 584
问答任务到命令场景 584
问答标志深度解析 103
问答跨平台等价命令 20
问答cmd.exe vs PowerShell对比 8

数据集 2: Agentic Terminal Coding Dataset — 自主工程推理数据集

  • 文件: agentic_terminal_coding_dataset_FINAL.jsonl
  • 大小: ~34 MB
  • 样本数: 2,248
  • 大约 token 数: ~888 万

目的

教授模型作为在终端中运行的自主编码代理——进行多步推理、真实工具使用、根本原因调查以及在真实软件工程场景下的工程判断。

场景类别

类别 样本数 重点
Bug修复 1,119 从首次复现到验证修复的诊断与解决
复杂调试 393 多原因Bug(如并发问题),需要深入调查
事故响应 280 需要立即缓解并跟进根本原因修复的生产事故
迁移 144 使用标志门控、分阶段推出策略的大规模系统/数据迁移
性能优化 168 基于性能分析的驱动修复,并通过实际基准测试验证
功能构建(全新开发) 144 在明确架构约束下从零构建新功能

每个样本的结构

每个样本是一个完整的多轮对话:

  • 系统提示 — 定义代理的角色和操作原则
  • 用户提示 — 真实具体的工程任务或事故
  • 助手响应 — 完整的代理轨迹,包括:
    • 将任务分解为步骤的前期计划
    • 编号的终端步骤,每步包含:确切命令、真实命令输出、执行该步骤的显式推理
    • 根本原因调查而非表面症状修补
    • 基于真实证据(测试运行、基准测试、日志)的验证
    • 考虑过的替代方案及显式推理
    • 已验证的边缘情况
    • 风险评估(影响范围、回滚计划、监控/部署建议)
    • 审查者备注或利益相关方沟通

设计理念

此数据集旨在教授工程判断,而不仅仅是代码输出:

  • 比较性推理(为什么选择的方法优于替代方案)
  • 验证纪律(通过直接测量确认修复有效)
  • 实际完整性(回滚计划和沟通被视为交付物的一部分)

配套使用建议

两个数据集互补设计,建议配合使用:

  • TerminalKnowledge 构建命令的流畅度和广度,使模型能够在macOS、Windows和Linux上正确操作终端。
  • Agentic Terminal Coding Dataset 构建工程判断和深度,教授有效使用命令解决真实软件工程问题的推理过程。

文件汇总

文件 大小 样本数 格式
terminal_commands_dataset_COMBINED_v4.jsonl ~1.3 MB 1,883 混合:{"text": ...}{"messages": ...}
agentic_terminal_coding_dataset_FINAL.jsonl ~34 MB 2,248 {"messages": ...} (聊天格式)

许可信息

数据集采用 Apache 2.0 许可证。

搜集汇总
数据集介绍
TerminalKnowledge 数据集图片
构建方式
TerminalKnowledge数据集由NexLM团队精选构建,旨在为语言模型提供跨平台终端命令的全面参考知识。该数据集融合了两种训练格式于单一JSONL文件中:其一为纯文本知识条目,以结构化散文形式呈现命令、操作系统、语法、描述、标志、示例及注意事项,适用于基座模型的预训练或持续预训练;其二为问答对话条目,涵盖参考解释、任务到命令场景、标志深度剖析、跨平台等效命令及cmd.exe与PowerShell对比等五种子类型。数据集覆盖macOS/Unix、Windows cmd.exe、PowerShell及Linux特定命令,共计1,883条示例,包含584个独特命令,约338,000个词元。
特点
TerminalKnowledge数据集的核心特点在于其广泛的跨平台覆盖与精细的类别划分。它优先专注macOS/Unix(314个命令),同时涵盖Windows cmd.exe(122个命令)、PowerShell(97个命令)及Linux特定命令(51个命令),并按照系统、文件与导航、网络、文本处理、开发工具等十大类别进行组织。数据集中不仅包含日常基础命令如ls、grep,还深度覆盖macOS特有的launchctl、diskutil及现代开发工具如git、docker、kubectl。此外,其混合格式设计允许同一数据集支持从基础事实学习到指令微调的多阶段训练,且提供了标志深度剖析、跨平台对比等高级内容,增强模型的实用理解能力。
使用方法
TerminalKnowledge数据集的使用方法灵活多样,适用于语言模型训练的多个阶段。在预训练或持续预训练阶段,可直接利用纯文本知识条目(格式为{'text': '...'})来增强模型对终端命令事实的广泛认知。在指令微调阶段,可采用问答对话条目(格式为{'messages': [{'role': 'system', ...}, {'role': 'user', ...}, {'role': 'assistant', ...}]})训练模型回答用户关于命令功能、使用场景、标志细节及跨平台等价物的问题。为获得最佳效果,建议将该数据集与NexLM配套的Agentic Terminal Coding Dataset结合使用,后者专注于培养模型的工程推理与自主代理能力,二者互补可产出既精通终端命令又具备严谨问题解决能力的模型。数据集已发布于Hugging Face,可便捷下载使用,并遵循Apache 2.0开源许可。
背景与挑战
背景概述
TerminalKnowledge数据集由NexLM团队于近期创建,旨在系统化覆盖跨平台终端命令行知识与自主编码智能体的推理能力。该数据集聚焦于解决大语言模型在终端操作环境中知识碎片化与工程判断力不足的核心问题,通过整合macOS/Unix、Windows cmd.exe与PowerShell及Linux特有命令,构建起包含584条独特命令、1883个训练样本的综合性知识库。其研究意义在于为模型提供从基础命令语法到复杂工程场景推理的多层次学习资源,为推动终端自动化代理技术的进步奠定了关键数据基础,对人工智能辅助编程与系统运维领域产生了深远影响。
当前挑战
该数据集所应对的领域挑战在于,大语言模型需从静态的文本知识跃升至具备跨平台终端操作的真实工程能力,这要求模型不仅记忆命令语法,更需掌握多步推理、根因分析与风险决策。构建过程中面临的挑战包括:如何在有限数据规模内平衡操作系统的广度与命令的深度,避免陷入百科全书式覆盖的冗余;如何将不同来源的原始命令格式(如PowerShell的对象管道与传统Unix命令)转化为统一的训练语料;以及如何在智能体轨迹数据中嵌入替代方案比较与验证逻辑,以培养模型的工程判断力而非简单的输出模仿。
常用场景
经典使用场景
在大型语言模型的能力拓展中,终端与命令行操作是衡量模型实用性与自主性的关键领域。TerminalKnowledge数据集专为增强语言模型对跨平台命令行工具的精准事实性知识而设计,涵盖了macOS、Windows及Linux三大生态系统中584个常用命令、约33.8万token的参考级知识。其经典使用场景体现为模型终端知识图谱的构建与微调,包括命令语法、标志参数、实用范例及平台特异性说明的学习,从而使得模型能够系统地掌握从日常文件操作到系统管理、开发工具链等多元场景下的终端命令用法。
实际应用
在实际工程应用中,TerminalKnowledge显著赋能了智能编码助手、自动化运维代理以及交互式命令行AI系统的开发。例如,模型可依据自然语言描述的任务需求(如“批量重命名某目录下的所有日志文件”),精准生成对应操作系统的有效命令组合,并提供跨平台等效方案。同时,该数据集助力构建面向DevOps场景的智能体,使其能够自主处理文件管理、网络诊断、系统监控和容器编排等常见操作,从而大幅降低人工查阅文档和命令纠错的时间成本,提升研发与运维效率。
衍生相关工作
基于TerminalKnowledge数据集,后续涌现了一系列具有重要价值的衍生工作。其中最核心的是同步发布的Agentic Terminal Coding数据集,它进一步将终端命令知识融入多步推理与自主工程决策的上下文中,构建了涵盖缺陷修复、复杂调试、事故响应、性能优化和特性开发等真实软件工程场景的完整智能体轨迹。此外,该数据集的思想启发了多种面向终端操作的知识蒸馏与课程学习方法,促进了跨平台命令知识图谱的自动构建研究,并推动了将结构化命令参考与细粒度标志深度解析相结合的混合训练范式在模型能力迁移中的应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务