TerminalKnowledge
收藏资源简介:
本仓库包含两个互补的JSONL数据集:TerminalKnowledge和Agentic Terminal Coding Dataset。TerminalKnowledge是一个跨平台命令参考数据集,用于训练语言模型掌握macOS/Unix、Windows cmd.exe、Windows PowerShell和Linux等操作系统的终端命令知识,涵盖命令存在、语法、标志、实用示例和平台特定注意事项,包含1,883个示例和584个独特命令,数据格式包括纯文本知识条目和问答聊天条目。Agentic Terminal Coding Dataset是一个自主工程推理数据集,用于训练模型作为在终端中操作的自主编码代理,进行多步推理、工具使用、根本原因调查和工程判断,覆盖bug修复、复杂调试、事件响应、迁移、性能优化和功能构建等现实软件工程场景,包含2,248个示例的多轮对话。这两个数据集设计为一起使用,以提升模型在命令流畅性和工程推理深度方面的能力,采用Apache 2.0许可证。
This repository contains two complementary JSONL datasets: TerminalKnowledge and Agentic Terminal Coding Dataset. TerminalKnowledge is a cross-platform command reference dataset for training language models to master terminal command knowledge across operating systems including macOS/Unix, Windows cmd.exe, Windows PowerShell, and Linux. It covers command existence, syntax, flags, practical examples, and platform-specific considerations, consisting of 1,883 examples and 584 unique commands, with data formats including plain-text knowledge entries and question-answering chat entries. Agentic Terminal Coding Dataset is an autonomous engineering reasoning dataset designed to train models to act as autonomous coding agents operating in terminals, performing multi-step reasoning, tool usage, root cause investigation, and engineering judgment. It covers real-world software engineering scenarios such as bug fixing, complex debugging, incident response, migration, performance optimization, and feature development, and contains 2,248 multi-turn dialogue examples. These two datasets are designed to be used together to enhance the model's capabilities in command fluency and depth of engineering reasoning, and are licensed under Apache 2.0.
数据集概述
该数据集由 NexLM 发布,包含两个互补的 JSONL 数据集,旨在训练和微调语言模型在终端/命令行熟练度和自主编码代理行为方面的能力。
数据集 1: TerminalKnowledge — 跨平台命令参考数据集
- 文件:
terminal_commands_dataset_COMBINED_v4.jsonl - 大小: ~1.3 MB
- 样本数: 1,883
- 覆盖的唯一命令数: 584
- 大约 token 数: ~338,000
目的
教授模型关于终端/命令行工具的广泛、准确的事实知识,包括命令存在性、语法、标志、实际示例以及特定平台的注意事项。这是一个参考/知识数据集,而非任务求解数据集。
覆盖范围
- macOS / Unix (优先): 314 个命令
- Windows (cmd.exe): 122 个命令
- Windows PowerShell: 97 个命令
- Linux 特定: 51 个命令
按类别覆盖
| 类别 | 命令数 |
|---|---|
| 系统 | 114 |
| 文件与导航 | 81 |
| Cmdlets (PowerShell) | 97 |
| 进程与系统 | 71 |
| 网络 | 63 |
| Shell 与环境 | 56 |
| 文本处理 | 39 |
| 开发工具 | 43 |
| 归档 | 12 |
| 权限 | 8 |
涵盖的核心工具
- 日常基础命令:
ls,cp,mv,grep,cd,find,chmod,ps,kill等 - macOS 特有深度覆盖:
launchctl,diskutil,codesign,notarytool,xattr,spctl,csrutil,tccutil,dtruss,sample,spindump,otool,security,defaults,tmutil,mdfind,pbcopy/pbpaste,osascript等 - Windows cmd.exe:
dir,robocopy,sfc,dism,netsh,wmic,reg,sc,bcdedit,vssadmin,bootrec等 - PowerShell cmdlets:对象管道基础(
Get-ChildItem,Where-Object,ForEach-Object,Select-Object)、系统管理(Get-Process,Get-Service,Get-WinEvent)、网络(Test-NetConnection,New-NetFirewallRule)以及注册表/证书管理 - Linux 特定:
systemctl,journalctl,apt/yum/dnf,ip,ss,ufw, SELinux/AppArmor 工具,strace - 现代开发工具:
git,docker,kubectl,terraform,npm/pnpm/yarn,uv/poetry/pyenv,ripgrep,fzf, 云 CLIs(aws,az,gcloud)
数据格式(混合在单一文件中)
- 纯文本知识条目 —
{"text": "..."}:结构化的事实补全,适合基础模型预训练或继续预训练。 - 问答聊天条目 —
{"messages": [...]}:包含五种指令调优数据子类型:- 参考解释
- 任务到命令场景
- 标志深度解析
- 跨平台等价命令
- cmd.exe vs PowerShell 对比
条目类型分布
| 格式 | 数量 |
|---|---|
| 纯文本知识 | 584 |
| 问答参考解释 | 584 |
| 问答任务到命令场景 | 584 |
| 问答标志深度解析 | 103 |
| 问答跨平台等价命令 | 20 |
| 问答cmd.exe vs PowerShell对比 | 8 |
数据集 2: Agentic Terminal Coding Dataset — 自主工程推理数据集
- 文件:
agentic_terminal_coding_dataset_FINAL.jsonl - 大小: ~34 MB
- 样本数: 2,248
- 大约 token 数: ~888 万
目的
教授模型作为在终端中运行的自主编码代理——进行多步推理、真实工具使用、根本原因调查以及在真实软件工程场景下的工程判断。
场景类别
| 类别 | 样本数 | 重点 |
|---|---|---|
| Bug修复 | 1,119 | 从首次复现到验证修复的诊断与解决 |
| 复杂调试 | 393 | 多原因Bug(如并发问题),需要深入调查 |
| 事故响应 | 280 | 需要立即缓解并跟进根本原因修复的生产事故 |
| 迁移 | 144 | 使用标志门控、分阶段推出策略的大规模系统/数据迁移 |
| 性能优化 | 168 | 基于性能分析的驱动修复,并通过实际基准测试验证 |
| 功能构建(全新开发) | 144 | 在明确架构约束下从零构建新功能 |
每个样本的结构
每个样本是一个完整的多轮对话:
- 系统提示 — 定义代理的角色和操作原则
- 用户提示 — 真实具体的工程任务或事故
- 助手响应 — 完整的代理轨迹,包括:
- 将任务分解为步骤的前期计划
- 编号的终端步骤,每步包含:确切命令、真实命令输出、执行该步骤的显式推理
- 根本原因调查而非表面症状修补
- 基于真实证据(测试运行、基准测试、日志)的验证
- 考虑过的替代方案及显式推理
- 已验证的边缘情况
- 风险评估(影响范围、回滚计划、监控/部署建议)
- 审查者备注或利益相关方沟通
设计理念
此数据集旨在教授工程判断,而不仅仅是代码输出:
- 比较性推理(为什么选择的方法优于替代方案)
- 验证纪律(通过直接测量确认修复有效)
- 实际完整性(回滚计划和沟通被视为交付物的一部分)
配套使用建议
两个数据集互补设计,建议配合使用:
- TerminalKnowledge 构建命令的流畅度和广度,使模型能够在macOS、Windows和Linux上正确操作终端。
- Agentic Terminal Coding Dataset 构建工程判断和深度,教授有效使用命令解决真实软件工程问题的推理过程。
文件汇总
| 文件 | 大小 | 样本数 | 格式 |
|---|---|---|---|
terminal_commands_dataset_COMBINED_v4.jsonl |
~1.3 MB | 1,883 | 混合:{"text": ...} 和 {"messages": ...} |
agentic_terminal_coding_dataset_FINAL.jsonl |
~34 MB | 2,248 | {"messages": ...} (聊天格式) |
许可信息
数据集采用 Apache 2.0 许可证。





