遇见数据集

tmax-sft-big

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

Tmax-sft-big是一个用于大语言模型监督微调(SFT)的组合数据集,由多个开源数据集合并而成,旨在支持终端代理(terminal agents)的研究与开发。数据内容来源于八个不同的子数据集,包括AllenAI的Sera-4.6-Lite-47000、m-a-p的TerminalTraj、NVIDIA的Nemotron-Terminal-Corpus(包含dataset_adapters、skill_based_easy、skill_based_medium、skill_based_mixed等多个子集)、open-thoughts的OpenThoughts-Agent-v1-SFT以及skill_tax_20260505_2.2k_combined_balanced_thinking_all。数据集总计包含约327,299个样本,每个样本都包含一个source_dataset字段,用于标识其原始来源子集。该数据集在Tmax相关论文中被用于大规模SFT实验,采用ODC-BY许可,适用于研究和教育用途,并遵循Ai2的负责任使用指南。部分数据由Gemini 3.1 Pro生成,使用时需同时遵守Google的服务条款。建议用户参考各原始数据集的许可条款。

Tmax-sft-big is a combined dataset for supervised fine-tuning (SFT) of large language models, created by merging multiple open-source datasets. It aims to support research and development of terminal agents. The data is sourced from eight different sub-datasets, including AllenAIs Sera-4.6-Lite-47000, m-a-ps TerminalTraj, NVIDIAs Nemotron-Terminal-Corpus (which includes subsets like dataset_adapters, skill_based_easy, skill_based_medium, skill_based_mixed), open-thoughts OpenThoughts-Agent-v1-SFT, and skill_tax_20260505_2.2k_combined_balanced_thinking_all. The dataset contains approximately 327,299 samples in total, with each sample including a source_dataset field to identify its original source subset. It has been used in Tmax-related papers for large-scale SFT experiments. The dataset is licensed under ODC-BY, suitable for research and educational purposes, and follows Ai2s responsible use guidelines. Some data is generated by Gemini 3.1 Pro, and users must comply with Googles terms of service when using it. It is recommended that users also refer to the license terms of the original datasets.

提供机构:
Allen Institute for AI
创建时间:
2026-06-18
原始信息汇总

数据集概述

Tmax-sft-big 是一个组合式监督微调(SFT)数据集,由多个来源的数据集合并而成,用于论文中的“大型SFT”实验。该数据集由 Allen AI 发布。

  • 许可证:ODC-BY
  • 用途:面向研究和教育用途,符合 Ai2 的负责任使用指南。
  • 数据内容:每条数据包含一个 source_dataset 字段,用于标识其原始来源子集。
  • 论文 & 资源:相关论文可在 arXiv 上获取,代码、模型、数据及博客文章均有对应链接。

数据来源

该数据集由以下8个子数据集组成:

来源数据集 样本数 原始链接
allenai__Sera_4.6_Lite_47000 47,464 allenai/Sera-4.6-Lite-47000
m_a_p__TerminalTraj 16,748 m-a-p/TerminalTraj
nvidia__Nemotron_Terminal_Corpus__dataset_adapters 179,888 nvidia/Nemotron-Terminal-Corpus: dataset_adapters
nvidia__Nemotron_Terminal_Corpus__skill_based_easy 35,208 nvidia/Nemotron-Terminal-Corpus: skill_based_easy
nvidia__Nemotron_Terminal_Corpus__skill_based_medium 22,037 nvidia/Nemotron-Terminal-Corpus: skill_based_medium
nvidia__Nemotron_Terminal_Corpus__skill_based_mixed 741 nvidia/Nemotron-Terminal-Corpus: skill_based_mixed
open_thoughts__OpenThoughts_Agent_v1_SFT 8,717 open-thoughts/OpenThoughts-Agent-v1-SFT
skill_tax_20260505_2.2k_combined_balanced_thinking_all 16,496 source config in osieosie/tmax-sft-full-20260513

总计样本数:约 327,399 条。

使用许可

  • 数据集本身采用 ODC-BY 许可证。
  • 数据中包含使用 Gemini 3.1 Pro 生成的输出,受 Google 服务条款约束。
  • 每个原始子数据集请参考其自身的许可证。

引用信息

若使用该模型或数据,请引用以下论文:

bibtex @misc{ivison2026tmaxsimplerecipeterminal, title={Tmax: A simple recipe for terminal agents}, author={Hamish Ivison and Junjie Oscar Yin and Rulin Shao and Teng Xiao and Nathan Lambert and Hannaneh Hajishirzi}, year={2026}, eprint={2606.23321}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2606.23321}, }

搜集汇总
数据集介绍
tmax-sft-big 数据集图片
构建方式
Tmax-SFT-Big数据集是一个大规模监督微调(SFT)语料库,由多个高质量开源数据集融合而成。构建者从Sera、TerminalTraj、Nemotron-Terminal-Corpus、OpenThoughts-Agent-v1-SFT以及专门配置的skill_tax语料中抽取样本,最终汇集超过32万条指令-响应数据。每一行数据通过'source_dataset'字段精确标注原始来源子集,便于追溯与消融研究。该数据集专为论文中所述的'大规模SFT'实验而设计,旨在提供多样化的训练素材,以提升终端智能体的指令跟随与任务执行能力。
使用方法
该数据集可直接用于大语言模型的指令微调阶段,采用标准的序列到序列监督学习策略。研究者和工程师可加载完整语料或按'Source dataset'字段对特定来源的子集执行消融实验,以评估不同数据成分对终端智能体性能的贡献。建议在训练时保留原始数据中的来源标记,便于后续分析与归因。需要注意的是,部分数据包含由Gemini 3.1 Pro生成的输出,使用者应遵守Google服务条款,并尊重各子数据集原始许可协议(如ODC-BY)中规定的研究与教育用途边界。
背景与挑战
背景概述
Tmax-sft-big数据集由Allen AI的研究团队于2026年创建,主要研究人员包括Hamish Ivison、Junjie Oscar Yin、Rulin Shao、Teng Xiao、Nathan Lambert和Hannaneh Hajishirzi等。该数据集旨在为终端代理(terminal agents)的指令微调提供大规模、多样化的监督微调(SFT)数据,核心研究问题在于探索如何通过简单有效的数据组合策略提升智能体在终端环境中的任务执行能力。作为Tmax项目的重要组成部分,该数据集整合了来自多个高质量来源的对话与指令数据,包含约32.7万个样本,覆盖技能导向、复杂推理及终端交互等场景。其发布对智能体微调领域产生了显著影响,为构建高效终端代理模型提供了坚实的数据基础,并被相关论文引用以验证数据规模与多样性对模型性能的提升作用。
当前挑战
该数据集面临的领域挑战主要在于终端代理任务的复杂性,包括对多步骤指令的理解、环境交互的动态反馈处理以及跨平台命令执行的泛化能力,这些均要求模型具备强推理与适应能力。在构建过程中,挑战体现在数据源的异构整合上:各来源数据集(如Nemotron Terminal Corpus和OpenThoughts Agent SFT)在格式、任务类型和质量标准上差异显著,需通过统一的去重与平衡策略实现兼容;同时,部分数据源自付费模型(如Gemini 3.1 Pro),其输出可能引入版权或使用限制,需严格遵循原始许可协议(如ODC-BY)并确保数据的合法合规使用。此外,大规模数据的存储与处理对计算资源提出较高要求,需在效率与质量间取得平衡。
常用场景
经典使用场景
在终端智能体与语言模型微调的研究领域中,Tmax-sft-big数据集扮演着基石般的角色。该数据集经由精心整合多个高质量的监督式微调来源而成,包括Sera、Nemotron-Terminal-Corpus及OpenThoughts-Agent等,覆盖了从对话生成到复杂指令遵循的广泛任务。其最经典的使用场景在于作为大规模监督微调(Big SFT)的骨干数据,用于提升语言模型在终端环境下执行多步骤操作、调用外部工具及进行环境交互的能力。研究者借助这一海量、多样化的训练素材,能够显著增强模型对结构化指令的理解与生成精度,为构建更加智能、灵活的终端代理系统奠定了坚实的数据基础。
解决学术问题
Tmax-sft-big数据集的核心贡献在于破解了终端代理领域中长期困扰学术界的训练数据瓶颈问题。此前,由于缺乏大规模、多源融合且标注一致的SFT数据,语言模型在终端环境下的泛化能力与任务迁移效果始终难以突破。该数据集通过整合来自不同来源的高质量子集,系统性地解决了训练数据来源单一、任务覆盖不足的难题,为研究终端交互中模型的行为一致性、指令跟随鲁棒性提供了标准化测评基准。它的出现推动了学术界对智能体在复杂终端场景中推理能力的量化研究,极大地减少了因数据差异造成的实验偏差,使得模型效果的对比与分析更为可靠。
实际应用
在工业级终端智能体的实际部署中,Tmax-sft-big数据集展现出卓越的应用价值。基于该数据集微调的语言模型能够被广泛应用于自动化运维、命令行助手、代码编辑环境以及智能客服系统等场景。例如,在运维自动化中,模型可依据自然语言指令自主完成服务器状态查询、日志分析及配置修改等操作;在开发者工具中,它能够辅助程序员执行文件管理、环境配置与调试流程。这些应用显著提升了人机交互效率,降低了重复性任务的时间成本,为终端操作智能化转型提供了可复现、可扩展的数据支撑,推动了人机协作边界的延伸。
数据集最近研究
最新研究方向
在终端智能体(terminal agents)的前沿研究中,Tmax-sft-big数据集代表了大规模监督微调数据整合的最新趋势。该数据集融合了来自Sera、TerminalTraj、Nemotron-Terminal-Corpus及OpenThoughts等多源异构的终端交互数据,共计超过32万条样本,旨在解决智能体在复杂终端环境中的指令遵循与任务执行能力。这一方向紧密关联当前对Agentic AI系统的热点探索,特别是通过大规模、多样化的SFT数据来提升模型在真实终端场景下的泛化性与鲁棒性。Tmax-sft-big的发布不仅为终端智能体的研究提供了标准化数据基准,也推动了数据组合策略在智能体训练中的方法论演进,对实现更高效、更通用的命令行代理系统具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务