遇见数据集

tmax-sft

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

TMax SFT 是一个用于监督微调(SFT)的数据集,旨在训练或评估能够在终端环境中执行任务的智能体。数据集的核心内容来源于 Qwen 3.6 27B 大型语言模型在约 2000 个由 tmax 项目生成的不同模拟环境中的交互轨迹。这些轨迹以多轮对话的形式组织,每条数据记录了一个完整的任务执行过程。数据集包含两个主要配置版本:一个包含所有交互的完整版本(skill_tax_20260505_2.2k_combined_balanced_thinking_all,含 10,726 个样本),以及一个仅包含成功完成任务轨迹的过滤版本(skill_tax_20260505_2.2k_combined_balanced_thinking_only_success,含 5,795 个样本)。每个样本的结构化信息非常丰富,主要包括:1) `messages` 列表,记录了用户与助手之间的对话轮次,每条消息包含常规文本内容 (`content`)、模型内部的推理过程 (`reasoning_content`)、角色 (`role`) 以及工具调用 (`tool_calls`) 的详细信息(如函数名称、参数命令等);2) `tools` 字段,定义了任务中可用的工具;3) `source` 字段,标识数据来源;4) 详尽的 `metadata`,记录了任务名称 (`task`)、执行日期 (`date`)、是否启用思考链 (`enable_thinking`)、是否成功完成任务 (`has_task_complete`)、交互轮次 (`num_turns`)、警告数量 (`num_warnings`)、使用的源模型 (`source_model`) 等多种执行环境和过程相关的元数据。该数据集专为研究终端智能体(Terminal Agents)而设计,适用于指令跟随、工具使用、多步推理、任务规划等能力的模型训练与评估。数据集采用 ODC-BY 许可证,遵循 Ai2 的负责任使用指南,并基于 tmax 研究论文构建。

TMax SFT is a supervised fine-tuning (SFT) dataset designed for training or evaluating agents capable of performing tasks in terminal environments. The core content of the dataset originates from the interaction trajectories of the Qwen 3.6 27B Large Language Model across approximately 2,000 distinct simulated environments generated by the tmax project. These trajectories are organized in the form of multi-turn dialogues, with each data entry recording a complete task execution process. The dataset includes two main configuration versions: a full version containing all interactions (skill_tax_20260505_2.2k_combined_balanced_thinking_all, with 10,726 samples), and a filtered version only including successfully completed task trajectories (skill_tax_20260505_2.2k_combined_balanced_thinking_only_success, with 5,795 samples). Each sample contains rich structured information, mainly including: 1) The `messages` list, which records the dialogue turns between the user and the assistant, where each message contains conventional text content (`content`), the model's internal reasoning process (`reasoning_content`), the speaker's role (`role`), and detailed tool call information (`tool_calls`) such as function names and parameter commands; 2) The `tools` field, which defines the tools available for the task; 3) The `source` field, which identifies the data source; 4) Exhaustive `metadata` that records various details related to the execution environment and process, including task name (`task`), execution date (`date`), whether chain-of-thought is enabled (`enable_thinking`), whether the task was successfully completed (`has_task_complete`), number of interaction turns (`num_turns`), number of warnings (`num_warnings`), and the source model used (`source_model`). This dataset is specifically designed for research on Terminal Agents, and is suitable for model training and evaluation of capabilities such as instruction following, tool use, multi-step reasoning, and task planning. The dataset is released under the ODC-BY license, follows the AI2 Responsible Use Guidelines, and is built based on the tmax research paper.

提供机构:
Allen Institute for AI
创建时间:
2026-06-19
原始信息汇总

数据集概述:TMax SFT

该数据集是TMax项目的一部分,专注于终端代理的监督式微调(SFT),基于 Qwen 3.6 27B 模型在约 2,000 个独立环境中生成的轨迹数据。

数据集配置与规模

数据集包含两个子配置,均只提供 train 分割:

配置名称 描述 样本数 数据集大小 下载大小
skill_tax_20260505_2.2k_combined_balanced_thinking_all 包含所有思考过程的轨迹数据 10,726 341,236,431 字节 96,148,947 字节
skill_tax_20260505_2.2k_combined_balanced_thinking_only_success 仅包含成功任务的思考轨迹数据 5,795 151,596,824 字节 40,910,334 字节

数据特征

每条数据包含以下字段:

  • messages: 对话消息列表,每条消息包含:
    • content (string): 消息内容
    • reasoning_content (string): 推理/思考内容
    • role (string): 角色(如 user/assistant)
    • tool_call_ids (list of string): 工具调用的ID列表
    • tool_calls (list): 工具调用详情,包含:
      • function: 含 arguments(命令字符串)和 name(函数名)
      • id, type: 工具调用标识与类型
  • tools (string): 可用工具的定义
  • source (string): 数据来源
  • metadata: 元数据,包括:
    • date (string): 日期
    • enable_thinking (bool): 是否启用思考过程
    • episode (string): 任务轮次
    • has_ctrl_c (bool): 是否包含中断信号
    • has_task_complete (bool): 任务是否完成
    • json_extraction_failed (bool): JSON提取是否失败
    • json_strategy_counts (dict): 不同策略的使用计数(0-5)
    • num_turns (int64): 对话轮数
    • num_warnings (int64): 警告次数
    • run_id (string): 运行ID
    • source_model (string): 源模型
    • task (string): 任务名称
    • trial_name (string): 试验名称

许可与语言

  • 许可协议: ODC-BY
  • 语言: 英语 (en)
  • 用途: 仅限研究与教育用途,需遵守 Ai2 的负责任使用指南。数据中包含由 Gemini 3.1 Pro 生成的输出,受 Google 服务条款约束。

引用

若使用该数据集,请引用论文:

  • 论文标题: Tmax: A simple recipe for terminal agents
  • arXiv: 2606.23321
搜集汇总
数据集介绍
tmax-sft 数据集图片
构建方式
Tmax-SFT 数据集源自 Tmax 项目,旨在为终端智能体训练提供监督微调数据。该数据集通过将 Qwen 3.6 27B 模型部署于约 2,000 个精心构建的终端环境,收集其完整的交互轨迹而生成。每个样本包含多轮对话消息、模型思考内容(reasoning_content)、工具调用记录及环境元数据,并依据任务完成状态与数据平衡策略,提供两种配置:'all'版本保留所有轨迹,共 10,726 条;'only_success'版本仅筛选成功完成任务的数据,共 5,795 条。数据构建强调真实终端场景的模拟,确保轨迹的多样性与适用性。
特点
该数据集的核心特点在于其丰富的结构化信息与严格的质量控制。每条样本不仅包含标准的角色-内容对话对,还记录了模型的推理过程(reasoning_content)与工具调用详情,支持研究模型在复杂终端任务中的逐步决策与工具使用行为。元数据涵盖执行日期、运行编号、警告次数、JSON 提取状态等字段,便于筛选与异常分析。其双配置设计允许研究者根据目标选择全量数据或高质量成功案例,提升了数据使用的灵活性。整体规模适中,专注于深度微调而非大规模预训练。
使用方法
Tmax-SFT 数据集专为与 Tmax 项目配套的 open-instruct 框架使用而设计。用户可通过 HuggingFace Datasets 库加载指定配置(如 skill_tax_20260505_2.2k_combined_balanced_thinking_all 或 only_success),并利用其消息与工具结构进行对话式监督微调。建议在加载时关注 metadata 字段中的 enable_thinking 与 has_task_complete 标记,以过滤或分析特定行为。数据集采用 ODC-BY 许可证,适用于研究及教育场景,引用时需注明 Tmax 论文以支持学术追踪。
背景与挑战
背景概述
随着大语言模型(LLMs)能力的持续提升,将其部署为能够自主执行复杂任务的终端智能代理(terminal agents)已成为人工智能领域的重要研究方向。此类代理需在动态环境中调用外部工具、执行命令行指令并完成多轮交互,对模型的推理能力与工具使用能力提出了严苛要求。在此背景下,Allen Institute for AI(Ai2)的研究团队(Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi)于2026年提出了Tmax方法及配套的SFT数据集(TMax-SFT)。该数据集源自Qwen 3.6 27B模型在约2,200个独立环境中生成的交互轨迹,旨在通过监督微调(SFT)提升语言模型的终端代理能力。其核心研究问题聚焦于如何利用结构化交互数据训练模型完成工具调用、多轮对话与任务完成,对终端自主智能体的研究具有里程碑意义。
当前挑战
该数据集所解决的领域挑战在于终端代理场景下的复杂决策与工具编排问题:模型需在不确定环境中理解不可预见的状态变更、精准解析用户意图并调用正确工具,同时应对多工具协同、错误恢复与长序列依赖等难题。构建过程中面临严峻挑战:首先,数据生成需依赖大规模模拟环境(约2.2K环境)和强基座模型(Qwen 3.6 27B)的采样,难以保证轨迹的多样性与成功率;其次,数据筛选需平衡任务完成率(has_task_complete)、原生思考过程(enable_thinking)与JSON策略有效性(json_strategy_counts),防止因模型失败案例(如has_ctrl_c, json_extraction_failed)引入噪声;此外,标注元数据涉及多回合交互、工具调用标识及来源追溯(source_model, run_id),对数据质量控制提出高要求。
常用场景
经典使用场景
在终端智能体研究领域,TMax-SFT数据集被广泛用于对大型语言模型进行监督式微调,以提升其在命令行环境中的任务执行能力。该数据集包含了来自Qwen 3.6 27B模型在约2000个独特环境中的交互轨迹,每个样本都记录了包括系统工具调用、推理过程以及对话回合在内的完整行为序列。研究者通常利用其丰富的结构化信息,训练模型掌握从解析任务指令、调用适当系统命令到完成复杂多步骤操作的完整闭环技能,尤其是在那些需要深度思考与工具协作的场景下尤为突出。
解决学术问题
该数据集有效回应了当前大语言模型在终端代理领域的核心挑战——如何从有限的交互样本中学习到泛化性强且可复用的工具使用策略。通过提供包含成功与失败多种子集的高质量轨迹数据,TMax-SFT使学术界能够系统性地研究模型在真实命令行环境中的行为鲁棒性、策略多样性以及差错恢复机制。其意义在于不仅为终端智能体的可控训练提供了标准化基准,还推动了探索模型推理与具体行动之间的深层耦合关系,从而为构建更贴近人类操作习惯的自主命令行助手奠定了坚实基础。
衍生相关工作
基于TMax-SFT数据集,衍生出多项具有影响力的研究工作。核心论文《Tmax: A simple recipe for terminal agents》提出了一个简洁而有效的终端智能体训练方案,并随之开源了配套的open-instruct工具库与模型集合。后续研究者围绕该数据集开展了关于思维链训练、失败案例分析与策略优化等方向的探索,同时在保持数据集学术开放性的基础上,推动了多模型在终端任务上的对比评估,进一步丰富了终端智能体领域的系统性研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务