遇见数据集

tmax-15k-open-instruct

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

TMax 15k - Open Instruct是一个用于训练Tmax系列模型(如Tmax 9b)的数据集,其格式专为与特定的开源指令库(open-instruct fork)配合使用而设计。该数据集是一个集合,包含大约15,000个强化学习(RL)环境实例。每个样本包含多个特征:messages(一个由content和role字段组成的消息列表,用于记录交互内容)、ground_truth(真实答案或目标)、dataset(来源数据集标识)、env_config(环境配置结构体,包括env_name、image和task_id)以及source(数据来源标识)。数据集规模方面,训练集包含14,601个样本,总大小约为66MB。该数据集采用ODC-BY许可证,旨在用于研究和教育目的,并遵循相关的负责任使用准则。数据生成过程和具体构成细节在相关论文中有详细说明。

TMax 15k - Open Instruct is a dataset designed for training Tmax series models (such as Tmax 9b), with its format specifically tailored for use with a particular open-source instruction library (open-instruct fork). The dataset is a collection comprising approximately 15,000 reinforcement learning (RL) environment instances. Each sample includes multiple features: messages (a list of messages with content and role fields to record interaction content), ground_truth (the true answer or target), dataset (identifier for the source dataset), env_config (a structure for environment configuration, including env_name, image, and task_id), and source (identifier for the data source). In terms of dataset scale, the training split contains 14,601 samples with a total size of approximately 66MB. The dataset is licensed under ODC-BY and is intended for research and educational purposes, adhering to relevant responsible use guidelines. The data generation process and specific composition details are elaborated in related papers.

提供机构:
Allen Institute for AI
创建时间:
2026-06-19
原始信息汇总

数据集概述:TMax 15k - Open Instruct

基本信息

  • 数据集名称:TMax 15k - Open Instruct
  • 提供方:Allen Institute for AI (AllenAI)
  • 许可证:ODC-BY
  • 语言:英语 (en)
  • 数据集地址:https://huggingface.co/datasets/allenai/tmax-15k-open-instruct

数据集用途

该数据集用于训练 Tmax 9b 及其他 Tmax 系列模型,是一个包含约15k个强化学习(RL)环境实例的集合,数据格式适配于 open-instruct 框架。具体生成细节及构成请参考随附的论文。

数据规模

  • 训练集 (train):包含14,601个样本,占用约66.05 MB。
  • 数据集总大小:约66.05 MB。
  • 下载大小:约21.42 MB。

数据特征

每条数据包含以下字段:

字段名称 数据类型 说明
messages list of dict 消息列表,每条消息包含 content (字符串) 和 role (字符串)
ground_truth string 真实答案或参考标准
dataset string 数据集来源标识
env_config struct 环境配置,包含 env_name (字符串)、image (字符串)、task_id (字符串)
source string 数据来源

数据集版本与引用

  • 通用版数据集:另有一个更通用的版本,地址为:https://huggingface.co/datasets/allenai/TMax-15K
  • 引用:使用该数据集或模型时,请引用论文 Tmax: A simple recipe for terminal agents (Ivison et al., 2026)。

许可与责任

数据集遵循 ODC-BY 许可证,仅供研究及教育用途,并需遵守 Ai2 的《负责任使用指南》。数据中包含由 Gemini 3.1 Pro 生成的输出,这些输出受 Google 服务条款的约束。

搜集汇总
数据集介绍
tmax-15k-open-instruct 数据集图片
构建方式
TMax-15K-Open-Instruct数据集源自Tmax项目,专为训练终端智能体(terminal agents)而构建。该数据集通过在大规模强化学习环境中采样,收集了约1.5万个环境实例,并经过精心筛选与格式化,适配于Open-Instruct框架。每个样本包含多轮对话消息(messages)、真实答案(ground_truth)、数据集来源(dataset)、环境配置(env_config,包括环境名称、镜像及任务ID)以及数据源标签(source),以此确保数据覆盖多样化的任务场景与系统配置。
特点
该数据集的核心特色在于其以强化学习环境实例为核心,聚焦于终端代理的指令遵循与任务执行能力。数据记录保留了完整的交互历史,即消息序列中的角色与内容,使得模型能够学习上下文感知的决策过程。此外,环境配置字段提供了任务的具体运行参数,增强了数据的可复现性与可控性。数据集仅包含训练集,共计14,601条样本,规模适中但质量精良,旨在为终端智能体研究提供高价值的基础训练资源。
使用方法
本数据集适用于微调大语言模型以构建终端智能体,推荐与配套的Open-Instruct代码库结合使用。用户可直接加载train分区的数据,利用messages字段中的对话结构进行有监督微调,以ground_truth作为目标输出。环境配置信息可用于模拟或复现特定任务场景,便于评估模型在不同系统环境下的泛化能力。数据集遵循ODC-BY许可,适用于学术研究与教育目的,使用时需注明出处并遵守谷歌服务条款。
背景与挑战
背景概述
在人工智能领域,终端代理(Terminal Agent)的研究正逐渐成为大语言模型应用的前沿方向,其目标在于让模型具备在复杂命令行环境中执行多步任务的能力。TMax-15K-Open-Instruct数据集由Allen AI实验室的研究团队于2026年创建,核心研究人员包括Hamish Ivison、Junjie Oscar Yin、Rulin Shao等人,旨在解决大语言模型在终端交互场景下的指令跟随与任务规划问题。该数据集包含约15,000个强化学习环境实例,为训练TMax系列模型提供了高质量的监督微调数据。作为TMax研究计划的基础资源,该数据集推动了语言模型从静态文本理解向动态环境交互的范式转变,对终端自动化和智能运维领域产生了重要影响。
当前挑战
该数据集所解决的领域核心挑战在于,传统大语言模型缺乏对命令行环境状态变化的感知与适应能力,难以高效完成多步骤、依赖环境反馈的终端操作任务。在数据构建过程中,团队面临生成高质量、多样化的终端交互指令对的困难,需要确保指令的合理性与环境的真实反馈相匹配。此外,如何平衡数据规模与质量,避免模型过拟合特定终端场景,并设计可泛化的任务模板,也是构建该数据集时亟待克服的难题。这些挑战共同指向了推动语言模型在现实终端环境中实现可靠决策与持续学习的核心目标。
常用场景
经典使用场景
在终端智能体研究领域,tmax-15k-open-instruct 数据集被广泛用于训练基于指令的强化学习智能体。该数据集包含约1.5万个交互环境实例,专为开放式指令任务设计,使得研究者能够在模拟的终端环境中对模型进行微调,从而提升其在复杂、多步骤指令执行中的表现。其经典用法是将消息序列、真实执行结果与环境配置相结合,构建端到端的指令跟随训练管线,助力智能体理解环境状态并作出合理决策。
衍生相关工作
基于 tmax-15k-open-instruct 数据集,研究者衍生出了一系列经典工作,包括 Tmax 系列模型(如 Tmax 9b)和相关的开源微调工具。这些工作不仅验证了数据集在终端智能体训练中的有效性,还进一步探索了数据增强、多轮交互建模以及环境反馈融合等方向。相关的代码仓库和模型发布在 GitHub 和 HuggingFace 上,形成了完整的生态,为后续研究提供了可复现的基准和可扩展的框架。
数据集最近研究
最新研究方向
TMax-15k-Open-Instruct数据集聚焦于终端智能体(terminal agents)的强化学习环境构建,为前沿的Agentic AI研究提供了关键的训练数据支撑。该数据集包含约1.5万个RL环境实例,由Allen AI团队基于Tmax框架开发,旨在通过简化且有效的配方提升智能体在终端交互中的决策能力。近期,随着大语言模型与自主智能体融合趋势的加速,TMax系列模型及数据集因提出可扩展的终端任务学习范式而备受关注。其基于Gemini 3.1 Pro生成的高质量数据,结合开源指令微调框架,为探索智能体在真实环境中的执行、规划与纠错机制铺平了道路,对推动AI从对话式向行动式智能体的转型具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务