遇见数据集

terminal_bench_2_a1_stack_bash_withtests_gpt5mini_20260808_235602

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条记录由以下字段构成:conversations(对话历史,包含role和content)、agent(代理标识)、model(模型名称)、model_provider(模型提供者)、date(日期)、task(任务描述)、episode(实验轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)以及trace_source(追踪来源)。数据集仅包含一个训练划分(train),共5,328个样本,总大小约420MB。

This dataset contains multi-turn conversation records, each consisting of the following fields: conversations (conversation history, including role and content), agent (agent identifier), model (model name), model_provider (model provider), date (date), task (task description), episode (experiment round), run_id (run ID), trial_name (trial name), result (result), verifier_output (verifier output), and trace_source (trace source). The dataset includes only a training split (train) with 5,328 samples, totaling approximately 420MB.

提供机构:
LAION eV
创建时间:
2026-08-10
原始信息汇总

数据集详情总结

基本信息

  • 数据集名称: laion/terminal_bench_2_a1_stack_bash_withtests_gpt5mini_20260808_235602
  • 所属机构: LAION
  • 数据集大小: 约 420 MB(420,131,854 字节)
  • 下载大小: 约 327 MB(326,751,648 字节)
  • 样本数量: 5,328 条(训练集)

数据划分

  • 训练集(train): 5,328 条样本,约 420 MB

数据特征

该数据集包含以下字段:

字段名 类型 说明
conversations 列表 对话记录,包含 role(角色)和 content(内容)两个子字段,均为字符串类型
agent 字符串 智能体名称
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务类型
episode 字符串 回合编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 执行结果
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据内容概述

  • 该数据集属于终端基准测试(Terminal Bench)系列,主要用于评估智能体在执行Bash命令行任务时的表现。
  • 任务类型涉及Stack相关操作,并包含测试环节(with tests)。
  • 使用的模型为 GPT-5 Mini(由模型提供方记录),数据集记录了智能体在终端环境中的完整对话交互、任务执行结果及验证器输出等信息。

数据格式

  • 数据文件路径:data/train-*
  • 数据格式为 Parquet(由 Hugging Face Datasets 默认格式推断),可按 Hugging Face 标准加载方式使用。
搜集汇总
数据集介绍
terminal_bench_2_a1_stack_bash_withtests_gpt5mini_20260808_235602 数据集图片
构建方式
该数据集是终端智能体领域的一项精心构建的成果,其核心在于利用集成了测试验证机制的Bash环境,对智能体在真实终端任务中的执行轨迹进行系统采集。数据构建过程依托于先进的GPT-5-mini模型,通过设计包含明确测试用例的复杂命令行任务,驱动智能体进行多轮交互,并完整记录对话历史、任务描述、运行参数及验证结果。每条样本均包含结构化的元数据,如智能体类型、模型标识、运行日期等,确保了数据的可追溯性与实验的严谨性。
特点
数据集在规模与质量上展现出显著优势,拥有5328个详尽样本,数据量达420MB,为终端智能体的训练与评估提供了坚实基础。其独特之处在于整合了基于测试的验证输出(verifier_output),为任务执行成效提供了客观基准。同时,数据集覆盖了多样化的任务类型与多轮对话历史,真实反映了终端操作的复杂性与挑战性。这种丰富而详实的结构,不仅支持深度上下文学习,还便于进行细粒度的行为分析与模型性能评估,是推动终端智能体研究迈向更高水平的宝贵资源。
使用方法
数据集以HuggingFace格式发布,内含统一的训练分割,默认配置即可直接加载。研究者可通过datasets库便捷获取数据,每条样本的丰富字段为多角度探究提供了便利。具体而言,可利用‘conversations’字段进行模型的指令微调或行为克隆,通过‘result’与‘verifier_output’字段开展强化学习中的奖励建模或智能体性能基准测试。此外,‘agent’、‘model’等元数据信息支持跨模型、跨配置的对比分析,有助于深入理解不同因素对终端任务执行的影响,从而推动终端智能体在自动化运维、软件开发等场景下的实际应用。
背景与挑战
背景概述
随着人工智能技术的飞速发展,智能体(Agent)在复杂任务执行与工具调用方面的能力日益受到关注。为评估和提升智能体在真实环境中的自主决策与操作能力,研究者们构建了多种基准测试集。该数据集名为'terminal_bench_2_a1_stack_bash_withtests_gpt5mini_20260808_235602',由研究人员于2026年创建,旨在通过模拟终端环境下的Bash命令操作,测试智能体在软件栈配置与测试执行等任务中的表现。数据集包含5328条对话记录,记录了智能体与环境的交互过程、执行结果及验证反馈。其核心研究问题聚焦于智能体在自然语言指令下的命令生成、错误修正与任务完成能力。自发布以来,该数据集为智能体在命令行环境中的能力评估提供了宝贵资源,推动了相关领域的研究进展,尤其在任务规划、工具调用与错误恢复等方向具有重要参考价值。
当前挑战
该数据集所解决的领域问题,即智能体在命令行环境中的自主任务执行,面临多重挑战:其一,Bash命令的多样性与语法复杂性要求智能体具备深厚的系统知识;其二,任务执行环境的高度动态性,包括文件系统状态变化与命令输出差异,增加了决策的不确定性;其三,验证任务完成情况的自动评估机制需精确衡量最终状态,而现有验证器可能无法覆盖所有正确解法。在数据集构建过程中,也遇到诸多困难:收集真实环境中多样化的任务实例需耗费大量人力资源进行标注;确保对话数据的自然性与代表性,需平衡指令清晰度与任务难度;此外,数据规模的扩大伴随注释成本的攀升,且需剔除无效或重复的交互记录,以保证数据质量与训练效率。这些挑战共同构成了该领域进一步发展的障碍。
常用场景
经典使用场景
该数据集聚焦于终端环境下的智能代理任务,其核心场景是评估和训练语言模型在Bash命令行界面中执行复杂操作的能力。数据集中包含了多轮人机对话记录、代理执行轨迹以及任务验证结果,为研究者在受控环境中模拟真实终端操作提供了丰富的语料。经典的使用方式是基于这些交互数据,构建强化学习或监督微调的基准,以提升模型在命令行推理、命令生成和错误修复等方面的性能。
解决学术问题
此数据集解决了自然语言处理与系统操作交叉领域中的关键学术难题,即如何量化评估语言模型在交互式终端任务中的规划与执行能力。传统静态基准无法捕捉动态环境中的决策过程,而该数据集通过记录完整的任务轨迹和验证结果,为研究提供了可复现的评估框架。它促进了关于模型泛化性、多步推理鲁棒性以及错误恢复机制的研究,推动了智能代理在真实命令行环境中的应用探索。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作,包括开发新的代理评估指标、提出灵巧的命令生成策略,以及设计结合反馈信号的学习算法。这些工作不仅加深了对语言模型在工具调用场景中能力的理解,还催生了多个开源工具包和基准测试集,如后续版本的任务难度分级系统和可扩展的模拟环境。这些衍生工作进一步推动了终端智能代理从实验室走向实际生产环境的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务