遇见数据集

terminal_bench_2_a1_stack_bash_20260822_024512

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集包含6338个样本,每个样本记录了一次智能体交互的完整对话历史及相关元信息。每条样本由以下字段组成:conversations字段为对话列表,每条对话包含角色(role)和内容(content);agent字段标识智能体名称;model和model_provider分别记录使用的模型及其提供商;date字段记录日期;task字段标记任务类型;episode、run_id、trial_name用于追踪实验运行;result字段存储最终结果;verifier_output字段包含验证器输出;trace_source字段注明跟踪来源。数据集仅提供训练集拆分,总数据量约490MB,适用于分析智能体对话行为、模型性能比较或验证器效果评估等场景。

This dataset contains 6338 samples, each recording a complete dialogue history of an agent interaction along with related metadata. Each sample consists of the following fields: the conversations field is a list of dialogues, each containing role and content; the agent field identifies the agent name; model and model_provider record the model used and its provider respectively; the date field records the date; the task field marks the task type; episode, run_id, and trial_name are used to track experiment runs; the result field stores the final result; the verifier_output field contains the verifier output; the trace_source field indicates the trace source. The dataset provides only the training split, with a total data size of approximately 490MB, suitable for analyzing agent dialogue behavior, model performance comparison, or verifier effect evaluation.

提供机构:
LAION eV
创建时间:
2026-08-23
原始信息汇总

数据集概述:laion/terminal_bench_2_a1_stack_bash_20260822_024512

基本信息

  • 数据集名称:terminal_bench_2_a1_stack_bash_20260822_024512
  • 提供方:LAION
  • 数据集大小:约490.5 MB(下载大小约398.7 MB)
  • 训练集样本数量:6,338条
  • 数据格式:仅包含训练集(train split)

数据字段说明

字段名 数据类型 说明
conversations 列表(含role和content字段) 对话记录,role为角色(字符串),content为内容(字符串)
agent 字符串 代理标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 轮次/会话编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 执行结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据用途建议

该数据集包含对话记录代理信息模型信息任务描述执行结果等字段,适用于终端环境下的代理行为分析、多轮对话建模、以及基于bash/stack任务场景的智能体评估与训练。数据集规模适中(6,338条),适合作为细粒度终端交互任务的训练或验证数据。

搜集汇总
数据集介绍
terminal_bench_2_a1_stack_bash_20260822_024512 数据集图片
构建方式
该数据集源自终端任务自动化基准测试的持续评测实践,构建过程围绕智能体在交互式命令行环境中的行为轨迹展开。每条样本经由标准化任务配置驱动,由不同智能体与模型组合在受控环境中执行,并完整记录多轮对话、执行结果与验证器反馈。数据采集覆盖多种运行配置与重复试验,形成大规模轨迹集合,从而为终端场景下的智能体能力分析提供可复用的评测素材。
特点
数据集以对话序列为核心载体,同时整合智能体标识、模型来源、任务标识、回合编号、运行标识及试验名称等元信息,并保留结果字段与验证器输出,便于对执行成败进行溯源。其内容规模达六千余条样本,涵盖多样化的任务类型与执行轨迹,结构上兼顾过程性记录与结果性标注,为研究终端任务中的决策模式与错误类型提供了丰富的细粒度依据。
使用方法
该数据集可通过HuggingFace数据集加载接口直接读取默认配置下的训练划分,利用对话字段还原智能体的交互过程,并结合任务、模型与结果字段进行分组统计或筛选分析。研究者可据此评估不同智能体在终端环境中的表现差异,亦可提取验证器输出以构建自动化评判流程,从而服务于智能体能力诊断、轨迹回放及基准测试等应用场景。
背景与挑战
背景概述
终端任务自动化长期受制于真实交互轨迹的匮乏。terminal_bench_2_a1_stack_bash_20260822_024512数据集于2026年8月由相关研究团队构建,聚焦于命令行代理在bash环境中的任务执行过程,收录了6338条包含多轮对话、代理身份、模型来源、任务描述及验证器输出等字段的完整运行记录。其核心研究问题在于如何系统评估大语言模型在终端环境下的规划、命令生成与错误恢复能力。该数据集为终端代理的基准测试与行为分析提供了大规模、结构化的实证基础,对推动自动化运维与交互式编程研究具有显著影响力。
当前挑战
在终端智能体领域,核心挑战在于真实环境中命令执行结果的高度不确定性与长程依赖。该数据集需解决模型在动态文件系统、权限约束和异步输出下进行可靠决策的难题,同时须应对多轮交互中错误传播与状态追踪的复杂性。构建过程中面临轨迹采集的标准化困难,包括不同代理框架的日志格式差异、验证器输出的一致化对齐,以及大规模数据去重与质量筛选。此外,如何确保任务覆盖的多样性与难度分层,并保持模型行为记录的可复现性,亦是该数据集持续面临的挑战。
常用场景
经典使用场景
在终端智能体与自动化系统评测领域,该数据集呈现了面向命令行交互的智能体完整执行轨迹。每条数据记录涵盖对话流转、代理标识、底层模型及其提供方、任务描述、回合编号、运行标识、试验名称、任务结果、验证器输出以及轨迹来源等结构化字段,共收录6338个训练样本。其经典用法在于支撑对终端环境中智能体行为的细粒度剖析,例如通过多回合对话序列复现代理在Shell指令空间中的决策路径,并借由验证器输出判定任务完成质量,从而为交互式智能体评估提供标准化素材。
实际应用
在工程实践层面,该数据集可服务于终端自动化运维、命令行辅助工具开发以及智能体安全审计等场景。开发团队利用其中的对话与验证器输出构建回归测试集,检验智能体在文件操作、进程管理与网络配置等任务中的鲁棒性;运维人员亦可借助任务与结果字段分析典型失败模式,优化提示工程或工具调用逻辑。此外,轨迹来源与模型提供方信息有助于组织针对不同基础设施的成本效益分析,为部署决策提供数据支撑。
衍生相关工作
围绕该数据集已衍生出若干经典研究方向。一部分工作聚焦于终端智能体的基准构建,利用其任务与验证器输出设计标准化评测协议;另一部分则致力于轨迹挖掘与行为克隆,以对话和结果字段为监督信号训练更高效的命令生成模型。亦有研究关注多模型对比,通过模型提供方与代理字段揭示不同架构在长程任务中的优劣,并催生了针对验证器输出的可信度校准方法,持续拓展终端智能体研究的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务