遇见数据集

terminal_bench_2_a1_stack_selfdoc_20260803_154957

收藏
Hugging Face2026-08-07 更新2026-08-09 收录
官方服务:

资源简介:

该数据集包含1564个训练样本,每个样本由多轮对话(conversations)组成,其中每条对话记录包括角色(role)和内容(content)。此外,每个样本还带有代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等字段。数据集适用于多轮对话分析、AI代理行为评估、模型性能验证等任务,可能涉及问答、指令跟随或工具使用等场景。

This dataset contains 1564 training samples, each consisting of multi-turn conversations, where each conversation record includes role and content. Additionally, each sample is accompanied by fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset is suitable for tasks such as multi-turn conversation analysis, AI agent behavior evaluation, and model performance verification, potentially involving question answering, instruction following, or tool use scenarios.

提供机构:
LAION eV
创建时间:
2026-08-07
原始信息汇总

数据集详情:laion/terminal_bench_2_a1_stack_selfdoc_20260803_154957

基本信息

  • 数据集名称:terminal_bench_2_a1_stack_selfdoc_20260803_154957
  • 数据集提供方:LAION
  • 数据大小:数据集总大小约173.36 MB,下载大小约144.64 MB
  • 分割信息:仅包含训练集(train),共1,564个样本

数据特征

数据集包含以下12个字段:

字段名 数据类型 说明
conversations 列表(包含role和content两个子字段) 对话内容,其中role为字符串,content为字符串
agent 字符串 智能体信息
model 字符串 使用的模型
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务描述
episode 字符串 回合/场景编号
run_id 字符串 运行标识
trial_name 字符串 实验/试验名称
result 字符串 结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据配置

  • 配置名称:default
  • 数据文件路径:data/train-*(包含通配符匹配的多个文件)

要点总结

该数据集属于LAION发布的terminal_bench系列,聚焦于基于终端(terminal)的智能体基准测试任务,包含详细的对话轨迹、模型执行信息(如模型提供方、运行ID)、任务结果及验证信息(verifier_output),可用于研究智能体在终端环境中的任务执行与自我文档生成能力。数据集结构清晰,每个样本包含完整的对话记录及执行元数据,适合用于训练和评估终端操作相关的智能体模型。

搜集汇总
数据集介绍
terminal_bench_2_a1_stack_selfdoc_20260803_154957 数据集图片
构建方式
在终端智能体评测领域,高质量轨迹数据的稀缺制约着模型行为分析与能力评估。该数据集由自动化评测框架对多个终端任务执行轨迹进行采集,经由智能体在沙箱环境中与命令行界面持续交互,完整记录每一步对话内容与操作反馈。任务覆盖Stack等软件栈自文档化场景,每次运行生成独立轨迹并附加智能体名称、模型标识、提供方、日期、任务类别、回合编号及运行标识。所有轨迹由验证器进行程序化结果核验,将执行结果与验证器输出一并归档,最终形成结构化的对话序列集合,构成可直接用于分析的大规模轨迹语料。
特点
该数据集以对话序列为核心组织单元,将智能体行为、模型元信息与环境反馈紧密耦合。其显著特征在于轨迹的全过程留存,既包括智能体与终端之间的多轮交互内容,也涵盖模型来源、提供方、任务标识与回合信息等上下文属性。每条样本附带执行结果与验证器输出,为区分成功与失败轨迹提供客观依据。数据规模达到上千条示例,覆盖多种任务与多次试验,字段设计兼顾模型评测与行为追溯需求。轨迹来源标注进一步增强了数据可溯性,使不同智能体与模型间的横向比较成为可能。
使用方法
该数据集可通过标准数据加载接口直接读取,训练集划分文件已预置在仓库中,加载后即可获得包含对话、智能体、模型、任务与验证输出的完整记录。研究者可依据任务与回合字段筛选特定场景的轨迹,结合执行结果与验证器输出开展成功率统计、失败模式归因或行为差异分析。对话字段支持对智能体交互过程进行逐步解析,用于训练行为克隆模型或构建过程奖励信号。模型与提供方字段便于跨模型对比实验,trace_source字段可用于追溯原始评测来源,从而支撑终端智能体能力的系统评估与迭代改进。
背景与挑战
背景概述
终端智能体研究伴随大语言模型在代码生成与系统操作领域的渗透而兴起,其核心在于评估模型在真实命令行环境中的多步推理与执行能力。terminal_bench_2_a1_stack_selfdoc_20260803_154957数据集于2026年构建,汇聚了1564条智能体交互轨迹,涵盖对话、任务描述、模型来源、验证器输出及运行标识等多维字段,旨在为终端任务自动化提供可复现的基准。该数据集回应了智能体在动态环境中自我纠错与工具调用评估的迫切需求,其大规模轨迹记录为分析模型行为模式、验证器可靠性及跨平台泛化能力奠定了数据基础,对推动自主智能体在软件工程与运维场景中的落地具有参考意义。
当前挑战
该数据集所面对的领域问题在于终端环境的高度不确定性与长程依赖,智能体需在缺乏明确中间奖励的情况下完成文件操作、进程管理与依赖解析等多步任务,现有模型常因错误累积而偏离目标。构建过程中,轨迹采集需兼容异构模型与工具链,验证器输出与真实执行结果之间可能存在语义鸿沟,任务切片与运行标识的规范化亦增加了一致性维护的难度。此外,不同智能体框架的交互格式差异导致数据对齐复杂,如何确保验证信号在跨模型条件下保持客观与可复现,仍是该数据集在后续迭代中需持续应对的挑战。
常用场景
经典使用场景
在终端智能体研究领域,terminal_bench_2_a1_stack_selfdoc数据集通常被用于评估和训练基于大语言模型的命令行交互智能体。其经典使用场景聚焦于多轮对话形式的终端任务求解,其中每一条样本记录了智能体与用户或环境之间的完整对话历史,涵盖角色、内容、模型提供方、日期、任务标识、运行标识以及验证器输出等元数据。研究者借此构建可复现的评测管线,考察智能体在真实操作系统环境中的指令解析、命令生成、错误调试与状态追踪能力,从而将自然语言意图转化为精确的Shell操作序列。
实际应用
在工程实践层面,该数据集服务于自动化运维、智能编程助手和交互式终端代理等实际场景。开发团队可利用其中的对话与验证记录,微调或提示大语言模型以执行文件管理、软件部署、日志排查和版本控制等命令序列,减少人工干预并降低操作风险。同时,验证器输出为自动评判智能体行为是否正确提供了依据,使生产环境中的持续集成与回归测试成为可能,有助于在企业级工具链中部署可靠的终端自动化能力。
衍生相关工作
围绕该数据集,已衍生出一系列与终端智能体评测和训练相关的经典工作。研究者基于其对话结构开发了多轮交互基准与轨迹分析工具,用以比较不同模型提供方在命令生成任务上的表现差异。部分工作进一步利用验证器输出构建自动奖励信号,探索强化学习与拒绝采样在终端任务中的应用。此外,该数据集还启发了对智能体自我文档化与错误恢复策略的研究,推动了终端场景下评测协议与开源工具链的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务