遇见数据集

terminal_bench_2_a1_staqc_20260808_162054

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

该数据集包含4087个训练样本,每个样本记录了一次多轮对话轨迹。对话以列表形式存储,每个对话回合包含角色(role)和内容(content)。此外,每个样本还附带了agent标识、使用的模型名称、模型提供商、日期、任务描述、episode编号、运行ID(run_id)、实验名称(trial_name)、最终结果(result)、验证器输出(verifier_output)以及轨迹来源(trace_source)。数据集可用于训练或评估对话代理、多轮对话系统、任务型对话模型,以及分析agent决策过程。

This dataset contains 4087 training samples, each recording a multi-turn dialogue trajectory. The dialogue is stored as a list, with each turn containing a role and content. Additionally, each sample includes agent identifier, model name, model provider, date, task description, episode number, run ID, trial name, final result, verifier output, and trace source. The dataset can be used for training or evaluating dialogue agents, multi-turn dialogue systems, task-oriented dialogue models, and analyzing agent decision processes.

提供机构:
LAION eV
创建时间:
2026-08-10
原始信息汇总

数据集概述

该数据集名为 laion/terminal_bench_2_a1_staqc_20260808_162054,由 LAION 发布,主要面向终端(Terminal)交互场景的评测基准(Benchmark),记录智能体(Agent)在终端任务中的多轮对话与运行结果。

基本信息

  • 数据集地址:https://huggingface.co/datasets/laion/terminal_bench_2_a1_staqc_20260808_162054
  • 数据集大小:约 854 MB(dataset_size: 854,430,413 字节)
  • 下载大小:约 287 MB(download_size: 287,554,265 字节)
  • 数据划分:仅包含 train 分割,共 4,087 条样本

数据字段

每条样本包含以下字段:

字段名 类型 说明
conversations 列表(包含 rolecontent,均为字符串) 多轮对话记录,role 代表角色(如用户/助手),content 为对话内容
agent 字符串 智能体名称或标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供商
date 字符串 记录日期
task 字符串 任务描述或标识
episode 字符串 回合编号
run_id 字符串 运行标识符
trial_name 字符串 试验名称
result 字符串 任务结果(如成功/失败)
verifier_output 字符串 验证器输出,用于结果校验
trace_source 字符串 追踪来源(trace 的文件源)

数据格式与配置

  • 数据集包含一个默认配置(config_name: default
  • 数据文件存储于 data/train-* 路径下(支持分片读取)
  • 数据格式为 Hugging Face Datasets 的标准格式,可直接加载使用

用途说明

该数据集适用于:

  • 终端环境下的智能体任务评测
  • 多轮对话建模与终端指令执行分析
  • 验证模型在真实终端操作中的表现(基于 verifier_outputresult 字段)
  • 分析不同模型、提供商、日期及任务类型的运行差异

注意:数据集仅划分了训练集,未提供其他分割(如验证/测试)。数据集中没有图像、音频等多模态内容,全部为文本型结构化数据。

搜集汇总
数据集介绍
terminal_bench_2_a1_staqc_20260808_162054 数据集图片
构建方式
该数据集源自终端智能体在复杂任务执行过程中的交互记录,通过系统化采集多轮人机对话、智能体行为轨迹及环境反馈信息构建而成。每条样本包含完整的对话历史、智能体标识、模型信息、任务描述及执行结果,并辅以验证器输出与追踪溯源字段,形成结构化、可复现的实验数据基础。
特点
数据集规模宏大,训练集含4087个实例,数据量达854MB,涵盖多智能体、多模型、多任务的执行场景。其独特之处在于每份样本均附带完整的执行元数据,如会话标识、运行编号及试验名称,便于细粒度分析与跨试验比对。此外,结果与验证器输出字段提供了客观的性能评估依据,增强了数据的科学性与可靠性。
使用方法
适用于训练与评估终端智能体的对话生成、任务规划与执行能力。研究者可基于conversations字段进行指令微调或上下文学习,利用result与verifier_output字段构建奖励模型或进行强化学习。同时,任务与智能体元数据支持分层抽样或跨域泛化实验,为智能体行为分析、人机协作优化及鲁棒性测试提供坚实的数据支撑。
背景与挑战
背景概述
该数据集名为terminal_bench_2_a1_staqc_20260808_162054,创建于2026年8月8日,由A1团队基于STaQC项目构建。其核心研究问题聚焦于终端环境下的智能体任务执行与对话交互,旨在通过结构化记录agent在终端操作中的多轮对话、任务轨迹及验证结果,推动终端自动化与人工智能代理的实证研究。数据集包含4087个训练样本,每样本涵盖角色对话、Agent标识、模型信息、任务定义、运行参数及验证输出等丰富元数据,为终端智能体的行为分析、性能评估及策略优化提供了标准化的基准资源,对自然语言处理与人机交互交叉领域具有重要参考价值。
当前挑战
该数据集面临的挑战多维且显著。首先,在领域层面,终端环境中的任务执行具有高度动态性和复杂性,涉及命令解析、错误恢复及多步骤规划,现有模型难以实现鲁棒泛化;数据集的构建需克服采集真实终端交互日志的隐私风险与噪声干扰,确保对话与轨迹的时序一致性和语义完整性。其次,构建过程中,海量原始数据的清洗、去重及标注需协调专业标注者与自动化工具,以保障4087样本的高质量,同时管理854MB存储规模下的数据版本控制与高效加载,以及跨模型、跨任务的可比性,对评估协议的标准化提出严苛要求。解决这些挑战,对终端智能体的可靠部署与评估至关重要。
常用场景
经典使用场景
该数据集作为终端交互代理(terminal agent)的基准测试集,其核心使用场景在于评估和比较各类大语言模型(LLM)驱动的智能体在复杂命令行环境中的任务执行能力。通过记录完整的会话序列、代理配置及执行结果,研究者可系统性衡量模型在真实终端操作中的规划、工具调用和错误恢复能力。其丰富的元数据(如task、episode)支持细粒度的性能剖析,适用于监督微调、少样本学习及强化学习等训练范式的数据支撑,是构建鲁棒终端代理的关键资源。
实际应用
在实际应用中,该数据集加速了智能运维(AIOps)和自动化软件开发工具的落地。基于此数据集训练的终端代理,能够被部署于云服务器管理、CI/CD流水线故障排查、自动化软件测试等场景,显著减轻工程师的重复性操作负担。其记录的轨迹数据还可用于构建智能助手,帮助用户通过自然语言指令完成文件操作、环境配置等任务,提升开发效率和运维响应速度,具有直接的工业应用价值。
衍生相关工作
该数据集的发布催生了多个方向的相关研究。一方面,它激发了针对终端交互的强化学习环境构建工作,如将数据集转换为交互式模拟器,用以训练更智能的决策模型;另一方面,其对话结构促进了多轮工具调用和记忆机制的研究。此外,基于其多智能体配置,衍生出关于代理协作和竞争策略的探索,以及与安全对齐相关的工作,确保终端代理行为符合人类规范。这些衍生工作共同丰富了LLM智能体的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务