遇见数据集

terminal_bench_2_a1_toolscale_20260810_081852

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集包含多轮对话记录及相关元数据。每条样本包含一个 conversations 列表,其中每个对话条目由角色(role)和内容(content)组成,此外还记录了代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)。训练集共有7330个样本,总数据量约为740 MB。该数据集可用于对话系统、模型评估或代理行为分析等场景。

This dataset contains multi-turn dialogue records and related metadata. Each sample includes a conversations list, where each dialogue entry consists of a role and content. Additionally, it records agent name, model name, model provider, date, task, episode number, run ID, trial name, result, verifier output, and trace source. The training set contains 7330 samples with a total data size of approximately 740 MB. This dataset can be used for dialogue systems, model evaluation, or agent behavior analysis scenarios.

提供机构:
LAION eV
创建时间:
2026-08-22
原始信息汇总

数据集概述

基本信息

  • 数据集名称laion/terminal_bench_2_a1_toolscale_20260810_081852
  • 提供机构:LAION
  • 数据集大小:约 740.87 MB(下载大小约 588.03 MB)
  • 数据划分:仅包含训练集(train),共 7,330 条样本

数据结构

数据集包含以下字段:

字段名 类型 说明
conversations 列表 对话记录,包含角色(role)和内容(content)
agent 字符串 智能体标识
model 字符串 模型名称
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务描述
episode 字符串 会话轮次
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 执行结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据集特点

  • 对话格式:每条样本包含多轮对话,每轮对话记录角色(如用户、助手)及对应内容。
  • 元数据丰富:包含模型、任务、运行标识、结果验证等多维度信息,方便用于智能体轨迹分析、任务评估与模型微调。
  • 规模:训练集约 7,330 条,适用于中等规模实验。

适用场景

  • 智能体行为分析与评估
  • 多轮对话模型的微调与评测
  • 工具调用(ToolScale)相关任务的基准测试
  • 模型运行轨迹的追踪与分析
搜集汇总
数据集介绍
terminal_bench_2_a1_toolscale_20260810_081852 数据集图片
构建方式
该数据集立足于终端自动化交互与智能体能力评估的研究背景,通过运行多轮终端基准任务来采集智能体与环境之间的真实交互记录。构建过程以任务驱动的方式展开,让不同智能体模型在终端环境中执行预设任务,并由验证器对执行结果进行判定,从而生成包含对话内容、智能体标识、模型来源、执行日期、任务描述、回合信息、运行标识、试验名称、执行结果及验证器输出等字段的结构化数据。数据以对话列表形式保存每一轮的角色与内容,最终汇合为规模达七千余条样本的训练集,文件体积约七百四十兆字节,为终端场景下的智能体行为分析提供了可追溯的原始素材。
使用方法
该数据集可通过HuggingFace数据集加载接口直接读取,使用默认配置即可访问训练集全部样本。研究者可依据对话列表字段还原智能体在终端任务中的逐步交互过程,并结合智能体、模型与任务等元数据字段开展分组比较或行为分析。验证器输出与执行结果字段可用于评估任务完成质量,运行标识与试验名称则支持对同一任务的多次尝试进行配对研究。数据以对话格式组织,适合用于智能体能力评测、终端交互建模以及自动化任务流程分析等研究方向,亦可作为训练或微调终端场景智能体的素材来源。
背景与挑战
背景概述
终端操作作为智能体与环境交互的核心场景,长期缺乏标准化评测基准。terminal_bench_2_a1_toolscale_20260810_081852数据集于2026年由终端基准团队构建,汇集七千余条多轮对话轨迹,涵盖命令执行、文件编辑与系统调试等任务。该数据集聚焦智能体在真实终端环境中的工具调用与任务完成能力,通过验证器输出与运行标识实现细粒度评估,为终端智能体的行为分析提供了可复现的实验基础,推动了自主智能体基准测试领域的发展。
当前挑战
该数据集所应对的终端任务具有长程依赖与状态动态变化特性,智能体需在模糊指令下完成多步命令组合,并处理权限、路径与语法错误等复杂反馈。构建过程中面临的挑战包括:从异构终端会话中提取结构化轨迹、确保验证器输出与任务真值的一致性、以及平衡任务难度与样本多样性。此外,真实终端环境的交互噪声与非确定性输出,对数据清洗与标注规范提出了严苛要求,仍需后续研究在可扩展性与评估可靠性上持续优化。
常用场景
经典使用场景
在智能体与环境交互的研究范式中,该数据集承载了终端任务自动化执行与工具调用轨迹的完整记录。其经典使用场景聚焦于训练和评估语言模型在命令行终端环境中完成复杂多步操作的能力,具体涵盖文件系统管理、软件包安装、脚本编写与调试等典型运维任务。每条对话轨迹均包含智能体的推理步骤、工具调用指令及执行结果,为研究工具增强型语言模型的行为模式提供了高保真序列数据。
解决学术问题
该数据集有效回应了学术研究中关于长程任务规划与工具使用泛化性的核心挑战。传统基准多局限于单轮问答或静态环境,难以刻画动态终端反馈下的决策链。通过提供包含验证器输出和多次试验记录的结构化数据,它使研究者能够系统分析智能体在错误恢复、上下文维持及跨任务迁移方面的表现,为工具学习、强化学习与程序合成等领域的可复现研究奠定了数据基础。
实际应用
在实际应用中,该数据集支撑了自动化运维、智能编程助手及机器人流程自动化等场景的技术验证。开发者可利用其中丰富的终端交互轨迹,微调模型以执行服务器配置、日志分析或持续集成流水线中的指令序列。其包含的模型提供者与运行标识信息,便于在真实部署前横向对比不同架构智能体的任务完成率与执行效率,降低人工干预成本。
数据集最近研究
最新研究方向
在智能体与终端环境交互的基准评测领域,该数据集聚焦于工具使用规模扩展下的终端任务执行能力研究。当前前沿方向致力于探索大语言模型在复杂命令行环境中的多步推理与工具调用策略,通过记录对话轨迹、模型提供方、任务标识及验证器输出等多元信息,系统评估智能体在真实终端场景中的鲁棒性与泛化性。伴随自动化运维与自主编程智能体的兴起,此类基准为工具增强型语言模型的可复现评测提供了关键基础设施,推动了从静态问答向动态交互式问题求解的范式迁移,对智能体在软件工程、系统管理等领域的落地具有显著的支撑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务