遇见数据集

terminal_bench_2_a1_toolscale_20260821_153653

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每个样本包含一个对话列表(conversations),其中每个对话带有角色(role,如用户或助手)和内容(content)。此外,每个样本还记录了代理名称(agent)、模型名称(model)、模型提供方(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集共包含6928个训练样本,适合用于对话系统训练、多代理交互分析、推理过程追踪或模型评估等任务。

This dataset contains multi-turn conversation records, where each sample includes a list of conversations (conversations), each with a role (e.g., user or assistant) and content. Additionally, each sample records agent name, model name, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset contains a total of 6928 training samples, suitable for tasks such as dialogue system training, multi-agent interaction analysis, reasoning process tracing, or model evaluation.

提供机构:
LAION eV
创建时间:
2026-08-23
搜集汇总
数据集介绍
terminal_bench_2_a1_toolscale_20260821_153653 数据集图片
构建方式
在终端智能体基准测试领域,轨迹数据的系统化采集对评估智能体工具调用能力具有关键意义。该数据集通过多轮交互式任务执行框架构建,每条样本记录智能体在指定任务下的完整对话序列,涵盖角色与内容字段,并同步采集智能体类型、底层模型及其提供方、执行日期、任务标识、回合编号、运行标识、试验名称、执行结果、验证器输出与轨迹来源等元数据。数据划分采用训练集单一划分,共包含6928条样本,原始字节规模约677.9MB,下载体积约543.2MB,形成结构化的轨迹语料,为后续分析提供可追溯的采集路径。
特点
该数据集以对话轨迹为组织核心,兼顾智能体行为与任务执行结果的双重记录,具有多维度标注与跨模型可比的特性。数据中同时保留智能体名称、模型名称及模型提供方,便于开展模型间横向对比与消融分析。验证器输出字段为每条轨迹提供自动化质量判定依据,支持对成功与失败案例的细粒度筛选。回合与试验标识使同一任务内的多次尝试可被区分,轨迹来源字段则增强数据溯源能力。整体体量适中,字段设计兼顾行为过程与结果评价,适用于智能体工具调用能力的诊断与评测。
使用方法
该数据集可通过HuggingFace datasets库直接加载默认配置,读取训练集后按字段进行过滤与分组分析。研究者可依据agent、model与model_provider字段实施分层比较,结合result与verifier_output字段筛选有效或失败轨迹,以评估不同模型在终端任务中的表现差异。conversations字段以列表形式存储多轮对话,可按role与content解析交互过程,用于行为模式挖掘或训练数据构造。task、episode与trial_name等标识支持对同一任务的多回合轨迹进行聚合分析,run_id与trace_source则可用于溯源与复现实验,整体适用于基准评测、误差分析与策略研究等场景。
背景与挑战
背景概述
终端环境下的智能体评测已成为衡量大语言模型工具调用与长程任务执行能力的关键途径。terminal_bench_2_a1_toolscale系列数据集由Terminal-Bench社区于2025年前后构建,聚焦于命令行交互场景中智能体的多轮决策与工具使用轨迹。该数据集以6928条训练样本记录智能体在终端任务中的完整对话、执行结果与验证器反馈,核心研究问题在于如何在真实、开放的命令行环境中系统刻画模型的规划、纠错与工具编排能力。其意义在于为智能体基准评测提供细粒度的过程性数据,推动终端自动化与可复现评测的发展。
当前挑战
从领域问题看,终端任务要求智能体在无结构化的命令行空间内完成文件操作、软件配置与脚本调试等长程目标,状态空间庞大且错误传播难以逆转,如何准确评估智能体的鲁棒性与泛化性成为核心挑战。在构建层面,该数据集面临多重困难:收集涵盖多种模型、智能体与运行提供方的轨迹需要统一接口与日志规范,验证器输出的可靠性依赖任务定义的严谨性,而大规模对话轨迹的去重、隐私过滤与结果标注亦带来显著成本。此外,不同试验设置下的可比性与可复现性仍需进一步保障。
常用场景
经典使用场景
在智能体与环境交互的研究范式中,终端操作任务长期缺乏大规模、标准化的评测基准。terminal_bench_2_a1_toolscale_20260821_153653数据集以对话轨迹为核心载体,汇集了涵盖多种智能体、模型及提供商的终端交互记录,为评估智能体在真实命令行环境中的任务执行能力提供了统一平台。其经典使用场景在于训练和测试智能体依据自然语言指令完成文件操作、进程管理、软件安装等终端任务,通过多轮对话与验证器输出形成闭环反馈,从而衡量智能体的规划、工具调用及错误恢复能力。
实际应用
在工业实践中,该数据集为自动化运维、持续集成与软件部署等场景提供了宝贵的训练与验证资源。开发团队可利用其中丰富的终端交互轨迹,微调或提示工程优化智能体,使其胜任服务器配置、日志排查、依赖管理等日常运维任务。同时,验证器输出字段为自动化质量保障提供了参照,有助于构建端到端的智能运维流水线。对于云服务提供商而言,该数据集还可用于评估不同模型在真实终端环境中的鲁棒性与安全性,从而指导模型选型与部署策略。
衍生相关工作
基于该数据集,学界与工业界已衍生出一系列经典工作。部分研究聚焦于智能体架构改进,提出基于记忆增强或反思机制的终端任务求解器,显著提升了长程任务的成功率。另有工作利用该数据集进行基准测试,发布了多个智能体在终端环境中的能力排行榜,推动了模型间的良性竞争。此外,围绕验证器输出与对话轨迹的细粒度分析,催生了针对智能体失败模式分类与错误归因的研究,为后续的鲁棒性增强与安全对齐提供了重要依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务