遇见数据集

terminal_bench_2_a1_pr_mining_20260805_114333

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条记录由一系列对话轮次(conversations)组成,每个轮次包含角色(role)和内容(content)字符串。此外,每条记录还包含代理(agent)、模型(model)、模型提供者(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等字段。训练集共有2991个样本,总数据集大小约为300MB。

This dataset contains multi-turn dialogue records, each consisting of a series of conversation turns (conversations) with each turn containing a role (role) and content (content) string. Additionally, each record includes fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The training set has 2991 samples, and the total dataset size is approximately 300MB.

提供机构:
LAION eV
创建时间:
2026-08-08
原始信息汇总

数据集概述:laion/terminal_bench_2_a1_pr_mining_20260805_114333

基本信息

  • 数据集名称:terminal_bench_2_a1_pr_mining_20260805_114333
  • 所属机构:LAION
  • 数据集大小:约 300.25 MB(下载大小约 256.97 MB)
  • 数据分割:仅包含训练集(train),共 2,991 条样本

数据字段

该数据集包含以下字段:

字段名 类型 说明
conversations 列表 对话记录,包含 role(角色)和 content(内容)两个子字段
agent 字符串 智能体名称
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务描述
episode 字符串 回合编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据集用途

从数据集名称(terminal_bench_2_a1_pr_mining)和字段结构来看,该数据集主要用于:

  • 终端基准测试(Terminal Bench)场景
  • Pull Request 挖掘(PR Mining)任务
  • 评估和记录智能体在执行特定任务时的表现

数据格式

  • 数据文件路径:data/train-*
  • 数据格式为 Parquet 格式(由 data/train-* 路径模式推断)
  • 配置名称:default
搜集汇总
数据集介绍
terminal_bench_2_a1_pr_mining_20260805_114333 数据集图片
构建方式
在终端智能体基准测试领域,高质量交互轨迹的采集与结构化标注构成了模型能力评估的关键基础设施。本数据集以terminal_bench框架为依托,经由自动化代理在多样化的命令行任务中执行操作,完整记录每次会话的多轮对话内容、代理标识、底层模型及其提供方、执行日期、任务描述、回合编号、运行标识与试验名称等元信息。每条轨迹均附带结果判定与验证器输出,以trace_source字段标注轨迹来源,从而在保留原始交互语义的同时形成可追溯、可验证的样本集合,最终汇入统一的训练数据分片。
特点
该数据集面向终端环境下的智能体行为分析,具有鲜明的多维度特征。其样本以对话列表为核心载体,将角色与内容配对存储,忠实再现代理与终端之间的指令—反馈循环。数据规模达2991条轨迹,原始体量约300MB,涵盖不同代理架构、模型提供方与运行批次,具备良好的异质性。验证器输出与结果字段为每条轨迹提供质量标签,使研究者能够在真实任务语境下考察代理的决策路径与成败模式,也为错误分析与策略对比提供了细粒度依据。
使用方法
研究者可借助HuggingFace datasets库直接加载该数据集,通过train分片访问全部轨迹。加载后,可按task、agent、model或result等字段进行筛选与分组,以支持按任务类型或代理配置的对比实验。conversations字段可用于训练对话模型或行为克隆,verifier_output与result则适宜作为奖励信号或评估基准。结合run_id与trial_name,用户能够追溯单次运行的完整上下文,进而开展错误归因、轨迹可视化或代理策略的消融研究,为终端智能体的迭代优化提供实证基础。
背景与挑战
背景概述
随着自主智能体在软件工程领域的深入应用,终端环境下的多步任务执行成为评估其真实能力的关键场景。terminal_bench_2_a1_pr_mining_20260805_114333数据集于2026年8月构建,聚焦于从代码仓库的拉取请求中挖掘终端操作轨迹,旨在为智能体在真实终端交互中的行为建模提供细粒度监督信号。该数据集汇集了多种智能体与模型配置下的对话式执行记录,涵盖任务、回合、运行标识与验证输出等结构化信息,其核心研究问题在于如何从非结构化的终端会话中提炼可复用的决策模式。通过提供约三千条完整交互样本,该数据集为终端智能体的训练与评测建立了可复现的基准,对自动化软件维护与智能运维领域具有显著的推动作用。
当前挑战
该数据集所应对的领域问题在于终端环境下智能体长程决策的信用分配与鲁棒性评估,即如何在充满不确定性的命令行交互中判断每一步操作的因果贡献。构建过程中面临的挑战包括:从异构的拉取请求中提取标准化任务描述,需克服代码仓库间术语与工作流的显著差异;终端会话包含大量冗余输出与噪声,精准标注验证结果依赖对执行状态的深度解析;多智能体、多模型的轨迹混合引入分布偏移,增加了数据一致性与可比较性的维护难度。这些挑战共同构成了终端智能体研究中的核心瓶颈。
常用场景
经典使用场景
在自主智能体与终端交互的研究中,该数据集构筑了一个基于终端环境的多轮对话测评基准。其经典使用场景在于系统性地记录并评估智能体在模拟终端场景下执行任务的表现,通过对话历史、智能体类型、模型来源、运行结果及验证器输出等多维度字段,为研究者提供可复现的评测轨迹。此类场景常见于自动化代码修复、命令行工具调用及系统运维等任务,旨在检验模型在复杂终端环境中的推理与执行能力。
衍生相关工作
围绕该数据集,后续研究催生了一系列针对终端智能体评测的扩展工作。部分学者以此为基础,探索多智能体协作在终端任务中的分工机制,或引入更细粒度的状态追踪以增强可解释性。亦有工作将其与代码生成、工具学习等方向结合,构建跨领域的综合基准,进一步拓展了终端交互数据在智能体研究中的复用边界与影响力。
数据集最近研究
最新研究方向
在人工智能代理评估领域,基于终端环境的基准测试正成为衡量大模型实际工程能力的关键手段。terminal_bench_2_a1_pr_mining_20260805_114333数据集通过记录代理在终端任务中的完整对话轨迹、验证器输出及模型运行元数据,为解析代理的决策路径与失败模式提供了细粒度素材。当前相关研究聚焦于利用此类轨迹数据开展代理行为建模与自动化错误归因,以揭示模型在真实开发场景中的推理局限。该数据集的构建呼应了业界对可复现、可审计代理评测的迫切需求,其丰富的元数据字段有助于推动从静态问答评估向动态交互评估的范式迁移,对提升自主代理的鲁棒性与透明度具有基础性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务