遇见数据集

terminal_bench_2_a1_issue_tasks_20260805_125430

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集包含4212个训练样本,每个样本包含多轮对话(conversations字段,由role和content组成),以及代理(agent)、模型(model)、模型提供方(model_provider)、日期(date)、任务(task)、轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等字段。数据集总大小约503MB,下载大小约290MB。

This dataset contains 4212 training samples. Each sample includes multi-turn conversations (conversations field, composed of role and content), as well as fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The total dataset size is approximately 503MB, with a download size of about 290MB.

提供机构:
LAION eV
创建时间:
2026-08-08
原始信息汇总

数据集概述

基本信息

数据集规模

  • 总大小:约503.2 MB(503,199,970字节)
  • 下载大小:约290.3 MB(290,297,561字节)
  • 数据划分:仅包含训练集(train)
    • 训练集样本数:4,212条

数据特征

每个样本包含以下字段:

字段名 数据类型 说明
conversations 列表(含role和content字段) 对话记录,role表示角色(如用户或助手),content为对话内容
agent 字符串 使用的智能体名称
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务类型
episode 字符串 回合/轮次编号
run_id 字符串 运行ID
trial_name 字符串 试验名称
result 字符串 任务结果
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据配置

  • 配置名称:default
  • 数据文件:位于 data/train-* 路径下,采用分片存储

数据类型

该数据集主要围绕终端(terminal)基准测试中的issue任务,包含多轮对话、智能体执行轨迹和结果验证信息,适用于评估和训练AI智能体在终端环境中的问题解决能力。

搜集汇总
数据集介绍
terminal_bench_2_a1_issue_tasks_20260805_125430 数据集图片
构建方式
在自主智能体与终端环境交互的研究脉络中,该数据集通过系统化采集智能体执行任务时的完整对话轨迹而构建。原始数据源自终端基准测试流程,每一实例均记录智能体在特定任务下的多轮交互,涵盖角色、内容、执行主体、模型标识、提供商、时间戳、任务描述、回合编号、运行标识、试验名称、执行结果、验证器输出及轨迹来源等字段。构建过程保留交互的时序结构与验证反馈,形成端到端的可追溯记录,为分析智能体行为提供细粒度素材,最终以训练集形式发布,包含四千二百一十二条样本,整体规模约五百零三兆字节。
特点
该数据集的核心特征在于其多维度的结构化标注与真实执行反馈的融合。每条样本不仅包含对话历史,还附带智能体类型、底层模型及其提供商信息,便于开展跨模型与跨主体的对比研究。结果字段与验证器输出共同构成对任务完成质量的客观刻画,而任务、回合与运行标识则支持对同一任务多次尝试的纵向追踪。轨迹来源字段进一步区分数据生成路径,增强数据溯源能力。整体数据以对话列表为主干,辅以丰富元数据,兼顾自然语言交互的复杂性与实验记录的可复现性。
使用方法
该数据集适用于智能体能力评估、交互策略分析及终端任务自动化等研究方向。研究者可加载训练集后,依据任务或模型字段筛选子集,提取对话序列以复现智能体决策过程,并结合结果与验证器输出量化任务成功率。借助运行标识与回合信息,可对同一任务的多轮尝试进行对比,考察智能体在错误纠正与策略调整方面的表现。模型与提供商字段支持跨模型性能比较,轨迹来源则有助于区分不同数据采集条件的影响。使用时需遵循数据字段的语义约定,确保分析结论与原始实验设置保持一致。
背景与挑战
背景概述
终端交互任务长期是智能体研究的难点,因其要求模型在真实命令行环境中理解模糊指令并执行多步操作。terminal_bench_2_a1_issue_tasks_20260805_125430数据集于2026年8月由相关研究团队发布,旨在为评估和提升大语言模型在终端环境下的问题解决能力提供标准化基准。该数据集收录了4212条训练样本,涵盖对话轨迹、智能体类型、模型来源及验证器输出等丰富元数据,核心研究问题在于衡量模型能否将自然语言任务描述准确转化为终端命令序列。其发布推动了自主智能体在软件工程、系统运维等领域的可复现研究,为后续终端交互基准的构建提供了重要参照。
当前挑战
该数据集所应对的领域问题在于终端任务执行的自动评估与泛化,传统基准多聚焦静态代码生成,难以捕捉动态环境中的探索、纠错与状态维护。构建过程中,研究人员需克服多轮对话轨迹的标准化采集、不同智能体与模型提供方的输出对齐,以及验证器对任务成功与否的可靠判定。此外,真实终端任务的长程依赖和不可逆操作使得奖励信号稀疏,如何设计兼顾公平性与区分度的评测协议亦构成显著挑战。数据规模与任务多样性之间的平衡同样考验着基准的覆盖能力和实用价值。
常用场景
经典使用场景
在自动化软件工程与智能体研究的交汇领域,该数据集构筑了一个以真实终端交互为脉络的任务执行语料库。其经典使用场景在于,将大规模语言模型驱动的智能体置于模拟命令行环境之中,令其依据自然语言描述的问题工单开展多轮诊断、文件操作与代码修复,并借助对话记录、执行轨迹及验证器输出,完整刻画智能体从问题感知到方案落地的全过程。
解决学术问题
针对智能体在长程任务中信用分配困难、终端操作序列评估缺乏细粒度标注等学术瓶颈,该数据集提供了带有验证反馈的多轮交互记录,使研究者得以剖析模型在命令生成、状态追踪与错误恢复等维度的表现,为可复现的智能体能力基准评测与强化学习策略优化奠定了数据基础。
衍生相关工作
围绕该数据集,已衍生出面向终端任务基准的方法学研究,包括智能体轨迹重放与验证框架、基于执行反馈的迭代式代码修复策略,以及面向多轮工具调用的长上下文建模工作,这些工作拓展了智能体在软件工程自动化领域的评测范式与算法边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务