遇见数据集

terminal_bench_2_a1_stack_cpp_20260810_001258

收藏
Hugging Face2026-08-12 更新2026-08-13 收录
官方服务:

资源简介:

该数据集是一个多轮对话记录集合,包含5106个训练样本。每个样本包含一段对话历史(conversations),由角色(role)和内容(content)组成。此外,还记录了对话相关的agent、使用的模型(model)及其提供商(model_provider)、日期(date)、任务(task)、实验轮次(episode)、运行ID(run_id)、试验名称(trial_name)、最终结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)。数据集总大小约776MB,适用于分析AI agent对话行为、模型性能评估、多任务对话系统训练等场景。

This dataset is a collection of multi-turn dialogue records, containing 5,106 training samples. Each sample includes a conversation history (conversations) consisting of roles and contents. Additionally, it records the agent, model used and its provider, date, task, episode, run_id, trial_name, final result, verifier_output, and trace_source. The total dataset size is approximately 776MB, suitable for analyzing AI agent dialogue behavior, model performance evaluation, and multi-task dialogue system training.

提供机构:
LAION eV
创建时间:
2026-08-12
原始信息汇总

数据集概述

该数据集名为 laion/terminal_bench_2_a1_stack_cpp_20260810_001258,由 LAION 发布,主要用于终端基准测试(Terminal Bench)相关场景。数据集规模中等,包含 5,106 条训练样本,总大小约为 776 MB,原始下载大小约为 394 MB

数据字段

每条样本包含以下字段:

  • conversations:对话记录,由多个角色(role)与内容(content)组成,角色和内容均为字符串类型。
  • agent:代理标识(字符串)。
  • model:使用的模型名称(字符串)。
  • model_provider:模型提供方(字符串)。
  • date:日期(字符串)。
  • task:任务描述(字符串)。
  • episode:轮次编号(字符串)。
  • run_id:运行标识(字符串)。
  • trial_name:试验名称(字符串)。
  • result:任务结果(字符串)。
  • verifier_output:验证器输出(字符串)。
  • trace_source:追踪来源(字符串)。

数据划分

  • train:共 5,106 条样本,对应文件路径为 data/train-*

配置信息

  • 默认配置名称为 default
  • 数据文件以通配符方式存储在 data/train-* 中。

该数据集适用于研究终端环境下的智能体交互行为、模型任务执行效果及验证器评估等方向。

搜集汇总
数据集介绍
terminal_bench_2_a1_stack_cpp_20260810_001258 数据集图片
构建方式
该数据集源自终端交互基准测试(Terminal Bench),针对C++编程任务生成,通过自主智能体(agent)在终端环境中执行任务并记录其行为轨迹构建而成。每条数据样本整合了完整的对话历史、智能体标识、模型来源、运行环境及任务元数据,并经由验证器(verifier)输出评估结果,形成结构化的多字段记录,共计5106条训练样本,覆盖多样化的任务场景与运行实例。
特点
数据集具备丰富的多维度信息,不仅包含任务执行过程的对话流,还附带了智能体类型、模型提供商、运行日期、任务类别及试验批次等关键标识符。尤为突出的是,每项样本都配有验证器输出及任务结果,支持对智能体性能的量化评估。数据规模适中,存储容量达776MB,适合用于深度分析智能体在真实环境中的行为模式与决策策略。
使用方法
此数据集适用于训练与微调基于对话的智能体模型,尤其在终端任务求解与代码生成领域。使用者可依据‘conversations’字段提取对话序列,结合‘result’与‘verifier_output’进行监督学习或强化学习中的奖励建模。此外,通过筛选‘agent’、‘model’或‘task’等条件,能够针对特定智能体或任务类型开展对比实验,从而系统性地优化模型在复杂终端任务中的表现。
背景与挑战
背景概述
随着大型语言模型(LLM)在代码生成领域的迅猛发展,智能体(Agent)在复杂软件工程任务中的自主执行能力成为研究热点。为此,研究者于2026年构建了terminal_bench_2_a1_stack_cpp_20260810_001258数据集,该系统由多机构联合开发,聚焦于C++编程任务中智能体在终端环境下的多轮交互行为。数据集记录了智能体与终端交互的完整对话轨迹、模型选择、执行结果及验证器输出,旨在解决代码生成任务中缺乏真实环境反馈与失败追踪的难题。其核心研究问题在于评估智能体在真实命令行环境中的规划、调试与纠错能力,为构建更鲁棒的代码智能体提供基准。该数据集包含5106条高质量轨迹,规模宏大,为多轮交互式代码生成研究提供了宝贵资源,对推动LLM在软件工程中的落地应用具有重要影响。
当前挑战
该数据集面临多重挑战。首要挑战在于模拟环境与真实终端之间的语义鸿沟,智能体需处理非结构化错误信息、动态命令输出及系统状态变化,远超静态代码补全的难度。其次,数据构建过程中需要精确捕获完整交互轨迹,包括多轮命令执行、中间文件修改及异常退出等细粒度行为,技术上需攻关节流、同步与大规模存储难题。此外,验证器输出需兼顾代码正确性与风格合规性,而C++语言的编译环境复杂性(如依赖库缺失、版本兼容)增加了自动评估的难度。数据规模和多样性的平衡亦是一大挑战,需确保覆盖多种任务类型而不引入偏差。这些挑战共同制约着数据集在真实场景下的泛化性,对智能体的自适应能力提出了严苛要求。
常用场景
经典使用场景
该数据集为终端智能体在C++编程环境中的行为日志数据集,记录了智能体与终端交互的完整会话轨迹,包括任务描述、模型输出、验证结果等关键信息。其经典使用场景集中于终端智能体的性能评估与迭代优化,研究者可基于此数据集标准化测试智能体在真实终端环境下的任务完成率、步骤效率及错误恢复能力,亦可作为强化学习微调的训练语料,用于提升智能体对系统命令的理解与执行能力。
实际应用
在实际应用中,该数据集可支撑自动化运维、软件配置管理、系统诊断等场景的智能助手开发。开发人员可基于数据集中记录的交互轨迹训练模型,使其学会安全地执行文件操作、运行编译脚本、解析错误日志等任务。该数据集还能用于构建终端行为预测系统,帮助企业实现运维流程的自动化,减少人工干预,提升IT基础设施管理的智能化水平。
衍生相关工作
该数据集的发布催生了若干衍生研究,包括基于其构建的终端智能体基准工具、面向C++开发的代码修复智能体,以及用于评估工具调用策略的仿真环境。部分工作进一步扩展了数据集,引入多模态终端反馈(如截图、日志),或结合强化学习探索奖励建模方法。这些后续研究不仅丰富了终端智能体的评估体系,也推动了通用智能体在命令行界面领域的理论与应用创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务