遇见数据集

terminal_bench_2_a1_nebius_swe_agent_20260809_063104

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条对话由角色(role)和内容(content)组成。此外,每条记录还附带了与对话生成过程相关的元数据,包括:代理名称(agent)、模型名称(model)、模型提供方(model_provider)、日期(date)、任务类型(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集规模为训练集共4239个样本,总大小约363MB。该数据集适用于研究对话系统、代理行为分析、模型评估等任务。

This dataset contains multi-turn dialogue records, each consisting of a role and content. Additionally, each record includes metadata related to the dialogue generation process, such as agent name, model name, model provider, date, task type, episode number, run ID, trial name, result, verifier output, and trace source. The dataset has a training set of 4239 samples with a total size of approximately 363MB. It is suitable for research on dialogue systems, agent behavior analysis, and model evaluation.

提供机构:
LAION eV
创建时间:
2026-08-11
原始信息汇总

数据集概述:laion/terminal_bench_2_a1_nebius_swe_agent_20260809_063104

基本信息

数据规模

  • 分割(Split):仅包含 train 训练集
  • 样本数量:4,239 条
  • 数据格式:Parquet 文件(data/train-*

数据字段

该数据集包含以下13个字段:

字段名 类型 说明
conversations 列表(含 rolecontent 两个子字段) 对话记录,其中 role 为字符串表示角色,content 为字符串表示内容
agent 字符串 智能体名称或标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 回合或场景编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 任务结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据特点

  • 该数据集聚焦于**终端基准测试(Terminal Bench)**场景,具体为 a1_nebius_swe_agent 智能体在2026年8月9日的运行记录。
  • 数据包含完整的对话轨迹(conversations)、智能体配置信息(模型、提供方)、任务描述、运行结果及验证信息,可用于研究软件工程智能体(SWE Agent)在终端环境中的行为与表现。
  • 数据集格式为标准Hugging Face数据集结构,可直接通过 datasets 库加载使用。
搜集汇总
数据集介绍
terminal_bench_2_a1_nebius_swe_agent_20260809_063104 数据集图片
构建方式
该数据集源自终端基准测试(terminal_bench)的自动化智能体交互记录,由Nebius SWE Agent在特定运行周期内生成。其构建过程系统性地采集了智能体与终端环境的多轮对话轨迹,每条样本完整记录了角色、对话内容、执行代理、模型标识、提供方、日期、任务描述、运行批次、试验名称、执行结果、验证器输出及溯源信息。数据集以train分片形式组织,包含4239条实例,总存储容量约363MB,确保了数据规模与信息密度的平衡。
特点
该数据集的核心特色在于其多维度的结构化元数据与丰富的对话内容相结合,每一条记录不仅包含智能体与环境的自然语言交互,还附带了模型来源、任务定义、结果验证等多重信息。这种设计使得研究者能够细致剖析智能体在真实终端任务中的决策路径与行为模式。此外,数据集的来源标注与运行批次信息增强了数据的可追溯性,为深入分析不同模型在复杂环境下的性能边界提供了可靠依据。
使用方法
该数据集适用于多类研究与应用场景,尤其适合用于智能体行为分析、模型性能评估以及强化学习训练数据的构建。研究者可基于对话字段提取交互序列,结合任务与结果字段进行成功与失败案例的对比分析;亦可利用agent、model等元数据维度进行分组研究,探索不同配置对任务完成度的影响。数据集的JSON格式便于直接加载于主流机器学习框架,支持快速定制数据预处理器,满足个性化实验需求。
背景与挑战
背景概述
该数据集由Nebius团队于2026年8月9日创建,旨在评估和优化AI智能体在终端环境中的自主任务执行能力。其核心研究问题聚焦于多轮交互下的任务规划、命令调用与错误恢复机制,是软件工程自动化领域的重要基准资源。数据集包含4239个训练样本,记录了智能体在复杂shell环境中的完整操作轨迹,涵盖了从简单的文件操作到复杂的代码仓库管理等多类任务。作为终端智能体研究的开源贡献,该数据集为对比不同模型(如SWE-Agent)的鲁棒性和效率提供了标准化测试平台,对推动自主软件开发、系统运维等领域的智能体研究具有显著影响力,有望加速下一代人机协作工具的演进。
当前挑战
该领域面临的首要挑战是智能体在非结构化终端环境中的泛化能力,需应对指令歧义、工具异常及长上下文理解等复杂情形,而当前模型常在此类动态场景中表现不稳定。其次,数据构建过程也极具挑战,需在真实终端会话中精确捕捉多轮行为序列,同时平衡样本多样性与覆盖度,确保涵盖各类命令组合和错误修复路径,这要求在数据清洗与标注环节投入大量人工校验,以降低噪声和对齐不一致风险。此外,随着任务复杂度上升,如何客观评估智能体策略的次优性与安全性,并避免过度拟合于特定shell环境或任务分布,也是持续制约该数据集效用与推广的关键难题。
常用场景
经典使用场景
该数据集收录了Nebius SWE Agent在Terminal Bench 2.1评测环境中的完整交互轨迹,共计4239条会话记录,每条记录包含多轮对话、Agent身份、模型信息及任务执行结果。其经典使用场景聚焦于软件工程智能体(SWE Agent)的行为分析与性能评估,研究者可利用该数据集复现Agent在真实编程任务中的决策路径,评估不同模型(如代码生成、工具调用)在自动化软件开发流程中的鲁棒性。通过解析conversations字段中的角色与内容,可深入探究Agent在问题理解、代码修改、测试验证等环节的推理模式,为优化Agent的提示策略与工具调用机制提供实证基础。
实际应用
在实际应用中,该数据集可助力企业构建智能编程助手,通过分析Agent在真实终端环境中的操作序列,优化代码补全、错误修复及重构等功能的决策逻辑。同时,它可用于训练自动编程评估器,使评估模型能够基于过程性信号(如步骤效率、资源消耗)而非仅结果来打分,从而更精准地筛选优质Agent。此外,数据集中的多轮对话数据还可用于开发教学系统,模拟专家Agent的决策过程,辅助培养开发人员的调试与编程能力,或为CI/CD流水线中的智能体提供强化学习训练素材。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作。例如,利用其轨迹训练奖励模型,以预测Agent在后续步骤中的成功概率,从而改进搜索策略;或者通过对比不同模型的轨迹差异,开展模型鲁棒性与泛化能力的研究。此外,该数据集也被用于构建模拟环境,训练Agent学会高效利用终端命令,减少无效操作。部分工作还致力于从轨迹中提取可复用的子流程模板,用于加速相似任务的求解。这些衍生研究共同推动了自主软件工程领域的发展,使Agent从“能解决问题”向“高效解决问题”演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务