遇见数据集

terminal_bench_2_a1_swegym_openhands_20260808_162055

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条记录由 conversations 字段(对话轮次列表,每轮标注角色和内容)、智能体名称(agent)、模型名称(model)及提供商(model_provider)、日期(date)、任务(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)组成。训练集共有 6719 个样本,总数据量约 579 MB。数据集可用于对话系统开发、智能体行为分析、模型评估与追踪等任务。

This dataset contains multi-turn conversation records. Each record consists of the conversations field (a list of dialogue turns, each turn annotated with role and content), agent name (agent), model name (model) and provider (model_provider), date (date), task (task), episode number (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The training set has 6719 samples, with a total data size of approximately 579 MB. The dataset can be used for dialogue system development, agent behavior analysis, model evaluation and tracking, etc.

提供机构:
LAION eV
创建时间:
2026-08-10
原始信息汇总

数据集概述

该数据集名为 terminal_bench_2_a1_swegym_openhands_20260808_162055,由 LAION 发布,旨在记录和评估 AI 智能体在终端环境中的任务执行轨迹。

数据集内容

数据集包含 6,719 条训练样本,每条样本记录了 AI 智能体在一次任务执行过程中的完整对话历史、任务信息与最终结果。具体字段如下:

字段名 说明
conversations 对话历史,包含角色(role)和内容(content)两部分
agent 使用的智能体标识
model 底层模型名称
model_provider 模型提供方
date 执行日期
task 任务描述
episode 回合编号
run_id 运行标识
trial_name 试验名称
result 任务结果
verifier_output 验证器输出
trace_source 轨迹来源

数据规模

  • 数据集总大小:约 579.8 MB(未压缩)
  • 下载大小:约 461.1 MB(压缩后)
  • 样本数量:6,719 条(训练集)

数据划分

该数据集仅包含一个 train 划分,数据文件存储在 data/train-* 路径下。

适用场景

该数据集适用于研究 AI 智能体在终端命令执行、软件开发任务(如 SWE-bench 类问题)中的行为模式、推理过程及任务成功率,可用于训练、评估或分析终端智能体的性能。

搜集汇总
数据集介绍
terminal_bench_2_a1_swegym_openhands_20260808_162055 数据集图片
构建方式
该数据集源于对终端交互环境中智能体行为的系统性采集与整理,旨在为基于大型语言模型的自主决策研究提供高质量的训练样本。构建过程中,研究人员利用SweGym模拟环境与OpenHands框架,引导不同配置的智能体执行大量软件工程任务,并详细记录了每一轮交互中的角色信息、对话内容、运行参数及最终结果。每条数据均附有模型标识、提供商、时间戳、任务编号、试验编号及验证器输出等元数据,确保了样本的可追溯性和可复现性。全部6719条样本经过结构化处理后整合为训练集,形成了一部涵盖多场景、多策略的终端操作行为语料库。
特点
数据集最显著的特点在于其深度整合了任务执行的全链路信息,从初始指令到智能体的中间思考、工具调用直至最终结果,均以多轮对话的形式完整呈现。这种细粒度的记录方式不仅捕捉了成功的操作路径,也囊括了探索性步骤和纠错过程,为研究模型在真实终端环境中的动态决策提供了珍贵素材。此外,每个样本附带丰富的上下文标签(如模型来源、运行批次和验证结果),使得该数据集支持多维度的条件筛选与特征分析,极大便利了不同模型架构、提示策略以及环境配置间的对比研究。其规模适中且格式统一,兼顾了数据多样性与计算可行性。
使用方法
使用这一数据集时,研究者可直接将其加载为标准的对话式监督微调格式,用于训练或评估模型在终端任务中的行为模仿与策略优化能力。借助样本中的'agent'、'model'及'result'等字段,可便捷地构造子集,以探究特定模型或成功案例的共性模式。同时,'verifier_output'字段为偏好学习提供了天然的比对信号,支持奖励建模或强化学习中的自动反馈机制。数据集的对话结构兼容主流开源训练框架,便于实施意图增强、多任务学习或上下文蒸馏等进阶方案。在应用过程中,建议依据任务类型进行分组训练,并利用时间戳信息考察模型性能的演变趋势,从而为终端智能体的迭代升级提供实证依据。
背景与挑战
背景概述
随着人工智能技术的飞速发展,特别是大型语言模型在复杂任务处理上的能力日益增强,如何系统地评估和提升这些模型在实际环境中的自主操作性能成为了研究热点。在此背景下,由SweGym与OpenHands等机构合作创建的‘terminal_bench_2_a1_swegym_openhands_20260808_162055’数据集应运而生,旨在提供一个标准化的基准测试平台,专注于终端交互场景下的智能体性能评估。该数据集于2026年8月创建,涵盖了6719个训练样本,记录了智能体与终端环境的完整对话轨迹、执行结果及验证者反馈,核心研究问题在于探索智能体在真实终端任务中的决策能力、工具使用效率及错误恢复策略。该数据集为衡量和比较不同模型在软件工程自动化、运维管理等领域的自主能力提供了重要参照,对推动智能体从对话式AI向行动式AI的跨越具有里程碑意义。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:终端操作任务涉及多步骤规划、动态环境反馈、工具调用准确性及异常处理,而现有模型在理解模糊指令、泛化至未见命令及长期任务连贯性方面仍显不足。其次,构建过程中亦遭遇诸多技术障碍,包括如何采集高质量的真实终端交互数据并确保多样性与代表性、如何设计合理的任务难度分级与验证机制以避免数据泄露或过拟合,以及如何处理不同运行平台和配置下的兼容性问题。此外,数据规模的控制与标注的准确性也是重要难点,需在保证数据量的同时维持语义标注的可靠性和一致性,从而为智能体训练与评估提供可信的基准。
常用场景
经典使用场景
该数据集是面向终端交互式代理(Terminal Agent)的多轮对话轨迹数据集,聚焦于软件工程环境中的终端命令执行与问题解决。经典使用场景包括训练和评估基于大语言模型的命令行代理,使其能够理解自然语言指令、生成并执行Shell命令、解析输出并迭代决策。研究者可借助该数据集进行监督微调(SFT)或强化学习(RL),以提升代理在真实终端环境中的任务完成能力,如自动化代码修复、系统配置管理等。数据集中包含的完整对话轨迹和验证结果,为构建鲁棒的终端交互策略提供了宝贵的训练资源。
实际应用
在实际应用中,该数据集可赋能自动化运维和开发者工具。例如,训练出的终端代理能够根据用户需求自动执行软件安装、环境配置、日志分析等常见任务,显著降低人工操作成本。在持续集成/持续部署(CI/CD)流水线中,代理可自主处理构建失败、依赖冲突等问题。此外,该数据集还可用于开发智能教学助手,通过在真实终端场景中的交互模拟,帮助新手学习命令行操作。其应用场景覆盖云服务管理、数据管道调试和系统监控等多个领域,具有广泛的落地价值。
衍生相关工作
该数据集衍生的相关经典工作包括构建更强大的终端代理模型、开发多任务学习框架以及探索代理的推理可解释性。例如,研究者可能基于此数据集微调Llama、Qwen等开源模型,形成专业的命令生成模型。同时,该数据集可催生终端交互中的安全对齐研究,如防止代理执行危险命令。此外,与之相关的基准测试(Benchmark)工作,如对比不同代理在任务完成率和资源消耗上的表现,也成为学术界关注的方向。这些衍生工作进一步推动了代码智能和自主代理领域的理论进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务