遇见数据集

terminal_bench_2_a1_pymethods2test_20260805_114335

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是一个多轮对话数据集,包含2672个训练样本。每个样本记录了一段对话过程,结构化为包含多个字段:对话历史(conversations)以角色(role)和内容(content)交替呈现;同时附带元数据如代理(agent)、模型(model)及提供商(model_provider)、日期(date)、任务(task)、对话轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)。该数据集适用于训练和评估对话系统、任务型对话模型或进行对话行为分析。

This dataset is a multi-turn dialogue dataset containing 2672 training samples. Each sample records a dialogue process, structured with multiple fields: conversation history (conversations) presented alternately by role and content; along with metadata such as agent, model, model provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. This dataset is suitable for training and evaluating dialogue systems, task-oriented dialogue models, or conducting dialogue behavior analysis.

提供机构:
LAION eV
创建时间:
2026-08-08
原始信息汇总

数据集概述

该数据集名为 laion/terminal_bench_2_a1_pymethods2test_20260805_114335,由 LAION 发布,是一个面向终端交互场景的基准测试数据集,其核心内容围绕“Python 方法到测试用例生成”任务展开。

数据集结构

数据集包含以下字段:

  • conversations:多轮对话列表,每条包含 role(对话角色)和 content(对话内容)。
  • agent:智能体标识。
  • model:模型名称。
  • model_provider:模型提供商。
  • date:数据日期。
  • task:任务类型。
  • episode:会话片段编号。
  • run_id:运行标识符。
  • trial_name:试验名称。
  • result:任务结果。
  • verifier_output:验证器输出。
  • trace_source:追踪来源。

数据规模

  • 总数据集大小:203,615,510 字节(约 194 MB)
  • 下载大小:173,023,489 字节(约 165 MB)
  • 训练集:包含 2,672 个样本,对应 203,615,510 字节数据

划分与格式

  • 仅提供 train 划分(无独立验证/测试集)。
  • 数据以 Parquet 格式存储,文件路径模式为 data/train-*
  • 默认配置名为 default
搜集汇总
数据集介绍
terminal_bench_2_a1_pymethods2test_20260805_114335 数据集图片
构建方式
在终端命令序列自动生成与验证的研究脉络中,该数据集依托Terminal Bench 2基准框架,通过Python方法调用与测试用例之间的映射关系构建任务集。数据采集自2026年8月5日的运行批次,利用自动化代理对每个任务发起多轮交互,完整记录对话历史、代理标识、模型名称及提供商信息。每个样本均经过独立验证器执行并输出结果字段,最终以2672个训练样本构成单一split,形成结构化对话与元数据并置的语料形态。
特点
数据集以对话序列为核心载体,同时保留代理类型、底层模型、任务标识、运行编号与试验名称等运行上下文,便于追溯不同代理配置下的行为差异。每个样本附带验证器输出与追踪来源字段,使交互过程与最终执行结果形成可对照的闭环。数据规模约2.03亿字节,涵盖多样化的终端操作场景,既包含模型生成的命令内容,也保留角色交替的对话结构,为分析终端任务中的推理与执行耦合关系提供细粒度记录。
使用方法
研究者可通过HuggingFace datasets库加载默认配置,读取train划分中的conversations字段以获取多轮对话文本,并结合agent、model与result等字段进行分组统计或条件筛选。该数据集适用于评估终端代理在Python方法调用与测试生成任务中的表现,亦可作为训练数据用于对话式命令生成模型的微调。使用时需注意验证器输出可作为质量参考,trace_source有助于区分数据采集渠道,从而控制分析范围。
背景与挑战
背景概述
终端任务自动化长期受制于真实交互环境的稀缺与评估标准的缺失,terminal_bench_2系列数据集的问世恰逢其时。该数据集由匿名研究团队于2026年8月构建,聚焦于将Python方法调用转化为测试用例的终端操作任务,涵盖2672条多轮对话轨迹,每条均附有代理、模型、验证器输出等元数据。其核心研究问题在于衡量大语言模型代理在真实终端环境中完成代码测试生成与执行的能力,为代理评估提供了可复现的基准。该数据集的影响力在于推动了终端交互式代理研究的标准化,为后续工作提供了细粒度的行为分析基础。
当前挑战
该数据集所面对的领域问题在于终端代理的测试生成任务本身具有高度开放性,要求代理理解方法语义、构造边界条件并执行验证,而现有基准多缺乏真实终端反馈。构建过程中的挑战同样显著:采集2672条轨迹需协调多种代理与模型配置,确保每轮对话与终端状态严格对应;验证器输出与最终结果的自动对齐需处理执行超时、环境差异和非确定性输出;此外,对话记录中隐含的隐式推理步骤难以完全结构化,给标注一致性带来困难。这些挑战共同构成了终端代理评估的复杂图景。
常用场景
经典使用场景
在自动化软件工程与智能体评估领域,该数据集通常被用于评估大语言模型在终端环境下的代码生成与调试能力。其经典使用场景聚焦于将自然语言描述的方法功能转化为可测试代码,并借助终端沙箱执行验证。模型需通过多轮对话与环境交互,逐步修正代码直至通过预设的单元测试,从而完整刻画智能体在真实开发工作流中的表现。
实际应用
在工业实践中,该数据集可用于训练与评测面向DevOps、自动化测试及低代码平台的代码智能体,帮助提升模型在真实终端环境中的可靠性与鲁棒性。其包含的对话、结果与验证输出可辅助构建代码审查、自动化错误诊断及交互式编程助手,从而降低软件开发中的人工调试成本,并加速从自然语言需求到可运行代码的转化流程。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作,包括面向终端交互的智能体框架、多轮代码修正策略以及基于验证器反馈的强化学习方法。这些工作进一步拓展了代码生成评测的维度,如引入更复杂的终端操作、多智能体协作与跨任务泛化测试,并为后续的软件工程智能体基准与工具链集成提供了重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务