遇见数据集

terminal_bench_2_a1_nemo_prism_math_20260821_153041

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集是一个多轮对话训练集,包含 4025 个样本,每个样本记录了一次完整的对话交互过程。数据集中每条样本包含以下字段:conversations(对话历史,每轮对话由角色 role 和内容 content 组成)、agent(代理或助手名称)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务描述)、episode(轮次)、run_id(运行 ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)以及 trace_source(追踪来源)。该数据集适用于训练或评估对话代理、分析模型输出质量、验证对话结果等任务。数据仅提供训练集,格式为 Parquet 或类似结构,总大小约 543MB。

This dataset is a multi-turn dialogue training set containing 4025 samples, each recording a complete dialogue interaction process. Each sample in the dataset includes the following fields: conversations (dialogue history, each turn consisting of role and content), agent (agent or assistant name), model (model name), model_provider (model provider), date (date), task (task description), episode (episode), run_id (run ID), trial_name (trial name), result (result), verifier_output (verifier output), and trace_source (trace source). This dataset is suitable for training or evaluating dialogue agents, analyzing model output quality, verifying dialogue results, etc. The data only provides a training set in Parquet or similar format, with a total size of approximately 543MB.

提供机构:
LAION eV
创建时间:
2026-08-23
搜集汇总
数据集介绍
terminal_bench_2_a1_nemo_prism_math_20260821_153041 数据集图片
构建方式
该数据集源自Terminal Bench 2的智能体评测轨迹记录,构建过程围绕数学推理任务展开。系统在Nemo Prism框架下调度不同模型与智能体进行交互式解题,完整捕获每一轮会话中角色与内容的对应关系,并同步记录模型标识、服务提供方、执行日期、任务描述、回合编号、运行标识及试验名称等元信息。每次试验结束后,验证器对解答结果进行判定,输出结构化验证反馈,最终以对话历史为核心字段组织为统一的数据记录,形成规模为4025条样本的训练集。
特点
数据集以多轮对话为主要承载形式,完整保留智能体在数学任务中的交互轨迹,兼具行为数据与评测结论。每条样本不仅包含角色标注的对话内容,还附带模型来源、验证器输出与追溯来源等辅助字段,便于分析不同模型在相同任务上的表现差异。数据规模适中,覆盖多样化的数学问题与试验配置,为研究智能体推理过程、模型行为对比及验证机制提供了细粒度的观测基础。
使用方法
使用时可借助HuggingFace datasets库加载默认配置下的训练集,直接访问对话、模型、任务与验证器输出等字段。研究者可依据task或run_id对样本进行分组,比较不同模型在相同数学任务中的对话轨迹与验证结果;亦可提取conversations字段用于对话建模或推理过程分析,结合verifier_output评估解答正确性。该数据集适用于智能体行为分析、数学推理评测及对话策略研究等场景。
背景与挑战
背景概述
终端环境下的智能体评测已成为检验大语言模型工具调用与多步推理能力的关键场域。terminal_bench_2系列数据集源于对真实命令行交互场景的系统性采集,旨在记录智能体在解决数学与逻辑任务时的完整对话轨迹、执行结果与验证器反馈。该数据集由研究团队于2026年前后构建,核心研究问题在于如何在高自由度终端环境中客观评估异构模型与代理框架的任务完成质量。其汇聚多模型、多代理、多轮试验的轨迹数据,为分析推理稳定性、错误模式及验证机制提供了细粒度语料,对智能体基准测试方法学具有推动作用。
当前挑战
该数据集所对应的领域问题在于终端任务的开放式求解与自动化评判,其难点源于命令空间近乎无限、任务目标需从自然语言精确转化、多步操作之间存在强依赖与不可逆风险,单一错误即可导致整条轨迹失效。构建过程中的挑战体现为跨模型与代理框架的轨迹对齐、验证器输出与对话内容的语义一致性校验、海量运行日志的去重与质量筛选,以及在保留真实交互噪声的同时维持标注可靠性。此外,如何界定任务成功与部分成功的边界,并控制验证偏差对评测结论的干扰,仍是持续存在的难题。
常用场景
经典使用场景
在终端智能体与自动化任务执行的学术探索中,该数据集构筑了一个以命令行动作序列为核心的评测场域。每条样本完整记录了智能体在模拟终端环境下与文件系统、进程管理及开发工具交互的多轮对话,并附有可验证的结果与裁决输出。研究者借此可系统评估语言模型在多步操作、状态跟踪与错误恢复方面的综合能力,成为终端任务基准测试的典型素材。
衍生相关工作
围绕该数据集,后续研究催生了面向终端交互的智能体框架、基于验证器反馈的强化学习策略以及多轮工具调用基准的扩展工作。其轨迹数据结构被用于训练具备命令合成与自纠错能力的专用模型,并启发了任务分解与执行监控相结合的评估方法,逐步形成了以终端动作为中心、涵盖规划、执行与验证三阶段的系列经典研究脉络。
数据集最近研究
最新研究方向
在智能体与数学推理交叉领域,terminal_bench_2_a1_nemo_prism_math_20260821_153041数据集为评估终端环境下大模型的多步数学问题求解能力提供了细粒度轨迹资源。当前前沿研究聚焦于将强化学习与程序化验证器结合,利用该数据集记录的对话流、验证器输出及模型元信息,分析智能体在复杂符号运算与代码执行中的错误传播机制。围绕数学推理的可解释性与鲁棒性,热点方向包括基于执行轨迹的过程奖励建模以及跨模型提供商的泛化性比较,此举有助于推动自主智能体在真实终端场景中完成高精度数学任务,对教育辅助与自动化形式化验证具有显著影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务