遇见数据集

terminal_bench_2_tasktrove_dq_tulu3_personas_math_step13_30b_a3b_20260730_054033

收藏
Hugging Face2026-07-30 更新2026-08-01 收录
官方服务:

资源简介:

该数据集名为 terminal_bench_2_tasktrove_dq_tulu3_personas_math_step13_30b_a3b,是一个从Iris强化学习运行中导出的OpenCode智能体轨迹数据集。数据集包含了智能体在数学任务上的交互对话记录,覆盖了完整的试验过程。每条数据包含智能体与环境的对话(conversations字段,包括角色和内容)、智能体标识(agent)、使用的模型(model及model_provider)、日期(date)、任务描述(task)、试验编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、指令(instruction)以及验证器输出(verifier_output)。数据集共包含15,651个训练样本,总大小约118MB。所有生成了result.json的试验均被收录,缺失的89个试验因未完成可评分的片段而未包含。该数据集适用于强化学习、智能体行为分析、数学推理等任务的研究。

This dataset is named terminal_bench_2_tasktrove_dq_tulu3_personas_math_step13_30b_a3b, an OpenCode agent trajectory dataset derived from an Iris reinforcement learning run. It contains interactive dialogue records of agents on mathematical tasks, covering the complete trial process. Each entry includes conversations between the agent and environment (conversations field with role and content), agent identifier (agent), model used (model and model_provider), date, task description (task), trial number (episode), run ID (run_id), trial name (trial_name), result, instruction, and verifier output (verifier_output). The dataset contains 15,651 training samples with a total size of approximately 118MB. All trials that generated result.json are included; the missing 89 trials were not included because they did not complete a scorable segment. This dataset is suitable for research in reinforcement learning, agent behavior analysis, mathematical reasoning, and other tasks.

提供机构:
LAION eV
创建时间:
2026-07-30
原始信息汇总

数据集概述

该数据集名为 terminal_bench_2_tasktrove_dq_tulu3_personas_math_step13_30b_a3b,来源于一次名为 rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260727-143750-b2bcd7 的 Iris 强化学习运行,从该运行的 Harbor 的 trace_jobs 工件中导出(每个 trial 的最后一个 episode)。

数据规模

项目 数量
trial 目录总数 15,740
具有 result.json 的 trial 数 15,651
数据集行数 15,651

覆盖完整:所有 trial 目录均被枚举,每个产生 result.json 的 trial 均包含在内。89 个没有 result.json 的 trial 因未完成可计分 episode 而未贡献行。

注意:该数据集早期版本仅含 255 行,基于部分本地镜像构建,现已被完整导出版本取代。

数据特征

每条记录包含以下字段:

  • conversations:对话列表,包含 content(字符串)和 role(字符串)
  • agent:智能体标识(字符串)
  • model:模型名称(字符串)
  • model_provider:模型提供方(字符串)
  • date:日期(字符串)
  • task:任务(字符串)
  • episode:episode 编号(字符串)
  • run_id:运行 ID(字符串)
  • trial_name:trial 名称(字符串)
  • result:结果(字符串)
  • instruction:指令(字符串)
  • verifier_output:验证器输出(字符串)

数据划分

  • 训练集 (train):15,651 条样本,占用 118,065,300 字节(约 112.6 MB)
  • 数据集总大小:118,065,300 字节
  • 下载大小:113,630,521 字节

数据文件路径为 data/train-*

搜集汇总
数据集介绍
terminal_bench_2_tasktrove_dq_tulu3_personas_math_step13_30b_a3b_20260730_054033 数据集图片
构建方式
本数据集源自Iris强化学习运行`rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260727-143750-b2bcd7`,完整导出了该次运行中Harbor `trace_jobs`产物内的所有OpenCode智能体轨迹,每试验保留最终可评分回合。数据构建过程对数以万计的试验目录进行逐一遍历与枚举,凡生成`result.json`的试验均被收录,而未产生该文件的试验因从未完成可计分回合而未纳入数据行,由此确保覆盖率的绝对完整。该数据集取代了先前仅含255行的部分镜像版本,转由全量导出重建,共整合15,651条记录,每一行对应一个完整试验轨迹及其伴随的元数据。
使用方法
使用时,可直接通过HuggingFace数据集加载接口读取`train`分割,该分割包含全部15,651条记录,数据文件格式为Parquet,支持流式或全量加载。研究者可依据`task`字段进行任务筛选,依据`episode`与`trial_name`追踪特定试验,或利用`conversations`结构重建智能体与环境交互的完整序列。`verifier_output`字段可用于检验结果正确性,`result`字段便于快速获取试验最终状态。该数据集适用于智能体行为分析、模板策略评估、以及作为微调或偏好对齐的语料来源,但需注意其源于特定运行,可能包含环境固有偏差。
背景与挑战
背景概述
此数据集源自Iris强化学习实验,由Qwen3-Coder-30B架构的模型在数学推理任务上生成,捕捉了OpenCode智能体在终端环境中的轨迹。创建于2026年,由研究团队在强化学习框架下产出,旨在探讨大规模语言模型在多步数学问题求解中的行为模式与优化路径。该数据集完整覆盖了实验中的15,651次可评分回合,为理解智能体决策过程、验证强化学习策略的有效性提供了宝贵资源,对推动交互式代码生成与数学推理的交叉研究具有重要影响。
当前挑战
该数据集面临的挑战主要体现在两方面。其一,领域问题层面,数学推理任务要求模型具备逻辑连贯性与计算准确性,而终端环境引入的交互复杂性加剧了策略探索的难度,如何从轨迹中提炼泛化性强的智能决策模式是一大难题。其二,构建过程方面,从15,740个试验目录中仅成功导出15,651条记录,存在89个未完成评分回合的试验,数据不完整可能引入偏差,如何确保数据质量与代表性成为关键。此外,数据规模的扩展与早期版本的一致性维护也构成了技术挑战。
常用场景
经典使用场景
该数据集为基于终端交互的智能体轨迹数据集,其核心应用场景在于强化学习与模仿学习框架下的智能体行为训练与评估。研究者可依托此数据集中丰富的多轮对话记录、指令映射及任务执行结果,构建智能体的策略网络,探索在复杂终端环境中决策制定的优化路径。数据集的完整覆盖特性,即所有成功执行的任务均被纳入,确保了训练样本的全面性,为验证智能体在真实终端操作中的泛化能力提供了坚实基础。
解决学术问题
此数据集专注于解决终端环境中智能体长程规划与稀疏奖励学习难题。通过在轨迹数据中刻画动作序列与最终结果间的因果链路,它助力研究者剖析智能体在试探性行为中的策略演化,进而推动基于过程监督的奖励建模研究。其完备的轨迹记录还将基准测试从静态任务集推进至动态交互层面,为评估智能体适应性与鲁棒性提供了新维度,对深化强化学习在命令执行领域的理论认识具有重要价值。
实际应用
在实际应用层面,该数据集可服务于自动化运维、智能命令行助手及软件开发辅助工具。通过训练智能体理解自然语言指令并映射至终端操作序列,能够实现系统配置、故障排查及批处理任务的自动化,进而提升IT运维效率。数据集中涵盖的多样化任务场景,为构建面向企业的智能终端交互产品提供了高质量训练语料,有助于降低人工干预成本并增强操作规范性。
数据集最近研究
最新研究方向
该数据集聚焦于利用强化学习(RL)优化开源代码智能体的决策过程,其核心在于通过大规模轨迹数据训练模型以提升在复杂终端环境中的任务执行能力。最新研究趋势显示,研究者正从静态指令跟随转向动态多步推理,强调模型在真实世界编程任务中的自主探索与纠错机制。此数据集完整收录了15,651次执行轨迹,覆盖了任务失败与成功案例,为分析多轮交互中的策略收敛、奖励稀疏性问题提供宝贵资源。其影响力在于推动代码生成模型从基准测试向可部署代理演进,促使RL算法更注重长程依赖与工具调用能力,对自动化软件工程和智能运维领域具有前瞻性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务