terminal_bench_2_tasktrove_dq_unix_step10_30b_a3b_20260730_014756
收藏资源简介:
该数据集名为 terminal_bench_2_tasktrove_dq_unix_step10_30b_a3b,包含来自TaskTrove DQ基准测试中unix子任务的OpenCode agent轨迹。这些轨迹由Qwen3-Coder-30B-A3B模型在强化学习(RL)扫描过程中生成,并完整地从Harbor rollout artifact集中导出。数据集共有11937个样本(试验),每个样本对应一个episode,包含完整的agent交互记录。字段包括:conversations(ShareGPT格式的对话列表,包含角色和内容)、instruction(任务提示)、result(试验结果)、verifier_output(评分器输出,如有)、agent(智能体名称)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务)、episode(轮次)、run_id(运行ID)、trial_name(试验名称)等。数据经过红action处理,其中一条终端观察因包含RSA私钥而被替换为占位符,未删除任何行。该数据集适用于agent轨迹分析、任务完成评估、模型行为研究等场景。
The dataset named terminal_bench_2_tasktrove_dq_unix_step10_30b_a3b contains OpenCode agent trajectories from the unix subtask of the TaskTrove DQ benchmark. These trajectories were generated by the Qwen3-Coder-30B-A3B model during reinforcement learning (RL) scanning and were fully exported from the Harbor rollout artifact set. The dataset has a total of 11937 samples (trials), each corresponding to an episode containing complete agent interaction records. Fields include: conversations (list of dialogues in ShareGPT format with roles and content), instruction (task prompt), result (trial outcome), verifier_output (scorer output if any), agent (agent name), model (model name), model_provider (model provider), date (date), task (task), episode (episode number), run_id (run ID), trial_name (trial name), etc. The data has been redacted; one terminal observation containing an RSA private key was replaced with a placeholder, and no rows were deleted. This dataset is suitable for agent trajectory analysis, task completion evaluation, and model behavior research.
数据集概述:terminal_bench_2_tasktrove_dq_unix_step10_30b_a3b
该数据集记录了 TaskTrove DQ unix 分支 中,一个 Qwen3-Coder-30B-A3B 智能体在强化学习(RL)扫描过程中产生的完整智能体轨迹,数据来源于 Harbor 回滚工件集的完整导出。
数据规模与覆盖度
- 训练集:包含 11,937 条样本(行),每条对应一个完整的 episode。
- 数据集总大小:约 269 MB(下载大小约 188.6 MB)。
- 覆盖度:占所有评分子试验(scored trials)的 100%。
- 评分子试验总数:11,937(对应 12,034 个试验目录)。
- 排除说明:97 个缺失
result.json的试验因中途被截断、未获评分及验证输出而被排除。
数据字段
- conversations:ShareGPT 风格的对话消息列表(包含
content和role字段)。 - agent:智能体标识。
- model / model_provider:模型名称及其提供商。
- date:记录日期。
- task:任务标识。
- episode / run_id / trial_name:运行批次与试验标识。
- result:试验结果。
- instruction:任务提示(prompt)内容。
- verifier_output:评分器输出(如存在)。
数据组织
- 数据集仅包含 train 划分(数据路径:
data/train-*)。 - 每一行对应一个 episode;
conversations为对话消息列表,instruction为任务提示,result为结果,verifier_output为评分器输出。
数据修订说明
- 数据集对一条终端观测中的 RSA 私钥 进行了打码处理,以
[REDACTED PRIVATE KEY]替代(该密钥为智能体在证书生成任务中于自身临时沙箱内生成的)。 - 未删除任何行。
- 注:此前一个旧版本数据集仅包含 248 行(2.1%),因其基于仅镜像最近修改痕迹的本地证据包构建,已被当前版本替换。



