terminal_bench_2_tasktrove_dq_unitsyn_python_step20_30b_a3b_20260730_014827
收藏资源简介:
TaskTrove DQ unitsyn-python 训练轨迹数据集(步骤 20,30B-A3B)记录了在训练 laion/tasktrove-dq-unitsyn-python-step20-30b-a3b 模型时,使用 SkyRL 从 Qwen/Qwen3-Coder-30B-A3B-Instruct 策略生成的 Terminus-2 agent 的 rollout 轨迹。每个数据行对应一个 trial 的最后一个 episode,包含完整的 agent 对话记录(包括推理过程和工具调用)、任务指令、标量奖励以及验证器输出。数据集包含 5977 行,覆盖 755 个不同的任务(如 unitsyn-python-0432),总对话轮次 136094,平均每行 22.8 轮,中位数 8 轮,范围 2-60 轮。奖励分布:2375 行奖励为 1.0(通过率 39.7%),3600 行奖励为 0.0,2 行因验证器超时失败。该数据集是完整导出,未经过子采样或过滤,并经过安全扫描确认无敏感信息泄露。适用于 agent 行为分析、强化学习训练轨迹研究、模型评估等任务。
The TaskTrove DQ unitsyn-python training trajectory dataset (step 20, 30B-A3B) records the rollout trajectories of Terminus-2 agents generated by SkyRL from the Qwen/Qwen3-Coder-30B-A3B-Instruct policy during the training of the laion/tasktrove-dq-unitsyn-python-step20-30b-a3b model. Each data row corresponds to the last episode of a trial, containing the complete agent dialogue (including reasoning process and tool calls), task instruction, scalar reward, and validator output. The dataset contains 5977 rows, covering 755 different tasks (e.g., unitsyn-python-0432), with a total of 136094 dialogue turns, an average of 22.8 turns per row, a median of 8 turns, and a range of 2-60 turns. Reward distribution: 2375 rows have a reward of 1.0 (pass rate 39.7%), 3600 rows have a reward of 0.0, and 2 rows failed due to validator timeout. The dataset is a complete export, without subsampling or filtering, and has been security-scanned to confirm no sensitive information leakage. It is suitable for agent behavior analysis, reinforcement learning trajectory research, model evaluation, and other tasks.
数据集概述
该数据集为 TaskTrove DQ unitsyn-python 训练轨迹数据集(step 20,30B-A3B),记录了使用 SkyRL 框架训练 Qwen/Qwen3-Coder-30B-A3B-Instruct 模型(对应 laion/tasktrove-dq-unitsyn-python-step20-30b-a3b)过程中的智能体(Terminus-2)完整交互轨迹。数据集以 Apache-2.0 许可证发布,属于文本生成任务类别。
数据规模与构成
- 总行数:5,977 行(训练集),每条记录对应一个试验(trial)的最后一个 episode
- 任务覆盖:755 个不同的任务
- 对话轮次:总计 136,094 个对话轮次,平均每行 22.8 轮,中位数 8 轮,范围 2 至 60 轮
- 奖励分布:2,375 行奖励为
1.0,3,600 行为0.0,2 行出现VerifierTimeoutError,通过率为 39.7% - 数据大小:数据集大小约 124 MB(下载大小约 94 MB)
数据字段
| 字段名 | 说明 |
|---|---|
conversations |
由 {role, content} 组成的对话列表;助手轮次包含 <think> 推理和 <tool_call> 工具调用块 |
instruction |
给智能体的任务指令 |
result |
标量奖励(字符串形式),或验证器失败时的异常名称 |
verifier_output |
验证器在该试验中的标准输出 |
task |
任务 ID,例如 unitsyn-python-0432 |
trial_name、run_id |
每次试验的唯一标识符 |
agent、model、model_provider、date、episode |
回滚元数据 |
数据覆盖与筛选
- 该数据集为运行的完整可导出试验集,并非样本。共包含 6,071 个试验目录,其中 6,068 个含有智能体轨迹,5,980 个含有
result.json(已评分),发布的行数为 5,977 行,占已评分试验的 99.95%。 - 有 3 个已评分试验因首次模型调用时出现
ContextLengthExceededError(上下文长度超出限制)而未产生数据行,其轨迹仅包含单个user步骤且无助手回复。 - 另有 88 个试验有轨迹但无
result.json,因在 episode 中途被截断且从未评分,被排除在外。 - 数据导出过程中未进行任何子采样、过滤或行数限制。
来源与安全扫描
- 数据来源于运行标识
rl-tasktrove-dq-sweep-30b-terminus2-qwen-20260725-163115-1ae770。 - 原始轨迹树(42,128 个文件,约 9.13 GiB)及每个分片的解码字符串单元均进行了安全扫描,未发现 JWT、AWS 访问密钥 ID、
sk-/hf_/gh*_令牌、PEM 密钥标记或 Iris 能力令牌等敏感信息。 - 该运行通过集群内 vLLM 直接地址提供服务,并使用占位凭证
fake_key,因此从未持有 Iris 代理端点密钥。
注意事项
奖励是针对仍在训练中的模型产生的(on-policy),因此通过率反映的是运行中途的策略状态,而非最终发布检查点的性能。




