terminal_bench_2_tasktrove_dq_taco_step15_30b_a3b_20260729_222705
收藏资源简介:
Agent trace 数据集是从 OpenCode/Harbor 平台收集的 rollout 轨迹数据集,源自 MarinSkyRL 的一次强化学习运行(rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8)。该数据集包含了每个试验的最后一个 episode 的 rollout 轨迹,即策略训练所依赖的 rollout 数据。数据集共包含 21604 条训练样本,覆盖了 99.9% 的评分试验(总评分试验数为 21619)。每个样本包含以下字段:conversations(对话记录,每个条目包含 content 和 role)、agent(智能体标识)、model(模型名称)、model_provider(模型提供者)、date(日期)、task(任务描述)、episode(episode 编号)、run_id(运行ID)、trial_name(试验名称)、result(奖励字符串)、instruction(指令)、verifier_output(验证器输出)。该数据集可用于研究强化学习中的 rollout 轨迹、策略行为、奖励信号等,适合作为学术研究和工业实践的分析材料。
The Agent trace dataset is a rollout trajectory dataset collected from the OpenCode/Harbor platform, originating from a reinforcement learning run of MarinSkyRL (rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8). It contains the rollout trajectories of the last episode for each trial, i.e., the rollout data that the policy training relies on. The dataset comprises 21,604 training samples, covering 99.9% of the scored trials (total scored trials: 21,619). Each sample includes the following fields: conversations (dialogue records, each entry contains content and role), agent (agent identifier), model (model name), model_provider (model provider), date (date), task (task description), episode (episode number), run_id (run ID), trial_name (trial name), result (reward string), instruction (instruction), and verifier_output (verifier output). This dataset can be used to study rollout trajectories, policy behavior, reward signals, etc. in reinforcement learning, and is suitable as analysis material for academic research and industrial practice.
数据集概述
该数据集为 Agent trace dataset(代理轨迹数据集),记录了来自 MarinSkyRL 运行(rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8)的 OpenCode/Harbor 回放轨迹。
基本信息
| 属性 | 值 |
|---|---|
| 数据集名称 | laion/terminal_bench_2_tasktrove_dq_taco_step15_30b_a3b_20260729_222705 |
| 任务类型 | 代理轨迹数据(Agent Trajectory) |
| 训练集样本数 | 21,604 |
| 训练集大小 | 2,151,573,579 字节(约 2.15 GB) |
| 下载大小 | 1,423,635,052 字节(约 1.42 GB) |
| 数据分割 | train(单一分割) |
数据特征
数据集包含以下字段:
- conversations(对话列表):每个对话包含
content(字符串)和role(字符串)两个子字段 - agent:代理标识(字符串)
- model:模型名称(字符串)
- model_provider:模型提供方(字符串)
- date:日期(字符串)
- task:任务标识(字符串)
- episode:回合编号(字符串)
- run_id:运行标识(字符串)
- trial_name:试验名称(字符串)
- result:奖励结果字符串(字符串)
- instruction:任务指令(字符串)
- verifier_output:验证器输出(字符串)
数据来源与覆盖范围
- 数据构建自对象存储上的完整试验集,而非本地证据包
- 对象存储上的试验目录数:21,711
- 具有
result.json(已评分)的试验数:21,619 - 发布行数:21,604
- 对已评分试验的覆盖率达 99.9%
未包含 result.json 的试验因中途截断且从未被评分而被排除,它们不携带奖励或验证器输出。
数据导出方式
数据通过 make_and_upload_trace_dataset --episodes last 导出,选择每个试验的 最后一个回合(即策略训练所使用的回放数据)。
安全扫描说明
在发布前,每个数据分片都进行了秘密扫描,覆盖了解码后的字符串单元格,检查内容包括:JWT、AWS 访问密钥 ID、sk- / hf_ / gh*_ 令牌以及 PEM 私钥标记。
- 用于验证推理端点回放的 Iris 代理令牌在零分片中出现,这是结构性的保证——导出器仅读取
agent/trajectory.json、任务指令、奖励和验证器输出,从不读取config.json、exception.txt、agent/opencode.txt或完整的result.json(result列仅包含奖励字符串) - 四行包含类似秘密的字符串,均已单独检查,均非凭证,属于代理转录内容或任务提示内容,刻意保留以维持研究工件的完整性
| 分片 | 内容说明 |
|---|---|
train-00068 |
2019-06-05 过期的 HS256 JWT,来自任务中的抓取网页内容 |
train-00089 |
GitHub raw.githubusercontent.com 预签名资源 JWT(2026-07-27 过期);代理获取的公共 CDN URL |
train-00012 |
TACO 任务提示本身,展示示例密钥结构(主体省略)——不含实际密钥材料 |
train-00100 |
模型幻觉生成的密钥主体,位于对 Debian ssl-cert-snakeoil.key 占位符的编辑中——不是有效的 base64,行长度不规则,load_der_private_key 验证失败 |




