遇见数据集

terminal_bench_2_tasktrove_dq_taco_step15_30b_a3b_20260729_222705

收藏
Hugging Face2026-07-30 更新2026-08-01 收录
官方服务:

资源简介:

Agent trace 数据集是从 OpenCode/Harbor 平台收集的 rollout 轨迹数据集,源自 MarinSkyRL 的一次强化学习运行(rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8)。该数据集包含了每个试验的最后一个 episode 的 rollout 轨迹,即策略训练所依赖的 rollout 数据。数据集共包含 21604 条训练样本,覆盖了 99.9% 的评分试验(总评分试验数为 21619)。每个样本包含以下字段:conversations(对话记录,每个条目包含 content 和 role)、agent(智能体标识)、model(模型名称)、model_provider(模型提供者)、date(日期)、task(任务描述)、episode(episode 编号)、run_id(运行ID)、trial_name(试验名称)、result(奖励字符串)、instruction(指令)、verifier_output(验证器输出)。该数据集可用于研究强化学习中的 rollout 轨迹、策略行为、奖励信号等,适合作为学术研究和工业实践的分析材料。

The Agent trace dataset is a rollout trajectory dataset collected from the OpenCode/Harbor platform, originating from a reinforcement learning run of MarinSkyRL (rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8). It contains the rollout trajectories of the last episode for each trial, i.e., the rollout data that the policy training relies on. The dataset comprises 21,604 training samples, covering 99.9% of the scored trials (total scored trials: 21,619). Each sample includes the following fields: conversations (dialogue records, each entry contains content and role), agent (agent identifier), model (model name), model_provider (model provider), date (date), task (task description), episode (episode number), run_id (run ID), trial_name (trial name), result (reward string), instruction (instruction), and verifier_output (verifier output). This dataset can be used to study rollout trajectories, policy behavior, reward signals, etc. in reinforcement learning, and is suitable as analysis material for academic research and industrial practice.

提供机构:
LAION eV
创建时间:
2026-07-30
原始信息汇总

数据集概述

该数据集为 Agent trace dataset(代理轨迹数据集),记录了来自 MarinSkyRL 运行(rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8)的 OpenCode/Harbor 回放轨迹。

基本信息

属性
数据集名称 laion/terminal_bench_2_tasktrove_dq_taco_step15_30b_a3b_20260729_222705
任务类型 代理轨迹数据(Agent Trajectory)
训练集样本数 21,604
训练集大小 2,151,573,579 字节(约 2.15 GB)
下载大小 1,423,635,052 字节(约 1.42 GB)
数据分割 train(单一分割)

数据特征

数据集包含以下字段:

  • conversations(对话列表):每个对话包含 content(字符串)和 role(字符串)两个子字段
  • agent:代理标识(字符串)
  • model:模型名称(字符串)
  • model_provider:模型提供方(字符串)
  • date:日期(字符串)
  • task:任务标识(字符串)
  • episode:回合编号(字符串)
  • run_id:运行标识(字符串)
  • trial_name:试验名称(字符串)
  • result:奖励结果字符串(字符串)
  • instruction:任务指令(字符串)
  • verifier_output:验证器输出(字符串)

数据来源与覆盖范围

  • 数据构建自对象存储上的完整试验集,而非本地证据包
  • 对象存储上的试验目录数:21,711
  • 具有 result.json(已评分)的试验数:21,619
  • 发布行数:21,604
  • 对已评分试验的覆盖率达 99.9%

未包含 result.json 的试验因中途截断且从未被评分而被排除,它们不携带奖励或验证器输出。

数据导出方式

数据通过 make_and_upload_trace_dataset --episodes last 导出,选择每个试验的 最后一个回合(即策略训练所使用的回放数据)。

安全扫描说明

在发布前,每个数据分片都进行了秘密扫描,覆盖了解码后的字符串单元格,检查内容包括:JWT、AWS 访问密钥 ID、sk- / hf_ / gh*_ 令牌以及 PEM 私钥标记。

  • 用于验证推理端点回放的 Iris 代理令牌在零分片中出现,这是结构性的保证——导出器仅读取 agent/trajectory.json、任务指令、奖励和验证器输出,从不读取 config.jsonexception.txtagent/opencode.txt 或完整的 result.jsonresult 列仅包含奖励字符串)
  • 四行包含类似秘密的字符串,均已单独检查,均非凭证,属于代理转录内容或任务提示内容,刻意保留以维持研究工件的完整性
分片 内容说明
train-00068 2019-06-05 过期的 HS256 JWT,来自任务中的抓取网页内容
train-00089 GitHub raw.githubusercontent.com 预签名资源 JWT(2026-07-27 过期);代理获取的公共 CDN URL
train-00012 TACO 任务提示本身,展示示例密钥结构(主体省略)——不含实际密钥材料
train-00100 模型幻觉生成的密钥主体,位于对 Debian ssl-cert-snakeoil.key 占位符的编辑中——不是有效的 base64,行长度不规则,load_der_private_key 验证失败
搜集汇总
数据集介绍
terminal_bench_2_tasktrove_dq_taco_step15_30b_a3b_20260729_222705 数据集图片
构建方式
本数据集源自MarinSkyRL框架下的一次大规模强化学习运行,具体为`rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8`。构建过程中,从持久化对象存储中完整提取了所有试验轨迹,而非依赖本地证据包,确保了覆盖的全面性。对于每个试验,仅选取其最后一个回合(episode)的滚动输出,即策略最终训练所用的样本。数据导出时,采用严格的过滤机制,剔除了未完成且无评分结果的试验(缺少result.json),从而保证了数据集中每个样本均携带有效的奖励信号与验证器输出。最终,发布的21604行数据覆盖了全部已评分试验的99.9%,体现了构建流程的严谨性与高完整性。
使用方法
本数据集以标准的Parquet格式存储,并托管于HuggingFace平台,用户可通过`datasets`库便捷加载。默认配置下,数据被划分为train分割,包含21604个示例,总大小约2.15GB。使用时应首先下载并解压数据文件,随后利用`load_dataset`函数读取。数据中的`conversations`字段采用角色-内容对的形式,可直接用于训练对话模型或评估智能体性能;`result`字段记录了奖励值,`verifier_output`提供了验证器判定,便于进行奖励建模或结果分析。鉴于数据可能包含敏感文本,建议在受控环境中使用,并遵守相关数据使用规范,同时注意其原始轨迹可能带有任务特有的格式,需结合`instruction`字段理解上下文。
背景与挑战
背景概述
该数据集源自MarinSkyRL框架下的一次大规模强化学习训练运行(rl-tasktrove-dq-sweep-30b-qwen3-coder-30-20260726-235656-574ba8),由OpenCode/Harbor平台在2026年7月29日导出,旨在捕捉智能体在复杂任务环境中的完整交互轨迹。数据集的构建基于TaskTrove、DQ和TACO等基准任务,涵盖了超过2.1万个试验轨迹,每个轨迹均包含对话历史、指令、奖励和验证器输出,为研究智能体决策过程、策略优化和推理能力提供了丰富的高质量语料。其发布填补了当前智能体轨迹数据稀缺的空白,对强化学习、多轮交互建模及代码生成等领域具有重要的推动价值,尤其为训练和评估基于Qwen3-Coder等模型的行为克隆和离线强化学习算法提供了坚实的实验基础。
当前挑战
该数据集构建面临多重挑战。在领域层面,智能体交互轨迹的采集面临任务多样性、长程依赖和奖励稀疏等难题,现有数据往往难以覆盖真实场景中的复杂决策路径,导致模型泛化能力受限。在构建过程中,首要挑战是数据完整性与一致性:原始存于对象存储的21711个试验目录中,仅有21619个包含scored的result.json,最终导出21604条记录,覆盖率为99.9%,需剔除未完成且无奖励的试验,确保数据质量。其次,敏感信息泄露风险是另一大挑战,数据发布前需对每个分片进行秘密扫描,检测JWT、AWS密钥等,防范凭证泄露。扫描发现四行包含类密钥字符串,逐一人工审核后确认并非真实凭证,但需谨慎处理以不破坏研究素材的完整性。此外,导出过程需严格限定读取范围,避免接触包含代理令牌的配置文件,从结构上杜绝了凭据外泄的可能。
常用场景
经典使用场景
该数据集作为智能体轨迹追踪语料库,专为强化学习与语言模型交互研究设计,其核心应用场景在于训练和评估基于终端环境的多轮决策代理。通过记录完整的对话历史、任务指令、验证器输出及奖励信号,研究者可借此深入剖析代理在执行复杂编码或系统管理任务时的行为模式,常用于离线强化学习、模仿学习以及基于人类反馈的优化研究。其高覆盖率(99.9%)确保了训练数据的完整性与统计代表性,是探索代理长程规划与自我纠错机制的理想基准。
解决学术问题
该数据集解决了学术研究中智能体轨迹数据稀缺与不透明两个关键问题。它提供了大规模(逾两万条)、结构化且带有细粒度结果标注的交互记录,使研究者能够量化分析策略网络在真实终端任务中的性能瓶颈,如任务分解失误、工具调用不当或奖励信号稀疏等。其严格的安全审查(如密钥扫描)保障了数据合规性,推动了可复现的强化学习实验设计,对于研究样本效率、信用分配以及多步推理中的泛化挑战具有奠基性意义。
实际应用
在实际应用中,该数据集直接服务于自动化终端代理产品的迭代开发,例如智能运维助手、代码调试机器人或安全审计工具。工程团队可利用其轨迹数据微调生产级模型,提升在真实命令行环境中的指令遵循与错误处理能力。同时,数据集的发布格式兼容主流RL框架,便于集成至持续训练管线,用于监控代理部署后的行为漂移,并作为回归测试的基准集,确保新版本策略在关键任务上的稳定性与安全性。
数据集最近研究
最新研究方向
该数据集聚焦于通过强化学习训练的开源智能体在真实环境中的轨迹数据,最新研究方向包括智能体策略的鲁棒性与泛化能力评估、推理过程的透明度与可解释性分析,以及基于大规模轨迹数据的行为建模与优化。数据集覆盖了从任务指令到最终结果的完整交互记录,为研究智能体在复杂任务中的决策机制、错误模式及奖励信号的有效性提供了丰富素材。当前热点在于利用此类轨迹数据进行离线强化学习、模仿学习及偏好对齐研究,进而推动自主智能体在下游任务中的可靠部署与安全演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务