遇见数据集

terminal_bench_2_tasktrove_dq_stack_pytest_step25_30b_a3b_20260730_053956

收藏
Hugging Face2026-07-30 更新2026-08-01 收录
官方服务:

资源简介:

该数据集是 TaskTrove stack-pytest 训练过程中产生的 rollout traces,记录了使用 SkyRL 框架在 TaskTrove 的 stack-pytest 数据源上训练 Qwen3-Coder-30B-A3B-Instruct 模型(步骤 25)时的交互轨迹。数据来源于 Terminus-2/Harbor 的回放记录,每个样本对应一次试验(trial)的最后一个回合(episode),以 OpenAI 风格的对话列表(conversations)形式存储,同时包含任务指令(instruction)、验证者分配的奖励(result)以及验证者的标准输出(verifier_output)。数据集共包含 21,695 个训练样本,源自对象存储上 154,311 个对象(18.6 GiB)的完整 trace_jobs 目录。原始试验目录共 22,047 个,其中 21,973 个被评分,本数据集包含了 98.73% 的评分试验,排除了 278 个 agent 从未进行任何回合的试验。数据字段包括:conversations(对话列表,含 content 和 role)、agent、model、model_provider、date、task、episode、run_id、trial_name、result、instruction、verifier_output。数据集已进行秘密扫描,未发现 JWT、AWS 密钥、OpenAI 密钥、Hugging Face 令牌等敏感信息,仅发现 30 个 PEM 标记(来自一个任务中的占位符,非真实私钥),保留未修改以保持数据完整性。

This dataset consists of rollout traces generated during the TaskTrove stack-pytest training process, recording interaction trajectories when training the Qwen3-Coder-30B-A3B-Instruct model (step 25) on the TaskTrove stack-pytest data source using the SkyRL framework. The data originates from replay records of Terminus-2/Harbor, with each sample corresponding to the last episode of a trial, stored in an OpenAI-style conversation list format, along with task instruction, reward assigned by the verifier (result), and the verifiers standard output (verifier_output). The dataset contains 21,695 training samples, derived from 154,311 objects (18.6 GiB) in the complete trace_jobs directory on object storage. The original trial directories totaled 22,047, of which 21,973 were scored; this dataset includes 98.73% of the scored trials, excluding 278 trials where the agent never performed any episode. Data fields include: conversations (list of dialogues with content and role), agent, model, model_provider, date, task, episode, run_id, trial_name, result, instruction, verifier_output. The dataset has undergone secret scanning and found no JWT, AWS keys, OpenAI keys, Hugging Face tokens, or other sensitive information; only 30 PEM markers (placeholders from a task, not real private keys) were found and retained unmodified to maintain data integrity.

提供机构:
LAION eV
创建时间:
2026-07-30
原始信息汇总

数据集概述

本数据集为 TaskTrove stack-pytest 训练回放轨迹,记录了使用 SkyRL 框架训练 laion/tasktrove-dq-stack-pytest-step25-30b-a3b 模型时的完整轨迹数据,共包含 21,695 条训练样本

数据内容

每条数据包含一个 trial 的最后一个 episode,以 OpenAI 风格的 conversations 列表形式存储,具体字段包括:

  • conversations:对话内容列表,包含 content(内容)和 role(角色)两个子字段
  • task:任务标识
  • instruction:任务指令
  • result:验证器给出的奖励分数
  • verifier_output:验证器的标准输出

此外还包含 agentmodelmodel_providerdateepisoderun_idtrial_name 等元数据字段。

数据规模

项目 数值
训练集样本数 21,695
训练集大小 564,025,199 字节(约 538 MB)
下载大小 427,135,976 字节(约 407 MB)
原始轨迹对象数 154,311 个(18.6 GiB)
trial 目录总数 22,047
已评分的 trial 数 21,973
发布行数占比 98.73%

数据来源

数据来自训练运行 rl-tasktrove-dq-sweep-30b-terminus2-qwen-20260725-155627-3eb19d,使用的 agent 为 terminus-2,服务模型为 hosted_vllm/Qwen3-Coder-30B-A3B-Instruct。数据基于对象存储上的完整 trace_jobs/ 前缀构建,而非本地镜像。

数据排除说明

  • 278 条 trial 被排除(占已评分 trial 的 1.27%):agent 从未发言,无对话可导出,其 result.json 中的奖励为 0
  • 74 个 trial 目录未被评分:无 result.json,已从分母中排除
  • 早期版本仅有 255 行(占 1.16%),因基于仅保留最近 500 条轨迹的本地镜像构建,现有版本已重建并扩充至 221 个分片

安全扫描

原始轨迹树和所有分片均经过密钥扫描,覆盖 JWT、AWS 访问密钥、OpenAI sk- 密钥、Hugging Face hf_ 令牌、GitHub gh* 令牌、PEM 标记及 Iris 代理端点密钥等模式。

扫描结果中仅发现 30 个 PEM 私钥标记,分布在 7 行数据中,均来自同一任务(stack-pytest-2021,一个 google.auth.crypt 练习)。这些是模型写入 Python 测试夹具的占位符内容:所有 58 个块均无法解析为有效私钥,40 个包含字面 ... 占位符,最长的解码后为 990 字节(而 RSA-2048 PKCS#8 密钥需要 1,218 字节)。这些内容按原样发布,未做修改,以保证数据集转录内容的完整性。

搜集汇总
数据集介绍
terminal_bench_2_tasktrove_dq_stack_pytest_step25_30b_a3b_20260730_053956 数据集图片
构建方式
本数据集源于利用SkyRL框架在TaskTrove的stack-pytest源代码上训练的强化学习轨迹记录,具体对应Qwen3-Coder-30B-A3B模型在训练步长25时的rollout数据。构建过程直接从对象存储中的完整trace_jobs前缀提取,覆盖154,311个对象,总计18.6 GiB,而非依赖本地镜像。每个试验对应一行,保存该试验的最后一个回合,以OpenAI风格的对话列表形式呈现,同时关联任务指令、验证器分配的奖励及验证器自身的标准输出。数据筛选严格,仅保留代理至少执行一次回合的试验,最终发布21,695行,占已评分试验的98.73%,确保了数据完整性。
使用方法
使用本数据集时,可直接通过HuggingFace数据集加载工具读取train分割,每行包含conversations字段,以OpenAI消息格式呈现,适合用于对话模型微调或行为分析。研究可结合instruction字段明确任务目标,借助result字段评估模型输出质量,并通过verifier_output深入理解奖励信号来源。需注意部分试验因代理未产生回合而被排除,因此使用时宜关注那些包含完整对话的样本。数据集的多元元数据(如agent、model、date)支持按需筛选,便于针对特定条件进行子集分析,进而探究训练动态与策略演化。
背景与挑战
背景概述
该数据集名为terminal_bench_2_tasktrove_dq_stack_pytest_step25_30b_a3b_20260730_053956,源自Terminus-2/Harbor项目,由LAION等机构于2026年创建,用于记录训练Qwen3-Coder-30B-A3B模型在TaskTrove stack-pytest任务上的强化学习轨迹。其核心研究问题在于捕捉模型在代码生成与执行验证过程中的交互行为,为智能体训练提供高保真数据。该数据集涵盖21,695个试验样本,每行包含完整的对话历史、任务指令、验证器奖励及输出,对于理解模型在复杂代码任务中的决策过程具有重要价值,推动了代码智能体与强化学习领域的交叉研究,为后续模型优化与评估提供了基准数据。
当前挑战
数据集构建面临多重挑战。首先,领域问题聚焦于代码生成与执行验证的复杂性,模型需在动态环境中进行多轮交互,这要求数据能忠实反映策略演化中的成败细节,而原始轨迹中约1.27%的试验因智能体未产生任何回复而被剔除,可能导致对失败模式的覆盖不足。其次,构建过程中需处理海量对象存储数据(154,311个对象,18.6 GiB),并确保数据完整性与一致性,如早期版本因本地镜像仅保留最近500条轨迹而缺失大量数据,促使团队转向完整前缀处理。此外,安全扫描发现30个PEM私钥占位符,虽证实为无效占位,但此类敏感内容的处理需在保留数据真实性与隐私合规间取得平衡。
常用场景
经典使用场景
该数据集是TaskTrove stack-pytest训练过程中强化学习回滚轨迹的忠实记录,其核心价值在于为智能体行为分析提供了规模可观、结构化完整的对话轨迹样本。每条样本包含多轮交互、任务指令、奖励信号及验证器输出,可作为研究大语言模型在代码生成与测试场景下决策机制的基准数据。研究者可借此剖析模型在复杂编程任务中的探索策略、错误修正模式以及工具调用逻辑,亦可为离线强化学习、行为克隆等范式提供高保真的训练语料。
解决学术问题
该数据集直面开源强化学习研究中轨迹数据稀缺且透明度不足的长期难题,通过完整保留训练中间步骤的原始交互记录,为复现实验、机理剖析及算法横向对比提供了可靠依据。其详尽记录了验证器奖励与模型输出间的关联,使研究者得以深入探究奖励噪声对学习动态的影响,以及模型从失败到成功的渐进路径,有力支撑了关于探索-利用权衡、样本效率及策略鲁棒性的学术讨论,并推动建立更严谨的训练过程评估框架。
实际应用
在实际应用中,此数据集可服务于智能编程助手的研发迭代,如代码补全、缺陷定位及自动化测试生成等功能的改进。开发者可依据轨迹中模型的有效策略与典型失误,实施针对性的人机对齐调优与安全对齐加固。同时,该数据集可作为模拟环境或评估基准,用于验证新算法在现实编程任务上的测试通过率提升能力,进而加速从学术模型到可靠工程工具的转化,降低企业级代码自动化工具的训练成本与试错风险。
数据集最近研究
最新研究方向
在强化学习与代码智能的交叉前沿,本数据集聚焦于训练过程中智能体轨迹的细粒度剖析,尤其关注验证器信号与策略网络在复杂任务(如stack-pytest测试生成)中的动态交互。其最新研究动向在于利用完整rollout轨迹开展离线策略评估、奖励模型校准及样本效率优化,并探索从失败轨迹中挖掘可迁移的修正信号。此外,针对大规模训练记录中的安全审计与机密泄露检测成为新兴热点,该数据集的未过滤发布策略为研究模型生成内容中的潜在隐私风险提供了独特视角,推动了可信AI与透明化训练数据管理的实践发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务