遇见数据集

terminal_bench_2_tasktrove_dq_unitsyn_python_step20_30b_a3b_20260730_014827

收藏
Hugging Face2026-07-30 更新2026-08-01 收录
官方服务:

资源简介:

TaskTrove DQ unitsyn-python 训练轨迹数据集(步骤 20,30B-A3B)记录了在训练 laion/tasktrove-dq-unitsyn-python-step20-30b-a3b 模型时,使用 SkyRL 从 Qwen/Qwen3-Coder-30B-A3B-Instruct 策略生成的 Terminus-2 agent 的 rollout 轨迹。每个数据行对应一个 trial 的最后一个 episode,包含完整的 agent 对话记录(包括推理过程和工具调用)、任务指令、标量奖励以及验证器输出。数据集包含 5977 行,覆盖 755 个不同的任务(如 unitsyn-python-0432),总对话轮次 136094,平均每行 22.8 轮,中位数 8 轮,范围 2-60 轮。奖励分布:2375 行奖励为 1.0(通过率 39.7%),3600 行奖励为 0.0,2 行因验证器超时失败。该数据集是完整导出,未经过子采样或过滤,并经过安全扫描确认无敏感信息泄露。适用于 agent 行为分析、强化学习训练轨迹研究、模型评估等任务。

The TaskTrove DQ unitsyn-python training trajectory dataset (step 20, 30B-A3B) records the rollout trajectories of Terminus-2 agents generated by SkyRL from the Qwen/Qwen3-Coder-30B-A3B-Instruct policy during the training of the laion/tasktrove-dq-unitsyn-python-step20-30b-a3b model. Each data row corresponds to the last episode of a trial, containing the complete agent dialogue (including reasoning process and tool calls), task instruction, scalar reward, and validator output. The dataset contains 5977 rows, covering 755 different tasks (e.g., unitsyn-python-0432), with a total of 136094 dialogue turns, an average of 22.8 turns per row, a median of 8 turns, and a range of 2-60 turns. Reward distribution: 2375 rows have a reward of 1.0 (pass rate 39.7%), 3600 rows have a reward of 0.0, and 2 rows failed due to validator timeout. The dataset is a complete export, without subsampling or filtering, and has been security-scanned to confirm no sensitive information leakage. It is suitable for agent behavior analysis, reinforcement learning trajectory research, model evaluation, and other tasks.

提供机构:
LAION eV
创建时间:
2026-07-30
原始信息汇总

数据集概述

该数据集为 TaskTrove DQ unitsyn-python 训练轨迹数据集(step 20,30B-A3B),记录了使用 SkyRL 框架训练 Qwen/Qwen3-Coder-30B-A3B-Instruct 模型(对应 laion/tasktrove-dq-unitsyn-python-step20-30b-a3b)过程中的智能体(Terminus-2)完整交互轨迹。数据集以 Apache-2.0 许可证发布,属于文本生成任务类别。

数据规模与构成

  • 总行数:5,977 行(训练集),每条记录对应一个试验(trial)的最后一个 episode
  • 任务覆盖:755 个不同的任务
  • 对话轮次:总计 136,094 个对话轮次,平均每行 22.8 轮,中位数 8 轮,范围 2 至 60 轮
  • 奖励分布:2,375 行奖励为 1.0,3,600 行为 0.0,2 行出现 VerifierTimeoutError,通过率为 39.7%
  • 数据大小:数据集大小约 124 MB(下载大小约 94 MB)

数据字段

字段名 说明
conversations {role, content} 组成的对话列表;助手轮次包含 <think> 推理和 <tool_call> 工具调用块
instruction 给智能体的任务指令
result 标量奖励(字符串形式),或验证器失败时的异常名称
verifier_output 验证器在该试验中的标准输出
task 任务 ID,例如 unitsyn-python-0432
trial_namerun_id 每次试验的唯一标识符
agentmodelmodel_providerdateepisode 回滚元数据

数据覆盖与筛选

  • 该数据集为运行的完整可导出试验集,并非样本。共包含 6,071 个试验目录,其中 6,068 个含有智能体轨迹,5,980 个含有 result.json(已评分),发布的行数为 5,977 行,占已评分试验的 99.95%。
  • 有 3 个已评分试验因首次模型调用时出现 ContextLengthExceededError(上下文长度超出限制)而未产生数据行,其轨迹仅包含单个 user 步骤且无助手回复。
  • 另有 88 个试验有轨迹但无 result.json,因在 episode 中途被截断且从未评分,被排除在外。
  • 数据导出过程中未进行任何子采样、过滤或行数限制。

来源与安全扫描

  • 数据来源于运行标识 rl-tasktrove-dq-sweep-30b-terminus2-qwen-20260725-163115-1ae770
  • 原始轨迹树(42,128 个文件,约 9.13 GiB)及每个分片的解码字符串单元均进行了安全扫描,未发现 JWT、AWS 访问密钥 ID、sk-/hf_/gh*_ 令牌、PEM 密钥标记或 Iris 能力令牌等敏感信息。
  • 该运行通过集群内 vLLM 直接地址提供服务,并使用占位凭证 fake_key,因此从未持有 Iris 代理端点密钥。

注意事项

奖励是针对仍在训练中的模型产生的(on-policy),因此通过率反映的是运行中途的策略状态,而非最终发布检查点的性能。

搜集汇总
数据集介绍
terminal_bench_2_tasktrove_dq_unitsyn_python_step20_30b_a3b_20260730_014827 数据集图片
构建方式
该数据集源自Terminus-2智能体在训练过程中产生的完整轨迹记录,依托SkyRL框架,以Qwen3-Coder-30B-A3B-Instruct为策略模型,针对TaskTrove基准中的755个任务进行交互。构建流程严格遵循原始运行的全部对象存储前缀,逐条导出每个试验的最后一集,确保无抽样、无过滤。每行包含完整的智能体对话历史、任务指令、标量奖励及验证器输出,并附有任务标识、运行元数据等字段。共计5977个样本,覆盖99.95%的已评分试验,剔除了因上下文长度错误或中断而未完成评分的少数案例,保证了数据集的完整性与代表性。
使用方法
使用该数据集时,研究人员可直接加载HuggingFace上的默认配置,获取训练分割的5977个样本。每条记录中的conversations字段可直接用于监督微调或偏好对齐,通过instruction字段重现任务场景,结合result字段作为奖励信号。验证器输出可用于分析任务成功与失败的原因。数据集适用于文本生成、智能体行为研究及强化学习训练等场景,尤其适合评估模型在终端交互任务中的表现。需注意,奖励为训练中途的在线策略结果,使用时须考虑策略演化对数据分布的影响。
背景与挑战
背景概述
该数据集由LAION等机构于2026年7月创建,作为TaskTrove DQ unitsyn-python项目的一部分,旨在支持基于终端交互的智能体训练。它记录了在训练过程中,使用SkyRL框架和Qwen3-Coder-30B-A3B-Instruct模型生成的完整智能体交互轨迹,每个样本包含对话历史、任务指令、奖励值及验证器输出。该数据集的核心研究问题在于:如何高效地利用真实终端环境的交互数据,训练出能够执行复杂Python单元合成任务的智能体。其发布为终端智能体领域提供了大规模、高质量的训练语料,推动了基于强化学习的智能体训练方法的发展,并对后续研究中的奖励建模、策略优化等方向产生了重要影响。
当前挑战
数据集构建与领域应用面临多重挑战。领域层面,解决的是终端交互智能体的策略学习问题,需要处理复杂的多步工具调用、长程依赖以及环境反馈的稀疏性,同时要求模型具备从错误中恢复的能力。构建过程中,挑战包括:大规模轨迹数据的存储与同步(48,196个对象,9.15 GiB),需确保数据的完整性(最终发布5,977行,覆盖99.95%的评分试验);处理因上下文长度超限(如ContextLengthExceededError)导致的无效样本,以及因中断而未评分的轨迹,需制定合理的排除策略;数据清洗中需进行敏感信息扫描,确保无令牌泄露,但还需考虑在代理端点使用占位凭证等特殊情况;此外,还需平衡数据集的规模与质量,确保每个任务有多样化的轨迹,同时避免重复或重复采样带来的偏差。这些挑战共同体现了在真实环境数据驱动下训练智能体的复杂性和实践细节。
常用场景
经典使用场景
该数据集记录了基于Qwen3-Coder-30B-A3B-Instruct模型在Terminal-Bench环境下执行Python单元合成任务的完整智能体轨迹,涵盖5977个试运行会话。其经典使用场景聚焦于智能体行为分析与强化学习训练验证,研究者可借助丰富的对话历史、工具调用序列及奖励信号,深入探究代码生成智能体在复杂终端交互中的决策机制与错误模式。
解决学术问题
该数据集解决了智能体学习过程中轨迹数据稀缺与不可复现的学术难题,为离线强化学习、行为克隆及奖励模型训练提供了大规模、细粒度的真实交互样本。其完整性与元数据丰富性,使得研究者能够精确关联任务指令、模型输出与验证结果,从而量化分析策略性能的演进规律,推动可复现的智能体训练研究。
实际应用
在实际应用中,该数据集助力开发者优化自主编码智能体的工具调用策略与推理路径,通过分析高奖励轨迹中的成功模式,改进模型在真实终端环境下的任务执行能力。其轨迹数据可直接用于构建智能体的监督微调数据集或作为RLHF的偏好对来源,加速代码自动化生成工具在软件开发、运维等领域的落地部署。
数据集最近研究
最新研究方向
该数据集聚焦于终端智能体行为轨迹的深度解析与强化学习优化,其最新研究方向在于利用大规模、高保真的代理轨迹数据驱动语言模型在真实终端环境中的决策能力跃升。随着终端交互范式从传统命令行向自主智能体演进,该数据集通过记录Qwen3-Coder-30B-A3B在TaskTrove单元合成任务中的完整操作序列,为探索稀疏奖励下的策略学习、长程任务分解及工具调用鲁棒性提供了关键实证。其覆盖5977条轨迹、136094轮对话的体量,以及逐任务验证器反馈的精细标注,使得研究者能够量化分析模型在不同任务难度下的行为模式,从而推动多步推理强化学习、上下文长度约束下的高效记忆机制等前沿课题的突破。该数据集的发布标志着开放科学在智能体训练轨迹共享方面迈出重要一步,为可复现的终端自动化研究奠定了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务