遇见数据集

T1-Long-Horizon-Terminal-Bench-Trajectories

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集名为“T1 — Long-Horizon Terminal-Bench Trajectories”,包含了使用Terminus-2代理框架在Long-Horizon Terminal-Bench(LHTB)上评估T1模型(基于Qwen3.5、参数量达122B)所产生的完整智能体轨迹。LHTB任务可持续数小时,评分采用部分信用机制,奖励值在[0,1]区间内连续分布,而非简单的通过/失败判定。数据集中包含两个独立重复运行的46个任务。每个试次对应一个独立目录,包含metadata.json(奖励、子指标、计时、token数)、trajectory.json(ATIF-v1.7格式的完整智能体/用户步骤序列)、多次上下文压缩产生的连续性文件(如trajectory.cont-N.json及其汇总文件)、终端窗格截图、部分任务的重放视频或GIF以及棋类任务的验步日志。根目录下的metadata.jsonl文件以扁平行格式提供每个试次的奖励、任务、token数、异常类型和路径,便于在HuggingFace查看器中浏览。读取完整轨迹时需要按顺序读取trajectory.json及其所有continuation段,因为上下文压缩会打断步骤编号并产生多个文件。评估配置包括:Terminus-2 v2.0.0代理、JSON解析器、温度0.6、top_p 0.95、max_tokens 8192、停用思考模式、输入上限96,000 token(32,000时主动压缩)、智能体超时14,400秒(4小时)。数据集已进行脱敏处理,移除了内部集群路径、作业标识、推理端点、代理主机名/IP及云组织标识,但保留了智能体沙箱内部路径和ID。注意事项包括:基础架构错误(如RewardFileNotFoundError或云提供商错误)导致的部分试次无评分,超时试次仍保留已获得的信用评分,以及token消耗主要由观测(终端输出、重新发送的上下文和压缩开销)主导而非模型输出。引用信息参见README中的BibTeX条目。

创建时间:
2026-09-09
搜集汇总
数据集介绍
T1-Long-Horizon-Terminal-Bench-Trajectories 数据集图片
构建方式
在大规模语言模型智能体评估领域,长时间跨度任务的过程性数据正成为理解智能体行为的关键资源。该数据集源自对T1(基于Qwen3.5的122B参数模型)在Long-Horizon Terminal-Bench基准上的系统评测,采用Terminus-2智能体框架完整记录每次试验的交互轨迹。46项任务分别独立重复两次,形成两轮运行数据,每项任务均以连续奖励而非通过与否进行评分。原始运行输出经过严格净化处理,移除内部集群路径、推理端点及云组织标识,同时将全部奖励与子指标预先提取至元数据文件,确保评分信息无丢失,最终以Apache-2.0许可发布。
特点
该数据集的显著特征在于其对长时程智能体行为的细致刻画。单次试验可持续四小时,上下文压缩机制频繁触发,每次压缩生成独立摘要三元组并开启新的轨迹分段,完整历史散布于主轨迹文件及多个延续片段中,需按序拼接方可还原全貌。评分体系采用连续奖励,并针对特定任务保留诸如将死步数、最优走子或已通过阶段等细粒度子指标。数据同时包含终端窗格捕获、回放视频与验证器操作日志,为多维度分析提供支撑。输入令牌规模远超输出,反映出终端观测与上下文重传的主导地位,而超时与基础设施异常均被如实标注,保持数据的中立与完整。
使用方法
使用该数据集时,研究者可通过仓库根目录的扁平元数据文件快速浏览各次试验的奖励、任务名称、令牌计数与异常类型,亦可借助数据查看器进行交互式检索。读取完整轨迹需加载主轨迹文件,并按延续引用依次串联所有分段文件,仅统计主文件将严重低估实际步数。每一步均标注来源与消息内容,便于区分模型输出与终端反馈。上下文压缩产生的摘要问答与摘要文件可用于分析智能体的自我提问与信息保留策略。针对棋类等任务,元数据中的子指标字段可支持超越标量奖励的深入评判,而回放与操作日志则为行为复现与验证提供补充依据。
背景与挑战
背景概述
随着大语言模型智能体在终端环境中的长时程自主交互能力日益受到关注,如何评估其在真实操作系统环境下的持续决策与工具调用表现,已成为智能体研究的关键议题。T1-Long-Horizon-Terminal-Bench-Trajectories数据集由研究者Junyao Yang于2026年发布,记录了基于Qwen3.5架构的1220亿参数模型T1在Long-Horizon Terminal-Bench上的完整智能体轨迹,采用Terminus-2脚手架,涵盖46项任务各两次独立重复运行,单次任务时长可达四小时。该数据集以连续奖励而非通过率刻画智能体表现,为长时程强化学习、上下文压缩机制与终端工具使用研究提供了珍贵的细粒度经验数据,对推动自主智能体的鲁棒性评估具有重要参考价值。
当前挑战
该数据集所面向的核心挑战在于长时程终端任务本身的复杂性与评测范式的转变:此类任务需智能体在数小时内持续维持目标状态、应对上下文窗口限制并反复进行压缩与续接,其连续奖励机制要求研究者摒弃传统的通过率视角。构建过程中亦面临多重困难,包括基础设施错误导致的部分试验无法计分、四小时超时机制对尾部试验的支配效应,以及上下文压缩引发的轨迹分段与步数统计偏差等问题。此外,观测输出主导的令牌消耗结构(输入令牌约为输出令牌的百倍)揭示了终端输出回传与压缩开销带来的显著成本压力,而原始运行记录的脱敏处理亦需在去除敏感基础设施信息的同时保留真实任务内容。
常用场景
经典使用场景
在大规模语言模型智能体评估领域,长时程终端交互任务已成为检验模型持续决策与工具调用能力的重要试金石。该数据集的经典使用场景在于完整记录并复现智能体在Long-Horizon Terminal-Bench上的多轮交互轨迹,每条轨迹蕴含智能体与终端环境之间数十乃至上百个步骤的连续对话,涵盖命令执行、错误诊断与策略调整等环节。研究者可借助轨迹数据细致剖析模型在四小时级别的任务中如何规划动作序列、应对环境反馈,并利用上下文压缩机制维持长程记忆,从而为智能体行为建模提供高保真度的经验材料。
衍生相关工作
围绕该数据集已衍生出若干值得关注的后续工作,涉及智能体脚手架改进、上下文压缩算法以及长时程强化学习策略等方向。研究者借鉴其ATIF-v1.7轨迹格式与续接段机制,探索更为高效的记忆摘要与状态恢复方法;部分工作聚焦于利用轨迹中的子指标设计稠密奖励函数,以缓解稀疏反馈带来的学习困难。该数据集所暴露的基础设施错误与超时现象亦引发了对评估鲁棒性的讨论,推动社区建立更为严谨的智能体基准评测规范。
数据集最近研究
最新研究方向
在长时程自主智能体评估领域,T1-Long-Horizon-Terminal-Bench-Trajectories的发布标志着研究重心从短周期任务通过率向小时级连续交互过程的深度刻画迁移。该数据集完整保留了Terminus-2脚手架驱动122B参数模型执行46项终端任务的双次重复轨迹,其核心价值在于以连续奖励信号替代二值判定,并通过上下文压缩分段机制支撑长达四小时的情节建模。当前前沿研究正围绕部分可观测环境下的信用分配、压缩摘要的信息保持能力以及超长输入输出不对称下的强化学习策略优化展开,该数据集为检验智能体在真实终端环境中的鲁棒性与持续学习能力提供了稀缺的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务