T1-Long-Horizon-Terminal-Bench-Trajectories
收藏资源简介:
该数据集名为“T1 — Long-Horizon Terminal-Bench Trajectories”,包含了使用Terminus-2代理框架在Long-Horizon Terminal-Bench(LHTB)上评估T1模型(基于Qwen3.5、参数量达122B)所产生的完整智能体轨迹。LHTB任务可持续数小时,评分采用部分信用机制,奖励值在[0,1]区间内连续分布,而非简单的通过/失败判定。数据集中包含两个独立重复运行的46个任务。每个试次对应一个独立目录,包含metadata.json(奖励、子指标、计时、token数)、trajectory.json(ATIF-v1.7格式的完整智能体/用户步骤序列)、多次上下文压缩产生的连续性文件(如trajectory.cont-N.json及其汇总文件)、终端窗格截图、部分任务的重放视频或GIF以及棋类任务的验步日志。根目录下的metadata.jsonl文件以扁平行格式提供每个试次的奖励、任务、token数、异常类型和路径,便于在HuggingFace查看器中浏览。读取完整轨迹时需要按顺序读取trajectory.json及其所有continuation段,因为上下文压缩会打断步骤编号并产生多个文件。评估配置包括:Terminus-2 v2.0.0代理、JSON解析器、温度0.6、top_p 0.95、max_tokens 8192、停用思考模式、输入上限96,000 token(32,000时主动压缩)、智能体超时14,400秒(4小时)。数据集已进行脱敏处理,移除了内部集群路径、作业标识、推理端点、代理主机名/IP及云组织标识,但保留了智能体沙箱内部路径和ID。注意事项包括:基础架构错误(如RewardFileNotFoundError或云提供商错误)导致的部分试次无评分,超时试次仍保留已获得的信用评分,以及token消耗主要由观测(终端输出、重新发送的上下文和压缩开销)主导而非模型输出。引用信息参见README中的BibTeX条目。





