T1-Terminal-Bench-2.1-Trajectories
收藏资源简介:
T1 — Terminal-Bench 2.1 Trajectories 数据集记录了使用 Terminus-2 agent scaffold 在 Terminal-Bench 2.1 基准上评估 T1 模型(基于 Qwen3.5、122B 参数)生成的完整 agent 轨迹。数据集包含两次独立的重复运行(run_1 和 run_2),每次运行覆盖 89 个任务,在相同的冻结配置下执行,以揭示运行之间的方差。平均正确率(除以所有 89 次试验,错误试验计为 0)为 64.0%。每个轨迹以目录形式组织,包含 metadata.json(奖励、时间、token 计数、采样配置)、trajectory.json(ATIF-v1.7 格式的完整 agent/用户步骤序列)、上下文压缩相关文件(summarization-N-* 和 trajectory.cont-N.json)以及 asciinema 终端录制 recording.cast 和 final tmux pane 捕获。根目录提供 metadata.jsonl 文件,每行一个试验,便于通过 Hugging Face 数据集查看器浏览。评估配置为:agent 采用 Terminus-2 v2.0.0,JSON 解析器,最大 500 轮;模型本地部署于 SGLang,采样温度 0.1,top_p 0.95,最大 token 32768,禁用思考;输入 token 限制 86016,每试验 agent 超时 18000 秒;环境为每个试验使用一个短暂的 Daytona 云沙箱。数据已进行清理,移除了内部集群路径、URI、推理端点代理主机名/IP、云组织标识符等基础设施细节,但保留了沙箱 ID 和任务相关秘密(如测试用 HuggingFace token)。注意:奖励是二值(0.0 或 1.0),平均值为解决率;同一配置重复运行间差异约 12 个百分点;基础设施错误(如 Daytona 内部错误)不代表模型失败。该数据集可用于研究 agent 行为、可重复性、上下文压缩影响以及工具使用场景。





