Long-Horizon Terminal-Bench (LHTB)
收藏资源简介:
Long-Horizon Terminal-Bench (LHTB) 是一个包含46个任务的基准测试,用于测量LLM代理在容器化终端中经过数百步后维持有用工作的能力。与短期编码基准测试不同,LHTB将代理置于有状态环境中,并通过隐藏的、从工件重建的验证器进行评分,自我报告的进度不计入成绩。任务涵盖交互式游戏与谜题、多模态分析、软件/逆向工程、科学计算、地球与能源系统、安全与性能、研究复现以及专业APEX风格工作流程。
Long-Horizon Terminal-Bench (LHTB) is a benchmark comprising 46 tasks aimed at evaluating the ability of LLM agents to maintain productive operational workflows over hundreds of steps within a containerized terminal environment. Unlike short-term coding benchmarks, LHTB deploys agents in a stateful environment, and employs hidden, artifact-reconstructed validators for scoring, excluding self-reported progress from grading considerations. The covered tasks span interactive games and puzzles, multimodal analysis, software and reverse engineering, scientific computing, earth and energy systems, security and performance optimization, research reproduction, as well as professional APEX-style workflows.
数据集概述
- 数据集名称: Long-Horizon Terminal-Bench (LHTB)
- 数据集地址: https://github.com/zli12321/LHTB
- 数据集类型: 多任务基准测试(46个任务)
- 核心用途: 衡量LLM智能体在容器化终端环境中执行长时任务(数百步)的能力。
任务与评估
- 任务数量: 46个任务,涵盖8个类别:
- 交互式游戏与谜题(8个)
- 多模态与成像分析(6个)
- 软件与逆向工程(6个)
- 科学计算与仿真(6个)
- 地球、气候与能源(6个)
- 系统、性能与安全(5个)
- 研究复现与机器学习(5个)
- APEX专业工作流(4个)
- 评估方法: 使用隐藏的、基于工件重建的验证器进行评分,不支持智能体自我报告进度。每个任务预算为90分钟。
- 评估环境: 使用 Harbor 评估框架,基于 Terminus-2 测试平台。
结果与发现
- 模型表现(2026年7月快照,21个前沿模型):
- 最佳模型(Grok 4.5)在严格成功标准下仅解决约28%的任务(13/46)。
- 中位数任务未被任何模型解决,表明基准测试远未饱和。
- 约55%的智能体-任务运行奖励低于0.25,智能体经常陷入循环、提前退出或预算耗尽。
- 成本与性能:
- 能力与价格不直接相关。例如,Grok 4.5(约$11/任务)排名第一,而Claude Fable 5(约$73/任务)排名第四。
- 低成本模型如 MiniMax M3($6/任务)和 Hy3($2.47/任务)性能可媲美高价模型。
数据集结构
- 仓库布局:
tasks/: 包含46个Harbor任务定义。configs/examples/: 示例Harbor YAML配置文件。- 每个任务遵循标准5文件结构:
task.toml(元数据)、instruction.md(智能体提示)、environment/(Dockerfile+资源)、tests/(隐藏验证器)、solution/(参考解决方案)。
使用方式
- 前提条件: 安装Harbor(
uv tool install harbor或pip install harbor)并运行Docker。 - 快速开始:
- 克隆仓库并拉取Git LFS文件。
- 使用
harbor run -c configs/examples/oracle_smoke.yaml进行测试。 - 设置API密钥(通过环境变量,如
OPENAI_API_KEY)并运行智能体。
相关资源
- 博客: https://zli12321.github.io/LHTB/
- 排行榜: https://zli12321.github.io/LHTB/leaderboard.html
- 论文: https://arxiv.org/abs/2607.08964
- Hugging Face数据集: https://huggingface.co/datasets/IntelligenceLab/Long-Horizon-Terminal-Bench
- 许可证: Apache License 2.0





