openthoughts-tblite
收藏资源简介:
NousResearch/openthoughts-tblite 数据集是 OpenThoughts-TBLite 的重新格式化版本,专为与 Hermes Agent Terminal-Bench 评估框架配合使用而设计。该数据集由 OpenThoughts Agent 团队与 Snorkel AI 和 Bespoke Labs 合作创建,是 Terminal-Bench 2.0 的一个难度校准子集,旨在加速终端代理的开发迭代。数据集包含100个任务,每个任务都有唯一的标识符、自然语言提示、预构建的 Docker 镜像、任务类别、难度级别、标签、超时设置等。任务难度分为五个等级(简单、中等、困难、非常困难、专家级),并提供了每种难度下的任务数量和通过率范围。数据集适用于终端代理的开发和评估,支持通过 Hermes Agent 或 Python 直接加载和使用。
数据集概述
数据集基本信息
- 数据集名称: NousResearch/openthoughts-tblite
- 许可证: Apache 2.0
- 标签: terminal-agents, benchmark, evaluation, software-engineering
数据来源与背景
- 本数据集是 OpenThoughts-TBLite 的重新格式化版本,专为与 Hermes Agent Terminal-Bench 评估框架配合使用而设计。
- 原始数据集 OpenThoughts-TBLite 由 OpenThoughts Agent 团队与 Snorkel AI 和 Bespoke Labs 合作创建。
- 它是 Terminal-Bench 2.0 的一个经过难度校准的子集,旨在为开发终端智能体时提供更快的迭代速度。
数据格式与内容
- 数据格式: 原始 TBLite 数据集将任务存储为包含 Dockerfiles、指令文件和测试脚本的独立目录。本数据集将其转换为扁平的表格格式,以匹配 NousResearch/terminal-bench-2 的架构。
- 数据规模: 包含 100 个任务示例,全部位于
train分割中。 - 关键变更:
- 为所有 100 个任务构建并推送了 Docker 镜像至 Docker Hub,标签为
nousresearch/tblite-<task-name>:latest。 - 将测试套件(
tests/目录)打包为 base64 编码的 tar.gz 存档,存储在tests_tar列。 - 将构建上下文(
environment/目录)打包为 base64 编码的 tar.gz 存档,存储在environment_tar列。 - 从每个任务的
task.toml中提取了元数据(类别、难度、标签、超时时间)。
- 为所有 100 个任务构建并推送了 Docker 镜像至 Docker Hub,标签为
- 内容保真度: 任务内容(指令、Dockerfiles 和测试脚本)未作任何修改,与原始版本完全相同。
数据模式(Schema)
| 列名 | 数据类型 | 描述 |
|---|---|---|
task_name |
string | 唯一任务标识符(来自 TBLite 的目录名) |
instruction |
string | 展示给智能体的自然语言任务提示 |
docker_image |
string | 预构建的 Docker Hub 镜像(nousresearch/tblite-<name>:latest) |
category |
string | 任务类别(例如 security, machine-learning) |
difficulty |
string | 难度等级(easy, medium, hard, very-hard, expert) |
tags |
string | JSON 编码的标签列表 |
agent_timeout_sec |
float64 | 来自 task.toml 的推荐智能体超时时间(秒) |
test_timeout_sec |
float64 | 来自 task.toml 的推荐测试/验证器超时时间(秒) |
environment_tar |
string | Docker 构建上下文的 Base64 tar.gz(镜像不可用时的备用方案) |
tests_tar |
string | 测试套件的 Base64 tar.gz(上传到沙盒的 pytest 脚本) |
test_sh |
string | tests/test.sh 的内容(测试运行脚本) |
难度分布
使用 Claude Haiku 4.5 作为参考模型进行校准:
| 难度等级 | 通过率范围 | 任务数量 |
|---|---|---|
| Easy | >= 70% | 24 |
| Medium | 40-69% | 43 |
| Hard | 10-39% | 28 |
| Very Hard | < 10% | 1 |
| Expert | < 10% | 2 |
使用方式
与 Hermes Agent 一起使用
bash python environments/benchmarks/tblite/tblite_env.py evaluate
使用 Python
python from datasets import load_dataset ds = load_dataset("NousResearch/openthoughts-tblite", split="train") print(f"{len(ds)} tasks") print(ds[0]["task_name"], ds[0]["instruction"][:100])
引用信息
bibtex @software{OpenThoughts-TBLite, author = {OpenThoughts-Agent team, Snorkel AI, Bespoke Labs}, month = Feb, title = {{OpenThoughts-TBLite: A High-Signal Benchmark for Iterating on Terminal Agents}}, howpublished = {https://www.openthoughts.ai/blog/openthoughts-tblite}, year = {2026} }



