Tmax-Tasks-Clean
收藏资源简介:
Tmax-Tasks-Clean 是一个专为终端代理任务设计的高质量数据集,源自 `allenai/tmax-15k-open-instruct` 项目。该数据集通过严格的奖励完整性过滤和多重审计流程构建,旨在确保每个任务的环境、指令和验证器之间相互一致,适合用于强化学习或监督微调训练。数据集包含三个分割:train(398个任务,通过八类评分标准的审计,并被一个强代理成功解决。其中156个任务由两名独立法官审阅,其余242个由一名法官审阅。每个任务包含原子记录如audit_verdict、passrate、trace等)、checking(207个任务,因法官分歧或后续审查发现缺陷而被保留,不推荐用于训练)、legacy(641个任务,是早期基于启发式选择构建的版本,后经审计发现约39.5%存在答案泄漏,已弃用)。数据集的字段涵盖任务ID、领域、镜像、指令、分割角色、解决信息(passrate、资源峰值)、审计结果、金标准类型等。金标准解决方案从成功的代理运行中提取,分为静态(文件tar包)和过程性(动作序列重放)两种,覆盖93.7%的训练任务。数据集还包含一个额外的审计结果(audit_v4_verdict),将训练任务进一步分类为“当前可用”(123个)、“可修复”(171个)和“不可用”(104个)。已知限制包括:部分任务仅由一名法官审阅、存在验证器可被绕过、域名分布与TerminalBench 2不一致等。建议用户在使用前根据`usable_now`和`salvageable`标志进行过滤。
Tmax-Tasks-Clean is a high-quality dataset designed for terminal agent tasks, sourced from the `allenai/tmax-15k-open-instruct` project. The dataset is constructed through rigorous reward integrity filtering and multiple audit processes, aiming to ensure consistency between the environment, instructions, and verifiers for each task, making it suitable for reinforcement learning or supervised fine-tuning training. The dataset contains three splits: train (398 tasks, audited against eight categories of scoring criteria and successfully solved by a strong agent. Among them, 156 tasks were reviewed by two independent judges, and the remaining 242 were reviewed by one judge. Each task includes atomic records such as audit_verdict, passrate, trace, etc.), checking (207 tasks retained due to judge disagreements or defects found in subsequent reviews, not recommended for training), and legacy (641 tasks, an early version built based on heuristic selection, later found to have about 39.5% answer leakage through auditing, deprecated). The dataset fields include task ID, domain, image, instruction, split role, resolution information (passrate, peak resources), audit results, gold standard type, etc. The gold standard solutions are extracted from successful agent runs, divided into static (file tar packages) and procedural (action sequence replay) types, covering 93.7% of training tasks. The dataset also includes an additional audit result (audit_v4_verdict) that further classifies training tasks into currently usable (123), fixable (171), and unusable (104). Known limitations include: some tasks are reviewed by only one judge, verifiers can be bypassed, domain distribution is inconsistent with TerminalBench 2, etc. It is recommended that users filter tasks based on the `usable_now` and `salvageable` flags before use.
Tmax-Tasks-Clean 数据集详情
数据集简介
Tmax-Tasks-Clean 是一个终端智能体(Terminal-agent)任务数据集,来源于 allenai/tmax-15k-open-instruct,经过严格的奖励机制完整性过滤后构建而成。由于 tmax 原始数据集不提供参考解决方案,该数据集通过两种独立方式验证任务正确性:一是有强智能体实际成功解决问题,二是通过 LLM 评判审核检查验证器是否可被利用。
- 原始规模:14,601 个任务
- 保留规模:398 个任务(仅占 2.7%)
- 创建过程:首批构建的 641 个任务因审核发现其中 40% 可在容器中直接读出答案而被废弃。
数据划分
| 划分 | 行数 | 说明 | 可信度 |
|---|---|---|---|
| train | 398 | 通过 8 类别评判标准审核(依据 River, arXiv 2608.22631),且由 gpt-5.6-luna(最多尝试 3 次,至少成功 1 次)在干净镜像中成功解决。其中 156 个由两名独立评委审核,242 个由一名评委审核。 |
可用(仍有注意事项) |
| checking | 207 | 因两类原因保留而不用于训练:180 个为两名评委意见不一致(重新审核仅有 5 个合格,失败率约 97%,其中 52 个泄露答案);27 个因对抗性审核被撤回(如存在可达的镜像内参考、泄露判定或负载相关奖励)。 | 仅可审查,不可用于训练 |
| legacy | 641 | 早期构建版本,依据评分器强度启发式选择。后续审核发现 39.5% 存在答案泄露、10.8% 验证器过弱,其 passrate 不可靠。 |
已被取代 |
重建原因
早期 legacy 划分的启发式选择系统地偏爱了泄露模式:setup.sh 将验证器的参考文件嵌入到智能体可读的镜像中,验证器对同一文件进行模糊比对,导致 cp 命令无需完成任务即可得分。最终审核表明该启发式在「干净率」上毫无提升,却使答案泄露翻倍:
| 指标 | 启发式选择 | 中性抽取 | 效果 |
|---|---|---|---|
| 干净 | 44.4% | 44.8% | 0.99× 无提升 |
| 答案泄露 | 39.5% | 19.4% | 2.04× 更差 |
| 验证器过弱 | 10.8% | 20.8% | 0.52× 更好 |
Train 划分的领域分布
按 TerminalBench 2 领域规模降序排列(共 398 个任务,其中 373 个有已验证的解决方案):
| 领域 | 目标数量 | 实际拥有 | 已验证解决方案 |
|---|---|---|---|
| software-engineering | 116 | 49 | 48 |
| system-administration | 40 | 86 | 76 |
| scientific-computing | 36 | 35 | 33 |
| security | 36 | 49 | 42 |
| data-science | 36 | 18 | 18 |
| debugging | 22 | 75 | 72 |
| file-operations | 22 | 0 | 0 |
| model-training | 18 | 0 | 0 |
| data-processing | 18 | 33 | 32 |
| mathematics | 18 | 0 | 0 |
| machine-learning | 13 | 0 | 0 |
| data-querying | 4 | 53 | 52 |
| optimization | 4 | 0 | 0 |
| games | 4 | 0 | 0 |
| video-processing | 4 | 0 | 0 |
| personal-assistant | 4 | 0 | 0 |
该划分并非与 TB2 成比例:TB2 权重最高的软件工程领域差距最大;调试和数据查询领域超重数倍;16 个领域中 8 个完全没有任务。
金标准解决方案
由于 tmax 无参考解决方案,金标准从通过的智能体运行中提取,并由独立编写的测试工具在每个全新容器中重新验证。
金标准类型
| 类型 | 数量 | 说明 |
|---|---|---|
| 静态金标准 | 327 | 文件差异的 tar 包;解压至干净容器即可获得奖励 1 |
| 程序性金标准 | 46 | 智能体的动作序列(重放);适用于答案为「运行中服务」的任务 |
| 已验证金标准覆盖率 | 373/398(93.7%) | |
| 无金标准 | 25 | 已解决并有完整追踪,但无可复现的参考解决方案 |
无金标准的原因(25 个任务)
文件 tar 无法表达特定类型的答案:
| 答案实际形式 | 任务数 | 原因 |
|---|---|---|
| 运行中的服务 | 48 | 进程不是文件 |
| 写入五个监控根目录之外 | 4 | 快照未覆盖 |
| 需删除的文件 | 4 | tar 只能添加,无法删除 |
| 环境状态/已安装包 | 4 | 在监控根目录之外 |
最典型示例:任务要求「使用 Bash 命令保护此环境」,智能体通过修改文件权限正确解决,但文件内容未变,前后差异快照未捕获任何内容。
数据列说明
共享列:task_id、tb_domain、image、instruction、split_role
train + legacy:solver、passrate、peak_ram_mb/peak_disk_mb(含环境)、peak_ram_task_mb、ram_env_mb/disk_env_mb、ram_at_ceiling/disk_at_ceiling
train 独有:audit_verdict、audit_confidence、trace
checking 独有:opus_verdict/fable_verdict 及置信度和证据
所有划分均带金标准验证列:gold_type(static/procedural/none)、gold_verified(布尔值)、grader_timing_sensitive、gold_invalid
对抗性审查缺陷标志:
| 列名 | 含义 |
|---|---|
n_judge_passes |
阅读过该任务的独立评委次数 |
judge_disagreement |
至少一次判定有缺陷且另一次为干净 |
ever_flagged_answer_leak |
曾被判定为答案泄露;基于干净判定发布 |
unguarded_image_oracle |
验证器与镜像中遗留的参考程序比对,且未检查智能体是否直接包装或复制 |
plaintext_image_oracle |
参考为可读源码而非编译二进制 |
train 中需过滤的风险任务:246 个任务评委不足 2 人、18 个存在评委分歧、12 个曾被标记答案泄露、12 个存在两类 oracle 标志。
2026-08-30 重新审核结果
所有 398 个 train 行均按大幅加严的审核标准重新判定:
audit_v4_verdict |
行数 | 含义 |
|---|---|---|
| 干净 | 123 | 当前标准下健全 — usable_now |
| 指令-验证器不匹配 | 171 | 验证器正确,指令过度声明 |
| 验证器过弱 | 58 | 貌似合理的伪造输出可通过 — 奖励信号已损坏 |
| 答案泄露 | 34 | 答案或可运行参考可达 |
| 其他 | 12 | 非确定性、环境不匹配、歧义 |
- 171 个「指令-验证器不匹配」任务并非损坏任务,其中 167 个标记为可修复(扩展验证器以测试声明的要求)。
- 104 个既非
usable_now也非salvageable的任务不应被用于训练。
python sound = ds.filter(lambda r: r["usable_now"]) # 123 fixable = ds.filter(lambda r: r["salvageable"]) # 167
已知限制
- 答案泄露模式未完全消除:12 个任务的验证器与镜像中遗留的可执行参考程序比对,
ln -s指向该参考即可得奖励 1。其中 4 个已被行为学证实可利用。 - 行为学快捷测试发现两个额外问题任务:经过评委和普查双重认证后仍发现两个任务可通过符号链接获得奖励 1。
- 检测器基于名称,12 是下限:以
oracle/reference为关键词的普查无法检测其他命名的参考程序。 - 解决门无法检测此类问题:当捷径同样通过时,通过仅说明「找到了验证器接受的内容」。
- 大多数任务仅有一名评委:242 个任务仅由一名评委审核;第二名评委否定第一名干净判定的比例为 21%(310 例中 65 例)。
- 领域分布与 TerminalBench 2 有偏差:可用率从软件工程的 30.6% 到数据处理领域的 67.2% 不等。
文件结构
splits/{train,checking,legacy}.parquet 三个划分(统一模式) verified_tasks.tar 训练任务包(398 个) verified_traces.tar 训练智能体追踪(每任务一个,gzip jsonl) gold_static.tar 327 个静态金标准(独立重新验证) gold_procedural.tar 46 个程序性金标准(服务任务) gold_held_back.tar 25 个撤回任务的解决方案 data/tasks-00000.tar 遗留任务包(641 个) PROCESS.md 完整构建日志 AUDIT_PROMPT.md 评判提示词(v1 失败与 v2)
评分方式
在任务的 image 中运行智能体,仅在智能体停止后上传 tests/,运行 bash tests/test.sh;奖励写入 /logs/verifier/reward.txt。




