遇见数据集

Tmax-Tasks-Clean

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

Tmax-Tasks-Clean 是一个专为终端代理任务设计的高质量数据集,源自 `allenai/tmax-15k-open-instruct` 项目。该数据集通过严格的奖励完整性过滤和多重审计流程构建,旨在确保每个任务的环境、指令和验证器之间相互一致,适合用于强化学习或监督微调训练。数据集包含三个分割:train(398个任务,通过八类评分标准的审计,并被一个强代理成功解决。其中156个任务由两名独立法官审阅,其余242个由一名法官审阅。每个任务包含原子记录如audit_verdict、passrate、trace等)、checking(207个任务,因法官分歧或后续审查发现缺陷而被保留,不推荐用于训练)、legacy(641个任务,是早期基于启发式选择构建的版本,后经审计发现约39.5%存在答案泄漏,已弃用)。数据集的字段涵盖任务ID、领域、镜像、指令、分割角色、解决信息(passrate、资源峰值)、审计结果、金标准类型等。金标准解决方案从成功的代理运行中提取,分为静态(文件tar包)和过程性(动作序列重放)两种,覆盖93.7%的训练任务。数据集还包含一个额外的审计结果(audit_v4_verdict),将训练任务进一步分类为“当前可用”(123个)、“可修复”(171个)和“不可用”(104个)。已知限制包括:部分任务仅由一名法官审阅、存在验证器可被绕过、域名分布与TerminalBench 2不一致等。建议用户在使用前根据`usable_now`和`salvageable`标志进行过滤。

Tmax-Tasks-Clean is a high-quality dataset designed for terminal agent tasks, sourced from the `allenai/tmax-15k-open-instruct` project. The dataset is constructed through rigorous reward integrity filtering and multiple audit processes, aiming to ensure consistency between the environment, instructions, and verifiers for each task, making it suitable for reinforcement learning or supervised fine-tuning training. The dataset contains three splits: train (398 tasks, audited against eight categories of scoring criteria and successfully solved by a strong agent. Among them, 156 tasks were reviewed by two independent judges, and the remaining 242 were reviewed by one judge. Each task includes atomic records such as audit_verdict, passrate, trace, etc.), checking (207 tasks retained due to judge disagreements or defects found in subsequent reviews, not recommended for training), and legacy (641 tasks, an early version built based on heuristic selection, later found to have about 39.5% answer leakage through auditing, deprecated). The dataset fields include task ID, domain, image, instruction, split role, resolution information (passrate, peak resources), audit results, gold standard type, etc. The gold standard solutions are extracted from successful agent runs, divided into static (file tar packages) and procedural (action sequence replay) types, covering 93.7% of training tasks. The dataset also includes an additional audit result (audit_v4_verdict) that further classifies training tasks into currently usable (123), fixable (171), and unusable (104). Known limitations include: some tasks are reviewed by only one judge, verifiers can be bypassed, domain distribution is inconsistent with TerminalBench 2, etc. It is recommended that users filter tasks based on the `usable_now` and `salvageable` flags before use.

创建时间:
2026-08-27
原始信息汇总

Tmax-Tasks-Clean 数据集详情

数据集简介

Tmax-Tasks-Clean 是一个终端智能体(Terminal-agent)任务数据集,来源于 allenai/tmax-15k-open-instruct,经过严格的奖励机制完整性过滤后构建而成。由于 tmax 原始数据集不提供参考解决方案,该数据集通过两种独立方式验证任务正确性:一是有强智能体实际成功解决问题,二是通过 LLM 评判审核检查验证器是否可被利用。

  • 原始规模:14,601 个任务
  • 保留规模:398 个任务(仅占 2.7%)
  • 创建过程:首批构建的 641 个任务因审核发现其中 40% 可在容器中直接读出答案而被废弃。

数据划分

划分 行数 说明 可信度
train 398 通过 8 类别评判标准审核(依据 River, arXiv 2608.22631),且由 gpt-5.6-luna(最多尝试 3 次,至少成功 1 次)在干净镜像中成功解决。其中 156 个由两名独立评委审核,242 个由一名评委审核。 可用(仍有注意事项)
checking 207 因两类原因保留而不用于训练:180 个为两名评委意见不一致(重新审核仅有 5 个合格,失败率约 97%,其中 52 个泄露答案);27 个因对抗性审核被撤回(如存在可达的镜像内参考、泄露判定或负载相关奖励)。 仅可审查,不可用于训练
legacy 641 早期构建版本,依据评分器强度启发式选择。后续审核发现 39.5% 存在答案泄露、10.8% 验证器过弱,其 passrate 不可靠。 已被取代

重建原因

早期 legacy 划分的启发式选择系统地偏爱了泄露模式setup.sh 将验证器的参考文件嵌入到智能体可读的镜像中,验证器对同一文件进行模糊比对,导致 cp 命令无需完成任务即可得分。最终审核表明该启发式在「干净率」上毫无提升,却使答案泄露翻倍:

指标 启发式选择 中性抽取 效果
干净 44.4% 44.8% 0.99× 无提升
答案泄露 39.5% 19.4% 2.04× 更差
验证器过弱 10.8% 20.8% 0.52× 更好

Train 划分的领域分布

按 TerminalBench 2 领域规模降序排列(共 398 个任务,其中 373 个有已验证的解决方案):

领域 目标数量 实际拥有 已验证解决方案
software-engineering 116 49 48
system-administration 40 86 76
scientific-computing 36 35 33
security 36 49 42
data-science 36 18 18
debugging 22 75 72
file-operations 22 0 0
model-training 18 0 0
data-processing 18 33 32
mathematics 18 0 0
machine-learning 13 0 0
data-querying 4 53 52
optimization 4 0 0
games 4 0 0
video-processing 4 0 0
personal-assistant 4 0 0

该划分并非与 TB2 成比例:TB2 权重最高的软件工程领域差距最大;调试和数据查询领域超重数倍;16 个领域中 8 个完全没有任务

金标准解决方案

由于 tmax 无参考解决方案,金标准从通过的智能体运行中提取,并由独立编写的测试工具在每个全新容器中重新验证。

金标准类型

类型 数量 说明
静态金标准 327 文件差异的 tar 包;解压至干净容器即可获得奖励 1
程序性金标准 46 智能体的动作序列(重放);适用于答案为「运行中服务」的任务
已验证金标准覆盖率 373/398(93.7%)
无金标准 25 已解决并有完整追踪,但无可复现的参考解决方案

无金标准的原因(25 个任务)

文件 tar 无法表达特定类型的答案:

答案实际形式 任务数 原因
运行中的服务 48 进程不是文件
写入五个监控根目录之外 4 快照未覆盖
删除的文件 4 tar 只能添加,无法删除
环境状态/已安装包 4 在监控根目录之外

最典型示例:任务要求「使用 Bash 命令保护此环境」,智能体通过修改文件权限正确解决,但文件内容未变,前后差异快照未捕获任何内容。

数据列说明

共享列task_idtb_domainimageinstructionsplit_role

train + legacysolverpassratepeak_ram_mb/peak_disk_mb(含环境)、peak_ram_task_mbram_env_mb/disk_env_mbram_at_ceiling/disk_at_ceiling

train 独有audit_verdictaudit_confidencetrace

checking 独有opus_verdict/fable_verdict 及置信度和证据

所有划分均带金标准验证列gold_type(static/procedural/none)、gold_verified(布尔值)、grader_timing_sensitivegold_invalid

对抗性审查缺陷标志

列名 含义
n_judge_passes 阅读过该任务的独立评委次数
judge_disagreement 至少一次判定有缺陷且另一次为干净
ever_flagged_answer_leak 曾被判定为答案泄露;基于干净判定发布
unguarded_image_oracle 验证器与镜像中遗留的参考程序比对,且未检查智能体是否直接包装或复制
plaintext_image_oracle 参考为可读源码而非编译二进制

train 中需过滤的风险任务:246 个任务评委不足 2 人、18 个存在评委分歧、12 个曾被标记答案泄露、12 个存在两类 oracle 标志。

2026-08-30 重新审核结果

所有 398 个 train 行均按大幅加严的审核标准重新判定:

audit_v4_verdict 行数 含义
干净 123 当前标准下健全 — usable_now
指令-验证器不匹配 171 验证器正确,指令过度声明
验证器过弱 58 貌似合理的伪造输出可通过 — 奖励信号已损坏
答案泄露 34 答案或可运行参考可达
其他 12 非确定性、环境不匹配、歧义
  • 171 个「指令-验证器不匹配」任务并非损坏任务,其中 167 个标记为可修复(扩展验证器以测试声明的要求)。
  • 104 个既非 usable_now 也非 salvageable 的任务不应被用于训练

python sound = ds.filter(lambda r: r["usable_now"]) # 123 fixable = ds.filter(lambda r: r["salvageable"]) # 167

已知限制

  • 答案泄露模式未完全消除:12 个任务的验证器与镜像中遗留的可执行参考程序比对,ln -s 指向该参考即可得奖励 1。其中 4 个已被行为学证实可利用。
  • 行为学快捷测试发现两个额外问题任务:经过评委和普查双重认证后仍发现两个任务可通过符号链接获得奖励 1。
  • 检测器基于名称,12 是下限:以 oracle/reference 为关键词的普查无法检测其他命名的参考程序。
  • 解决门无法检测此类问题:当捷径同样通过时,通过仅说明「找到了验证器接受的内容」。
  • 大多数任务仅有一名评委:242 个任务仅由一名评委审核;第二名评委否定第一名干净判定的比例为 21%(310 例中 65 例)。
  • 领域分布与 TerminalBench 2 有偏差:可用率从软件工程的 30.6% 到数据处理领域的 67.2% 不等。

文件结构

splits/{train,checking,legacy}.parquet 三个划分(统一模式) verified_tasks.tar 训练任务包(398 个) verified_traces.tar 训练智能体追踪(每任务一个,gzip jsonl) gold_static.tar 327 个静态金标准(独立重新验证) gold_procedural.tar 46 个程序性金标准(服务任务) gold_held_back.tar 25 个撤回任务的解决方案 data/tasks-00000.tar 遗留任务包(641 个) PROCESS.md 完整构建日志 AUDIT_PROMPT.md 评判提示词(v1 失败与 v2)

评分方式

在任务的 image 中运行智能体,仅在智能体停止后上传 tests/,运行 bash tests/test.sh;奖励写入 /logs/verifier/reward.txt

搜集汇总
数据集介绍
Tmax-Tasks-Clean 数据集图片
构建方式
Tmax-Tasks-Clean数据集源自allenai/tmax-15k-open-instruct,历经严苛的多阶段筛选与审计流程构建而成。初始的14,601项任务经初步过滤后,仅保留398项(占比2.7%),且早期构建的641项因审计发现40%存在答案泄露问题而被弃用。构建核心在于双轨验证:一方面由强智能体(gpt-5.6-luna)在纯净镜像中成功求解,另一方面依托基于River论文的八维度LLM评分标准进行独立审计,并辅以对抗性审查与行为捷径测试,确保任务环境、指令与验证器三者间的一致性。最终数据划分为三个子集:train(398项,通过审计且可解)、checking(207项,因法官分歧或缺陷被扣留)、legacy(641项,因方法论缺陷被取代但保留溯源价值)。
特点
该数据集的显著特征在于其极致的纯净性与透明性。每项任务均附带完整的审计判定、求解率、资源消耗峰值及智能体轨迹,且93.7%的任务具备可复现的金标准解(静态文件tar或程序性动作序列)。尤为独特的是,数据集中明确标注了各类潜在缺陷标记,如法官分歧、答案泄露风险、未防护的图像预言机等,并提供了基于更严格再审标准(audit_v4)的可用性分类(usable_now与salvageable),其中123项可直接训练,167项需扩展验证器后使用。此外,黄金解均经过独立容器重验证,确保其真实性,而资源列区分环境包含与任务归因,为强化学习训练提供了不可或缺的可靠性保障。
使用方法
使用者可通过HuggingFace datasets库加载数据,并根据需求灵活筛选子集及质量标记。基础加载方式为`load_dataset("Fzz1/Tmax-Tasks-Clean", split="train")`,可进一步过滤`usable_now`或`salvageable`字段以获取即时可用或需修复的任务。对于黄金解,静态解文件应解压至任务容器的根目录(`tar -xzpf <task_id>.solution.tar.gz -C /`),随后运行测试脚本即可验证奖励;程序性解则需重放智能体动作序列以重建服务状态。使用时务必参考PROCESS.md与AUDIT_PROMPT.md文档,并谨慎对待单法官审计的任务及有缺陷标记的条目,建议结合领域分布偏差进行子采样,以适配特定研究需求。
背景与挑战
背景概述
Tmax-Tasks-Clean数据集由艾伦人工智能研究所在2026年构建,旨在为终端代理强化学习提供高质量训练任务。它从包含14,601个任务的原始池中严格筛选,仅保留398个通过LLM审计与强代理求解双重验证的样本,聚焦于软件工程、系统管理等16个领域。该数据集的核心贡献在于揭露了奖励机制的脆弱性(如答案泄露),并建立了多阶段审计流程,其结论与River(arXiv:2608.22631)等理论不谋而合,对终端智能体环境设计具有深远影响。作为首个公开的、强调奖励完整性的终端任务集,它推动了从朴素启发式过滤向多维度鲁棒性验证的范式转变,在2026年相关研究中被广泛引用。
当前挑战
数据集面临的主要挑战源于终端环境任务的高复杂度:其一,领域层面,如软件工程等要求多步交互与上下文依赖的任务,其评估设计易受奖励欺骗(如通过单行符号链接获取满分),彻底杜绝此类捷径需无参考解的完备验证;其二,构建过程中,原始启发式筛选方法竟将答案泄露率提高2.04倍,暴露出任务难度与漏洞信号的固有相关性,促使开发出结合LLM多评委共识、行为捷径测试等三级防御体系;此外,领域分布失衡(如8个域为0样本)、多数任务仅单评委审核(分歧率达21%)、以及动态服务类答案无法用静态文件表达等,均是持续待解的技术挑战。
常用场景
经典使用场景
Tmax-Tasks-Clean数据集源自Tmax-15k开放式指令集,经过严苛的奖励机制完整性筛选,仅保留2.7%的高质量终端代理任务。该数据集的核心使用场景在于训练和评估基于终端交互的智能代理(agent),这些代理需在给定的容器环境中,依据自然语言指令完成软件工程、系统管理、科学计算等领域的实际操作。任务设计强调指令、环境与验证器三者间的逻辑一致性,为强化学习(RL)环境下的代理行为训练提供了可靠基准。研究人员可利用其标准化的任务拆分、丰富的元数据(如通过率、资源占用)以及经过独立复核的金标准解决方案,开展代理的泛化能力、鲁棒性及任务解决策略的深入研究。
实际应用
在实际应用中,此数据集可用于开发能够自主完成复杂IT运维和软件开发任务的智能助手。例如,训练出的代理可依据用户指令在隔离的Linux环境中进行系统配置、代码调试、数据处理或安全审计,其通过执行bash命令、修改文件等操作完成目标。该数据集强调任务的可执行性和验证的严格性,使得基于其训练的代理在自动化运维、DevOps、智能编程辅助等领域具有潜在应用价值。其金标准解决方案(包括静态文件快照和过程性操作记录)可用于自动生成任务演示或作为模仿学习的专家轨迹,而资源消耗和时序敏感性的标注则有助于在实际部署中对代理性能进行预估和优化。
衍生相关工作
该数据集构建过程中衍生了诸多可复用的学术资产与方法。其详尽的构建日志(PROCESS.md)和审计工具(AUDIT_PROMPT.md)为社区提供了可操作的数据集质量评估框架,其八类别审计准则可应用于其他环境型任务数据集的过滤。此外,其验证的金标准提取流程——涵盖静态文件差分和过程性操作回放两种范式——为无法提供参考解决方案的动态任务(如需维持运行服务)设计了创新的解决方案表示方法。这些衍生工作,包括行为学捷径检测方法和对验证器-指令匹配度的深入分析,不仅对终端代理研究有用,也为更广泛的基于环境交互的智能体数据工程提供了重要的方法和工具,推动了该领域向更严谨、更可信的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务