遇见数据集

TerminalWorld-Seeds-Clean

收藏
Hugging Face2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

TerminalWorld Seeds, oracle-validated 是 TerminalWorld-Seeds 的一个经过验证的子集,专注于终端任务(terminal tasks)。该数据集只包含那些在公共基础设施上,从发布的 task package 出发,能够成功构建环境、运行参考解决方案并完成验证器(test.sh 退出码0)的任务。然而,后续修正指出,退出码0仅表示验证器成功执行,并不保证参考解决方案实际通过测试。因此,数据集中每个任务都包含一个 `reward_verdict` 列(取值为 pass、fail 或 unknown),用于指示参考解决方案是否真正获得通过分数(reward.txt == 1)。在 1,353 个任务中,有 784 个任务的参考解决方案实际通过,456 个任务构建运行但得分为零,113 个任务因环境构建失败而无法判断。此外,数据集还提供了 `reference_partial` 列,标记那些参考解决方案注释为“# Partial:”的任务(即故意只实现部分功能),以及 `verdict_flipped` 列,标记在多次验证中结果发生翻转的任务。数据集的布局与父数据集一致,遵循 Recursive-Task-Synthesis 的发布格式,因此现有加载器可以无修改使用。该数据集还包含资源需求信息:`req_cpus`、`req_memory_mb`、`base_image` 和 `est_disk_mb`,方便用户按任务分配内存和磁盘。验证在 udocker(基于 PRoot 的根模拟)和 Daytona 云端沙箱上运行,所有验证结果均记录在 `metadata/tasks.parquet` 中。请注意,该数据集包含 harbor-canary 标记,用于检测基准数据泄露,其预期用途是作为合成种子(synthesis seeds),用于生成更困难的任务,而非直接训练。如果使用该数据集收集的轨迹进行训练,将导致模型在 TerminalWorld 基准测试中受到污染。数据集来源为 EuniAI/TerminalWorld,许可证为 CC-BY-4.0。

TerminalWorld Seeds, oracle-validated is a validated subset of TerminalWorld-Seeds, focusing on terminal tasks. This dataset contains only those tasks that can successfully build the environment, run the reference solution, and complete the validator (test.sh exit code 0) on public infrastructure starting from the published task package. However, subsequent corrections indicate that exit code 0 only means the validator executed successfully, not that the reference solution actually passed the test. Therefore, each task in the dataset includes a `reward_verdict` column (values: pass, fail, unknown) indicating whether the reference solution truly achieved a passing score (reward.txt == 1). Among 1,353 tasks, 784 reference solutions actually passed, 456 tasks built and ran but scored zero, and 113 tasks were indeterminate due to environment build failures. Additionally, the dataset provides a `reference_partial` column marking tasks where the reference solution has a comment "# Partial:" (i.e., intentionally partial implementations), and a `verdict_flipped` column marking tasks whose results flipped across multiple validations. The dataset layout is consistent with the parent dataset, following the Recursive-Task-Synthesis release format, so existing loaders can be used without modification. The dataset also includes resource requirement information: `req_cpus`, `req_memory_mb`, `base_image`, and `est_disk_mb`, allowing users to allocate memory and disk per task. Validation was performed on udocker (PRoot-based root emulation) and Daytona cloud sandboxes, with all validation results logged in `metadata/tasks.parquet`. Note that this dataset contains harbor-canary markers for detecting benchmark data leakage. Its intended use is as synthesis seeds to generate more difficult tasks, not for direct training. Using trajectories collected from this dataset for training will cause model contamination on the TerminalWorld benchmark. The dataset source is EuniAI/TerminalWorld, and the license is CC-BY-4.0.

创建时间:
2026-08-13
原始信息汇总

数据集概述:TerminalWorld Seeds, oracle-validated

基本信息

  • 许可证:CC-BY-4.0
  • 数据集类型:终端任务数据集(terminal tasks),包含指令、环境、参考解决方案和私有验证器
  • 数据格式:Parquet(metadata/tasks.parquet),默认配置,包含训练集
  • 来源:从父数据集 andylizf/TerminalWorld-Seeds 筛选而来,布局遵循 Zhongzhi1228/Recursive-Task-Synthesis 发布格式,兼容现有加载器

数据集内容

  • 任务总数:1,353 个任务(父语料共 1,530 个任务)
  • 筛选标准:环境可构建、参考解决方案可运行、验证器可完成执行
  • 关键列
    • reward_verdict:验证结果(pass / fail / unknown
    • verdict_flipped:是否在多次尝试中出现过通过又失败的情况(54 个任务标记)
    • reference_partial:参考解决方案是否部分实现任务(55 个任务标记)
    • run_mode:验证环境类型(entrypoint / entrypoint_bypassed
    • dockerfile_repaired:是否修复了 Dockerfile 中的 heredoc 空格问题(22 个任务标记)

验证准确性说明

  • 861 个任务的参考解决方案实际获得通过分数(reward.txt == 1
  • 446 个任务构建和运行成功但得分为零
  • 46 个任务因环境构建失败无法判定(属于运行器限制,并非任务缺陷)
  • 若需参考解决方案确实可解决的任务,应过滤 reward_verdict == "pass"

资源需求列

列名 说明 覆盖率 中位数
req_cpus 任务声明的 CPU 需求 1,496/1,530 1
req_memory_mb 任务声明的内存需求 1,316/1,530 2,048
base_image Dockerfile 基础镜像 1,530/1,530 ubuntu:22.04(50%)
est_disk_mb 估算磁盘需求(非声明) 1,523/1,530 1,108

验证方法与限制

  • 运行环境:使用 udocker(PRoot 根模拟)、真实 Docker 和 Daytona 云沙箱进行验证
  • 入口点处理:支持镜像自带的入口点(entrypoint),部分任务依赖入口点提供本地服务
  • 构建上下文处理:将需要外部上传文件的 Dockerfile 重写为内联形式(文本用 heredoc,二进制用 base64)
  • 判定原则:验证结果为最后一次尝试的结果,而非最佳结果

使用注意事项

  • 金丝雀标记:任务内容包含 TerminalWorld 的 harbor-canary 标记,意图作为合成种子(synthesis seeds),不应用于训练语料,否则会污染 TerminalWorld 排行榜评估
  • 未经裁决的审查项:词法审计标记了 48 个验证器断言路径完全不可见的任务,以及 3 个指令泄露验证器路径的任务,但均未人工裁定,可能有大量误报

引用与归属

搜集汇总
数据集介绍
TerminalWorld-Seeds-Clean 数据集图片
构建方式
本数据集源自TerminalWorld-Seeds的严苛筛选与验证流程,其构建核心在于对每个终端任务实施可执行性证明。验证过程包括构建环境、运行参考解决方案及执行测试脚本,仅保留验证器成功退出且环境构建无误的任务。特别地,所有任务均经过Docker环境的双重校验,并依据验证器输出文件中的奖励分数重新判定,确保任务内在一致性。此外,构建过程对Dockerfile进行了必要的修复,如调整heredoc间距,并记录了入口点执行模式,以保任务在多种运行环境下的可复现性。
使用方法
本数据集以Parquet格式存储任务元数据,并遵循与父数据集及RST发布版相同的布局,确保了与现有加载器的直接兼容性。研究者可直接使用HuggingFace的datasets库加载,并根据列信息进行筛选,例如选取reward_verdict为'pass'的任务用于训练或评估。对于需要资源规划的任务,可利用req_memory_mb和est_disk_mb进行沙箱大小配置。此外,数据集提供了任务内容,可作为任务合成的种子,但需注意其含有的canary标记,避免用于直接训练以防止基准测试数据泄露。
背景与挑战
背景概述
TerminalWorld-Seeds-Clean 数据集由研究团队于2026年创建,基于 TerminalWorld 基准(arXiv:2605.22535),旨在为终端代理(terminal agents)提供经过验证的任务种子集合。该数据集由 andylizf 等人发布,隶属于与 Recursive-Task-Synthesis 相关的任务综合(task synthesis)体系,其核心研究问题在于确保每个任务的可执行性:即环境可构建、参考解决方案可运行且验证器能完成判定。通过大规模的 Docker 和 udocker 验证流程,团队对 1,530 个候选任务逐一检查,最终筛选出 1,353 个内部一致的任务,并额外提供 reward_verdict、reference_partial 和 verdict_flipped 等元数据列,供下游用户按需选择。该数据集对强化学习和智能体训练领域具有重要影响,为任务综合和验证流程树立了新标准,尤其在处理环境依赖性、版本漂移和验证器失效等问题上提供了实践范式。
当前挑战
该数据集面临的核心挑战源于终端任务的固有复杂性。首先,领域问题层面,终端任务要求环境、指令、参考解决方案和私有验证器四者严格契合,但现实世界中基础镜像的过时、包镜像服务关闭及文件缺失常导致任务在作者基础设施之外失效,使得训练时奖励信号恒为零,浪费计算资源。其次,构建过程中,验证标准历经重要修正:早期基于退出码的判定被揭示为不充分,因部分脚本退出码为 0 且忽略 pytest 结果,导致通过率虚高;后续重验证发现 1,353 个任务中仅 861 个参考解决方案真正获得通过分数,且存在 55 个标注为部分实现(# Partial:)的任务。此外,Docker 构建中的 entrypoint 抑制、heredoc 空格解析限制等工程问题,以及网络请求导致的验证结果翻转(54 个任务曾翻转)均构成挑战,迫使研究者仔细区分任务缺陷与运行器限制,并引入 run_mode、dockerfile_repaired 等标注以记录环境差异。
常用场景
经典使用场景
TerminalWorld-Seeds-Clean数据集为终端交互智能体研究提供了经过严格验证的高质量任务集。其核心用途在于,为训练和评估基于终端命令行的自主代理(autonomous agents)提供真实、可复现的基准环境。该数据集精心筛选出环境可构建、参考解决方案可执行且验证器能完整运行的任务,剔除了因基础设施故障或任务自身缺陷导致无法评估的样本,从而确保研究者在一个纯净、可靠的测试平台上衡量智能体在文件操作、软件安装、网络请求等命令序列规划方面的性能。这种“可执行证明”的筛选机制,使其成为开发鲁棒性终端智能体的理想起点,尤其在强化学习环境中,避免了因任务不可解而带来的无效训练开销。
解决学术问题
该数据集直面终端任务合成与验证中的关键学术挑战,即如何确保证合成的任务集在脱离原始创作环境后仍保持其内在一致性。它通过执行参考解决方案并运行私有验证器,提供了一种自动化、可扩展的任务质量审计方法,解决了传统数据集构建中依赖人工检查或仅基于静态元数据筛选的局限。其重要贡献在于揭示了“验证器退出码为0”与“参考方案真正通过测试”之间的显著差距,并引入了`reward_verdict`等细粒度标注,为研究任务难度、可解性与验证器设计之间的关系提供了宝贵的数据基础,进而推动了更可靠的任务生成与评估协议的研究。
实际应用
在实际应用中,TerminalWorld-Seeds-Clean可用于开发面向真实运维场景的智能助手,例如自动化的服务器配置、软件部署、日志分析及故障排查系统。其数据所附带的资源需求估算(如内存、磁盘)和基础镜像信息,直接支持在资源受限的云沙箱环境中进行大规模并行评估与训练,有助于构建能够自主操作Linux终端的AI代理,从而提升DevOps和系统管理任务的自动化水平。此外,该数据集的灵活筛选机制(如依据`reward_verdict`和`reference_partial`列)使企业能够根据自身对任务可靠性的需求,灵活调整训练集的质量门槛,以适配从教学演示到高风险生产环境的不同场景。
数据集最近研究
最新研究方向
在智能体与终端环境交互的实证研究中,数据集的生态完整性与可复现性成为当前关注的核心议题。TerminalWorld-Seeds-Clean的发布,标志着对合成任务基准进行系统性验证的新阶段,其通过真实Docker环境对参考解决方案进行严格评审,揭示了任务内部一致性与外部可执行性之间的微妙裂隙。该数据集不仅提供了细粒度的奖励判定标注,还引入了对任务部分实现、运行环境敏感性等复杂特性的显式标记,为研究者在强化学习、任务合成及智能体评估等领域提供了更为可靠与透明的实验基底。其关于验证器与指令间潜在信息泄漏的审慎分析,以及对金丝雀标记的强调,进一步推动了基准测试方法论向严谨性与伦理规范性的纵深发展,对于构建可泛化、可解释的智能终端代理具有重要的学术与实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务