遇见数据集

infra-as-code-trajectories

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

Infra As Code Trajectories 是一个由 Grok 4.6 通过合成数据工厂生成的合成数据集,旨在解决 Terraform 和 Kubernetes 中遗留对象的基础设施即代码(IaC)修复问题。该数据集包含 5208 条原始记录,分布在多个 JSONL 文件中(batch-r01.jsonl 至 batch-r2604.jsonl),总大小约 28699 KB。数据集的发布状态为原始未整理版本,不适用于直接训练,仅供检查和复现。数据集的语言为英语,采用 Apache 2.0 许可证。它被设计为通用代理研究数据集,独立于 Fable 5 集合,且未被标记为 Spikenaut 训练数据。计划中的策展训练版本将在后续审计和导出后发布,当前版本不应作为训练语料库使用。

Infra As Code Trajectories is a synthetic dataset generated by Grok 4.6 via a synthetic data factory, designed to address infrastructure-as-code (IaC) remediation issues for legacy objects in Terraform and Kubernetes. The dataset contains 5208 raw records distributed across multiple JSONL files (batch-r01.jsonl to batch-r2604.jsonl), with a total size of approximately 28699 KB. The release status is the raw, uncurated version, which is not suitable for direct training and is intended only for inspection and reproduction. The dataset language is English, licensed under Apache 2.0. It is designed as a general agent research dataset, independent of the Fable 5 collection, and is not marked as Spikenaut training data. A curated training version is planned for future release after auditing and export; the current version should not be used as a training corpus.

创建时间:
2026-08-19
原始信息汇总

Infra As Code Trajectories 数据集详情

数据集概述

该数据集围绕 Terraform/Kubernetes 遗留对象的基础设施即代码(IaC)修复任务构建,属于合成数据类别,用于代理式工作流研究。

关键信息

  • 数据集名称: Infra As Code Trajectories
  • 许可证: Apache-2.0
  • 语言: 英语
  • 数据标签: synthetic-data、agentic-workflows、grok-4.6、provenance、trajectories、terraform、kubernetes、iac

数据来源与生成

  • 底层合成数据由 Grok 4.6 通过合成数据工厂代理通道生成
  • 工厂标识: infra-as-code-factory
  • 源路径: outputs/raw/2026-08-19-agentic/infra-as-code-factory/

当前发布状态

原始数据已公开,位于 data/raw/ 目录,包含 5208 条记录,分布在 data/raw/batch-r01.jsonldata/raw/batch-r2604.jsonl 文件中(约 28699 KB)。支持性说明文档位于 data/metadata/NOTES-*.md

重要声明

  • 当前数据为公开原始证据快照,尚未经过整理,不具备训练就绪状态
  • 该 Hub 副本并非精选训练导出,工厂源仍是写入目标
  • 公开可见性不代表训练就绪性

计划中的精选发布

精选训练数据集的发布仍需等待后续审计和导出流程,此仓库不应被视为训练语料库

相关资源链接

许可证说明

本公开原始发布采用 Apache License 2.0 许可,该许可授予重用权限,但并不使记录具备训练就绪性或代表真实世界的实际测量数据。

搜集汇总
数据集介绍
infra-as-code-trajectories 数据集图片
构建方式
在基础设施即代码(IaC)的运维实践中,Terraform与Kubernetes配置漂移及残留对象修复长期依赖人工经验,而高质量修复轨迹的稀缺制约了智能体在该领域的能力评估。该数据集由Grok 4.6模型经Synthetic Data Factory智能体流水线批量生成,工厂标识为infra-as-code-factory,原始输出经快照落盘后按批次序列化为JSONL文件,共收录5208条原始记录,分布于2604个批次文件中。生成过程未引入人工标注,完全依托模型在受控环境内对IaC修复任务的自主推演,配套的说明文档与权利记录文件共同构成可追溯的构建证据链。
特点
该数据集聚焦Terraform与Kubernetes环境下遗留对象的IaC修复任务,以智能体轨迹为基本单元,完整保留了模型在诊断、规划与修正各阶段的行为序列。其显著特征在于双重属性:一方面作为研究型语料,承载了前沿模型在真实运维语义下的推理痕迹,可用于智能体工作流分析与评估;另一方面,发布方明确将其界定为仅限研究的遗留语料,记录中标记的training_ready为false,且项目政策禁止其进入任何模型权重更新流程。此外,数据集附带机器可读的权利记录与贡献者角色分解,为合规审查提供了细粒度依据。
使用方法
研究者可通过HuggingFace仓库直接获取data/raw/目录下的JSONL批次文件,逐行解析智能体轨迹以开展IaC修复行为的观察与复现研究,元数据目录中的说明文档辅助理解生成上下文与批次划分。使用前须审阅rights.json所载的保留、评估与再分发状态,当前各项状态均处于未决且默认关闭的合规姿态。鉴于该发布为原始未策展载荷,数据未经清洗与验证,不宜直接用于训练或微调,仅适合作为研究性检查、可复现性验证及智能体行为分析的输入素材。
背景与挑战
背景概述
基础设施即代码(IaC)范式在云原生时代的迅速普及,使Terraform与Kubernetes等编排工具成为现代运维的核心支柱,而配置漂移、残留对象与声明式修复的自动化研究亦随之兴起。infra-as-code-trajectories数据集于2026年8月由Synthetic Data Factory项目团队构建并公开发布,其合成记录由Grok 4.6模型经由agentic生成流水线产生,聚焦Terraform/Kubernetes残留对象的IaC修复任务。该数据集以5208条原始记录构成公开证据快照,为基础设施修复领域的智能体研究提供了可复现的轨迹语料,并因其明确的“仅限研究”定位而在数据治理层面具有示范意义。
当前挑战
该数据集所面向的领域问题,在于基础设施即代码修复中残留对象的自动识别与声明式消解,其难点在于Terraform状态文件与Kubernetes实际集群状态之间的复杂偏差关系,以及修复动作需在幂等性、安全性与最小变更原则下保持正确。构建过程中的挑战同样显著:合成轨迹须忠实反映真实运维场景中的多步推理与工具调用,而原始载荷被明确标注为未经整理的public raw数据,尚未达到训练就绪标准;此外,许可与保留状态因provider、渠道与日期而异,并在未决期间采取fail-closed策略,进一步限制了语料的可用范围。
常用场景
经典使用场景
在基础设施即代码(Infrastructure as Code, IaC)领域,配置漂移与残留资源修复长期构成运维自动化的核心挑战。该数据集以Terraform与Kubernetes为技术底座,聚焦“遗留对象修复”这一典型任务,构建了由Grok 4.6智能体生成的轨迹样本。每条记录完整刻画了智能体在检测到基础设施状态与声明式配置不一致后,如何定位孤立资源、推断修复策略并执行变更的决策链条。研究者可借此基准评测智能体在多步骤规划、工具调用及错误恢复中的综合能力,亦可用于分析智能体在真实IaC工作流中的行为模式与失败机制。
实际应用
在工程实践中,该数据集可作为智能体驱动的基础设施自动化运维研究的基础素材。典型应用涵盖:训练评估智能体执行Terraform计划与Kubernetes清单的差异消解,辅助开发面向云原生环境的自动修复工具,以及构建仿真环境以测试智能体对配置漂移的响应策略。尽管当前发布版本明确标注为研究专用且不可用于模型权重更新,其原始记录的公开仍为工业界理解智能体在真实IaC场景中的表现边界提供了宝贵的参照,并为后续构建经过审计的策展数据集奠定了证据基础。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于合成数据工厂项目的后续迭代与评测体系构建。与其直接关联的包括rmems/synthetic-factory项目中记录的政策决策与技术路线,以及基于Grok 4.6智能体工厂所产出的其他轨迹数据集。该数据集亦激发了关于智能体轨迹数据权利治理与训练就绪性评估的讨论,相关实践体现在rights.json与ATTRIBUTION.md等元数据规范中。此外,它推动了基础设施即代码领域内智能体基准测试的探索,为后续研究者在轨迹标注、任务分解及安全约束建模等方向提供了可借鉴的起点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务