遇见数据集

infraset

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

InfraSet 是一个开放数据集,记录了 LLM 执行基础设施任务的过程和结果。该数据集旨在为 LLM 在真实系统(包括新部署、已有系统、生命周期末期或分布式环境)中的操作表现提供实证数据。当前版本包含 800 个任务和 43970 条已执行的命令(其中 39511 条成功,4459 条失败)。数据集分为两个配置:execution-summary(任务执行摘要)和 collector-observations(收集器观测)。每个任务记录包括环境(如 AlmaLinux 9、Alpine、CentOS Stream 10 等)、命令统计(成功/失败)、奖励分数(Reward)、覆盖率(Coverage)、功能得分(Functionality)、操作卫生得分(Hygiene)以及时间指标(部署时间和执行时间)。该数据集适用于评估 LLM 在系统管理与基础设施自动化方面的能力。

InfraSet is an open dataset that records the processes and results of LLMs performing infrastructure tasks. This dataset aims to provide empirical data on the operational performance of LLMs in real-world systems, including new deployments, existing systems, end-of-life systems, or distributed environments. The current version includes 800 tasks and 43,970 executed commands (39,511 successful and 4,459 failed). The dataset is divided into two configurations: execution-summary and collector-observations. Each task record includes the environment (e.g., AlmaLinux 9, Alpine, CentOS Stream 10, etc.), command statistics (success/failure), reward score, coverage, functionality score, hygiene score, and time metrics (deployment time and execution time). This dataset is suitable for evaluating the capabilities of LLMs in system management and infrastructure automation.

创建时间:
2026-08-27
原始信息汇总

InfraSet 数据集详情

基本信息

  • 数据集名称: InfraSet
  • 许可证: Apache-2.0
  • 语言: 英语(en)
  • 标签: 基础设施、LLM评估、Linux、系统管理
  • 任务类别: 其他
  • 数据规模: 少于 1K 条(n<1K)

数据集概述

InfraSet 是一个记录 LLM(大语言模型)执行基础设施任务的数据集,包含任务执行结果与完整追踪信息。该数据集旨在为 LLM 在真实系统(包括绿地、棕地、退役或分布式环境)中操作基础设施的表现提供公开的经验数据,弥补当前缺乏相关实证依据的空白。

数据配置

数据集包含两个配置:

  • execution-summary: 任务执行摘要,数据文件位于 data/execution-summary.jsonl
  • collector: 观测数据,数据文件位于 data/collector-observations.jsonl

执行摘要说明

数据集共记录了 800 个任务43,970 条已完成执行命令,其中 39,511 条成功,4,459 条失败。各项任务按指标(平均值)进行评估,具体指标含义如下:

  • Commands: 成功/失败的执行命令数(0/0 表示有审计记录但无命令请求;audit unavailable 表示无审计产物)
  • Reward: 成功结果得分
  • Coverage: 覆盖率
  • Functionality: 功能完整性
  • Operational hygiene: 运维卫生度(检测执行过程中的不必要变更、遗留残留及无关回归;1.000 表示未发现问题,0.000 表示无卫生得分)
  • Provisioning time: 预配置时间
  • Execution time: 执行时间

一个失败的命令仅代表一次不成功的尝试,并不必然意味着最终任务失败。

任务任务与环境

数据集任务围绕多个集群服务和多种操作系统环境展开。任务类型包括:

  • etcd-cluster: etcd 集群搭建
  • etcd-member-replacement: etcd 成员替换
  • mariadb-galera-cluster: MariaDB Galera 集群搭建
  • mariadb-galera-cold-restart: MariaDB Galera 冷重启
  • mariadb-galera-scale-out: MariaDB Galera 扩容
  • postgresql-failover: PostgreSQL 故障转移
  • postgresql-replication-tls: PostgreSQL TLS 复制
  • postgresql-streaming-replication: PostgreSQL 流复制
  • rabbitmq-cluster: RabbitMQ 集群搭建
  • rabbitmq-tls: RabbitMQ TLS 配置

支持的环境操作系统包括:

  • AlmaLinux 9
  • Alpine
  • CentOS Stream 10
  • RHEL 7.9 / 8 / 9 / 10
  • Ubuntu 16.04

各类任务的实例数通常为 3 或 4 个节点环境。

执行结果示例(部分)

以 PostgreSQL 在 RHEL9.8 环境为例:postgresql-failover-rhel9 任务的成功率表现最佳(命令成功/失败: 75/0,Reward: 1.000,Hygiene: 0.850,执行时间: 6m06s);而 postgresql-replication-tls-rhel9 的 Hygiene 仅为 0.600,说明执行过程中存在不必要的变更或残留。

在 Ubuntu 16.04 环境下的 mariadb-galera-cold-restart-ubuntu16 任务奖励得分最低(Reward: 0.750,Functionality: 0.750,Hygiene: 0.500,执行时间: 40m00s),表明该任务在部分指标上未完全达到预期。

搜集汇总
数据集介绍
infraset 数据集图片
构建方式
InfraSet数据集旨在填补大型语言模型(LLM)在真实基础设施运维中表现缺乏公开实证数据的空白。其构建方式基于一系列精心设计的运维任务(jobs),涵盖绿地、棕地、生命周期末期及分布式环境等多种场景,并针对多种操作系统(如AlmaLinux、Alpine、CentOS、RHEL、Ubuntu)执行。每个任务均在真实或模拟环境中进行,记录完整的执行轨迹,包括成功与失败的命令、审计日志、时间消耗等量化指标。数据通过自动化工具采集,并提供结构化摘要,便于分析模型的决策过程与执行结果。
特点
该数据集包含800个任务及43970条执行命令,其中39511条成功、4459条失败,提供了丰富的正负样本。其特色在于多维度的评估体系,包括奖励(Reward)、覆盖率(Coverage)、功能性(Functionality)和操作卫生(Hygiene),能全面反映模型在任务完成度、资源利用及潜在风险方面的表现。时间指标(如配置时间、执行时间)进一步揭示了效率差异。此外,任务覆盖多种主流Linux发行版,增强了泛化性,为LLM在基础设施运维中的可靠性与安全性研究提供了坚实数据基础。
使用方法
研究者可利用InfraSet进行LLM运维能力的基准测试与比较分析。通过加载HuggingFace上的数据文件(如execution-summary.jsonl和collector-observations.jsonl),可复现实验结果或进行二次挖掘。建议结合任务描述与执行日志,评估模型在命令序列生成、错误恢复及系统状态管理上的表现。数据集的许可证为Apache-2.0,方便学术与商业应用。用户可通过HuggingFace接口或自定义脚本获取数据,并根据自身需求过滤特定环境或任务子集,以支持更细粒度的研究。
背景与挑战
背景概述
随着大型语言模型(LLMs)在基础设施运维领域的日益渗透,无论是直接操作还是人机协同,其实际效能与潜在风险均缺乏系统性实证。2026年,open-sudo团队推出了InfraSet数据集,旨在填补这一空白,通过记录LLMs在真实环境(涵盖绿地、棕地、生命周期末端及分布式场景)中执行的基础设施任务与痕迹,为评估其能力提供科学依据。该数据集包含800个任务与近44,000条执行命令,覆盖多种Linux发行版及核心服务(如etcd、PostgreSQL、RabbitMQ等),并引入覆盖度、功能性与运维卫生等多维评估指标。InfraSet的发布为LLM运维研究建立了标准化基准,促进了可重复实验与社区协作,对智能运维领域具有开创性影响。
当前挑战
领域层面,核心挑战在于确保LLM在真实基础设施操作中的可靠性与安全性,尤其面对异构环境(如不同操作系统版本)和复杂分布式任务,需平衡任务成功、资源覆盖率与运维卫生,避免不必要的系统变更或附带损害。构建过程中,挑战在于任务设计的代表性、跨环境一致性以及验证流程的公正性,需处理命令审计的完整性(如审计缺失或命令记录不确定),并准确量化奖励与卫生分数,确保数据集的准确性和可比性。此外,扩展任务集以覆盖更广泛场景亦为重要挑战,需社区持续贡献以增强数据集对新兴基础设施问题的响应能力。
常用场景
经典使用场景
InfraSet数据集的核心应用场景在于评测大型语言模型在真实基础设施运维任务中的表现能力。该数据集记录了800项涉及不同操作系统(如RHEL、Ubuntu、CentOS等)的集群服务配置、故障恢复、扩容缩容等任务的完整执行轨迹,涵盖从命令下发到最终状态验证的全过程。研究者可利用这些高保真度的执行数据,量化分析模型在执行系统管理操作时的成功率、操作规范性及潜在风险,从而构建面向基础设施领域的LLM基准测试体系,推动模型在复杂系统环境下的鲁棒性研究。
衍生相关工作
基于InfraSet,研究者已衍生出多项经典工作,包括开发更精细的LLM运维能力评测协议,提出结合执行轨迹的强化学习微调方法以提升模型的任务完成质量,以及设计异常操作检测算法以增强基础设施的安全性。数据集也促进了多模态(文本与命令)学习模型的探索,并支持对模型失败模式的分析,为构建自我修正和自我解释的智能运维代理奠定了基础。这些工作共同构建了从数据驱动评估到模型优化和落地的研究链条,推动了LLM在系统工程领域的深入应用。
数据集最近研究
最新研究方向
InfraSet数据集聚焦于大语言模型在真实基础设施运维中的执行效能评估,其前沿研究方向涵盖绿地、棕地、生命周期终结及分布式环境下的自动化任务执行追踪。数据集通过记录800个任务及43970条执行命令,量化了模型在系统配置、集群管理、故障恢复等场景中的成功率、功能覆盖度与操作卫生度,为LLM驱动的智能运维提供了实证基础。当前研究热点包括:利用此类基准数据优化模型在复杂shell命令生成中的鲁棒性,探索人类参与下的混合决策机制,以及构建跨多发行版、多服务类型的可泛化评估框架。该数据集的开放共享将助推从理论能力测试向生产级应用评估的范式转变,填补了LLM操作真实系统时行为证据的空白,对于提升基础设施自动化的安全性与可靠性具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务