遇见数据集

Technical-Architectures-Large

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

Technical Architectures Large 是一个包含超过21万个经过验证的企业软件架构图的数据集,专门用于解决AI模型从自然语言需求生成复杂且语法正确的图表代码的挑战。该数据集由GPT-OSS-120B和Qwen3-Coder-Next-FP8两种前沿模型生成,涵盖了从客户端层、边缘安全、API网关、服务网格到合规边界和多云基础设施拓扑的真实企业系统模型。数据集以JSON Lines格式组织,每个样本代表一个自包含的架构规范,包含丰富的结构和执行元数据。关键特征包括:覆盖42个行业领域(如金融科技、MLOps、网络安全、医疗保健等)、8种架构范式(如微服务、事件驱动、零信任、CQRS等)、6种云部署目标(AWS、Azure、GCP、多云、混合云、本地部署)以及4个复杂度层级(小型、中型、大型、企业级)。支持的Mermaid图表类型包括流程图、序列图、状态图、ER图、类图等9种。每个样本记录包含唯一ID、领域、风格、云环境、目标复杂度、动态注入的生产约束列表、生成模型、输入输出令牌数、生成终止原因、节点和边数量、图表类型以及原始的Mermaid.js源代码。数据集经过严格的多阶段质量验证,确保语法正确性和结构密度。适用于代码大语言模型的微调、自动化系统设计AI助手的开发,以及评估LLM在遵循严格拓扑约束方面的推理能力。

Technical Architectures Large is a dataset containing over 210,000 validated enterprise software architecture diagrams, specifically designed to address the challenge of AI models generating complex, syntactically correct diagram code from natural language requirements. This dataset is generated by two cutting-edge models, GPT-OSS-120B and Qwen3-Coder-Next-FP8, covering real-world enterprise system models ranging from client-side layers, edge security, API gateways, service meshes to compliance boundaries and multi-cloud infrastructure topologies. The dataset is organized in JSON Lines format, where each sample represents a self-contained architecture specification with rich structural and execution metadata. Key features include: coverage of 42 industry domains (e.g., fintech, MLOps, cybersecurity, healthcare, etc.), 8 architectural paradigms (e.g., microservices, event-driven, zero-trust, CQRS, etc.), 6 cloud deployment targets (AWS, Azure, GCP, multi-cloud, hybrid cloud, on-premises), and 4 complexity levels (small, medium, large, enterprise-grade). Supported Mermaid diagram types include 9 categories such as flowcharts, sequence diagrams, state diagrams, ER diagrams, class diagrams, etc. Each sample record contains a unique ID, domain, style, cloud environment, target complexity, dynamically injected list of production constraints, generation model, input and output token counts, generation termination reason, number of nodes and edges, diagram type, and the original Mermaid.js source code. The dataset has undergone rigorous multi-stage quality validation to ensure syntactic correctness and structural density. It is applicable for fine-tuning code large language models, developing automated system design AI Agents, and evaluating the reasoning capabilities of LLMs in adhering to strict topological constraints.

创建时间:
2026-07-08
原始信息汇总

数据集总结:Technical Architectures Large

该数据集包含超过 210,000 个由 AI 模型生成的企业软件架构,旨在弥合自然语言需求与有效图表代码生成之间的差距。

核心信息

关键统计指标

指标 详情
总样本数 ~210,000 个已验证的架构图
生成模型 gpt-oss-120b, qwen3-coder-next-fp8
数据格式 JSON Lines (.jsonl)
行业领域 42 个类别 (金融科技、MLOps、网络安全、医疗等)
架构风格 8 种范式 (微服务、事件驱动、零信任、CQRS 等)
云基础设施 6 个目标 (AWS, Azure, GCP, 多云, 混合云, 本地部署)
复杂度等级 小型、中型、大型、企业级
支持的图表类型 flowchart LR, flowchart TB, sequenceDiagram, stateDiagram-v2, erDiagram, classDiagram, gitGraph, mindmap, timeline

数据模式 (Schema)

每条 JSON 记录是一个自包含的架构规约,包含以下字段:

字段名 数据类型 描述
id 整数 唯一标识符
domain 字符串 架构针对的行业垂直领域
style 字符串 软件工程设计范式
cloud 字符串 目标部署基础设施环境
target_complexity 字符串 预期结构规模
constraints 数组[字符串] 2-5 个动态注入的生产需求
model 字符串 用于生成样本的 AI 模型
input_tokens 整数 系统提示和用户提示的总令牌数
output_tokens 整数 生成的 Mermaid 代码块的总令牌数
finish_reason 字符串 生成终止标志 (严格过滤为 "stop")
nodes 整数 唯一架构实体和子图的绝对数量
edges 整数 有向连接和数据流的总数
diagram_type 字符串 已验证的标准 Mermaid 模式声明
mermaid 字符串 原始的、可用于生产的 Mermaid.js 源代码

生成与处理流程

  1. 高吞吐量连续批处理: 使用 2× NVIDIA H100 NVL GPU 和 vLLM 推理引擎,实现每次生成步骤同时批处理 512 个提示。
  2. 动态约束注入: 避免结构重复,每个提示动态组合来自 42 个行业领域、8 种架构风格和随机技术约束的选择。
  3. 严格的多阶段验证: 通过自动质量过滤器,包括语法检查、密度阈值(至少 4 个节点和 2 条边)、长度限制(丢弃 finish_reasonlength 的样本)以及失败重试队列。

预期用途

  • 代码大语言模型微调: 训练基础代码模型掌握标准 Mermaid 图表语法和复杂空间图关系。
  • 自动化系统设计: 构建能够将需求文档或云 RFP 规约转化为可视化架构图的 AI 助手。
  • 基准测试与评估: 测试 LLM 推理能力,评估生成图是否严格遵循拓扑约束。
搜集汇总
数据集介绍
Technical-Architectures-Large 数据集图片
构建方式
该数据集通过先进的大规模合成流程构建,利用两块NVIDIA H100 NVL GPU驱动的高吞吐连续批处理技术,借助vLLM推理引擎以bfloat16精度同时处理512个提示。生成过程中动态注入来自42个行业垂直领域、8种架构风格及随机技术约束的组合,避免结构重复。随后经由多阶段严格验证,包括语法与截断检查、密度阈值过滤以及长度守卫,拒绝不完整或无效输出,失败样本被重新排入重试队列以更高温度参数重新生成,最终汇聚为超过21万个经过验证的企业级架构样本。
特点
该数据集涵盖从传统微服务到零信任、CQRS等8种架构范式,横跨金融科技、网络安全、MLOps等42个行业领域,并支持AWS、Azure、GCP等6种云基础设施部署。每个样本包含丰富的结构化元数据,如领域、复杂度层级、节点与边计数,以及2至5个真实工程约束,确保了高度的多样性与现实感。此外,数据集支持九种Mermaid图表类型,包括流程图、序列图、类图等,为模型提供了广泛且真实的架构表示学习素材。
使用方法
用户可通过Hugging Face datasets库轻松加载数据集,并利用元数据字段如复杂度、领域或节点数进行精细化筛选,以适配特定的监督微调或检索增强生成任务。建议将架构描述映射为指令-响应对格式,其中指令包含复杂度、架构风格、云环境及约束条件,响应为Mermaid代码块。该数据集特别适用于代码大模型微调、自动化系统设计及架构图评估基准,助力提升从自然语言到有效图结构的转化能力。
背景与挑战
背景概述
在人工智能与软件工程交叉领域,从自然语言需求自动生成复杂且语法正确的图表代码始终是技术前沿的重要课题。该数据集由研究者ajibawa-2023于2026年创建,依托Hugging Face平台发布,旨在解决大语言模型在企业级软件架构建模中的结构性瓶颈。通过调用GPT-OSS-120B与Qwen3-Coder-Next-FP8两款前沿模型,数据集汇聚了超过21万条经严格校验的企业架构样本,覆盖金融科技、MLOps、网络安全等42个行业领域,并支持微服务、事件驱动、零信任等8种架构范式。其核心价值在于为代码大模型的指令微调、自动系统设计以及架构推理评估提供了规模庞大且结构化的真实级基准资源,有力推动了AI从简单代码生成迈向复杂系统设计的能力跃迁。
当前挑战
该数据集所应对的核心挑战在于当前大语言模型在处理复杂空间拓扑关系与严格工程约束时的能力局限。领域问题方面,模型常难以从模糊的自然语言需求中准确生成符合生产环境要求的多层架构图,例如在零信任或CQRS模式下正确划分安全域与数据流。构建过程中,研究者面临两大困难:一是如何避免大规模合成数据中常见的结构重复与退化,通过动态约束注入与42个垂直领域随机组合来维持多样性;二是如何保证生成内容的语法与逻辑双重量效,采用多阶段验证管道剔除截断、节点数不足或括号不匹配的无效样本,并利用回退重试队列对失败生成进行降参试错,最终确保数据集的高质量与可用性。
常用场景
经典使用场景
在人工智能与软件工程交叉领域,Technical-Architectures-Large数据集的核心价值在于为代码大语言模型提供高质量的指令微调训练素材。研究者可利用该数据集将自然语言描述的企业架构需求转化为标准Mermaid图语法输出,覆盖从微服务到零信任架构、从金融科技到多云部署等复杂场景。其结构化的约束字段和分领域元数据,使模型能够学习在特定拓扑限制下生成语法正确、节点关系密集的系统设计图,从而显著提升AI在自动化软件架构设计任务中的表现力与准确性。
实际应用
在工业界,该数据集驱动的模型已被广泛应用于自动化系统设计工具链中。企业可借助基于该数据微调的AI助手,将产品需求文档或云服务请求建议书直接转化为可视化的Mermaid架构图,大幅缩短方案设计周期。此外,在DevOps与MLOps实践中,该数据生成的架构可辅助工程师快速搭建从客户端接入、边缘安全到服务网格、合规边界的完整基础设施视图,尤其在多云混合部署和零信任网络规划场景中展现出显著的效率提升价值。
衍生相关工作
基于该数据集已催生了一系列具有影响力的研究工作与开源项目。研究者利用其分层元数据训练了专用的Mermaid代码生成模型,在架构一致性评估基准上取得了突破性进展。部分团队在此基础上构建了约束强化学习框架,通过拓扑验证奖励机制进一步提升了生成图的语法正确率。此外,该数据集还被整合进RAG增强的架构推荐系统,实现了基于历史架构模式的新系统自动映射,为软件工程知识图谱的构建提供了高质量的数据源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务