遇见数据集

aegis-bilingual-industrial-ai-dataset

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

AEGIS AI 双语工业运营数据集是一个合成数据集,旨在支持多语言企业AI系统、检索增强生成(RAG)、工业问答、文档智能、语义搜索和AI工作流自动化的实验与研究。该数据集在保留原始AEGIS AI工业数据集中的设备标识符和关键技术术语的基础上,扩展了结构化的阿拉伯语和英语表示。数据集共包含64条工业运营记录,覆盖8个AI模块(工人安全、预测性维护、机器人监控、视觉检查、AI警报、工作流自动化、文档助手、工厂状态)和多个工业领域(制造、石油天然气、仓储物流、机器人)。每条记录均提供英语和阿拉伯语版本,包括模块、行业、严重性、标题、运营上下文、问题、推荐措施等字段。数据集规模较小,专门用于AI组合实验、多语言RAG原型、指令微调实验、LoRA/PEFT实验、语义检索以及双语企业AI演示,不应用于生产环境下的工业安全场景。

AEGIS AI bilingual industrial operations dataset is a synthetic dataset designed to support experiments and research in multilingual enterprise AI systems, Retrieval-Augmented Generation (RAG), industrial question answering, document intelligence, semantic search, and AI workflow automation. Building upon the original AEGIS AI industrial dataset, it retains device identifiers and key technical terms while expanding structured Arabic and English representations. The dataset contains 64 industrial operation records covering 8 AI modules (Worker Safety, Predictive Maintenance, Robot Monitoring, Visual Inspection, AI Alerts, Workflow Automation, Document Assistant, Plant Status) and multiple industrial domains (Manufacturing, Oil & Gas, Warehouse & Logistics, Robotics). Each record provides both English and Arabic versions, including fields such as module, industry, severity, title, operation context, problem, and recommended action. The dataset is small-scale and specifically intended for AI composition experiments, multilingual RAG prototyping, instruction fine-tuning experiments, LoRA/PEFT experiments, semantic retrieval, and bilingual enterprise AI demonstrations. It should not be used for production-level industrial safety scenarios.

创建时间:
2026-08-18
原始信息汇总

数据集概述

AEGIS AI 双语工业运营数据集(AEGIS AI Bilingual Industrial Operations Dataset) 是一个合成的英阿双语数据集,专为多语言企业级AI系统实验而设计,涵盖检索增强生成(RAG)、工业问答、文档智能、语义搜索及AI工作流自动化等领域。

该数据集在保留工业设备标识符和关键技术术语的基础上,扩展了原始AEGIS AI工业数据集的结构化阿拉伯语和英语表示形式,共包含 64条工业运营记录,覆盖 8个AI模块 和多个工业领域。


语言

数据集包含英语和阿拉伯语两种语言的并行信息。每条记录均提供以下字段的英阿双语版本:

  • 模块(module)
  • 行业(industry)
  • 严重程度(severity)
  • 标题(title)
  • 运营背景(operational context)
  • 问题(question)
  • 建议操作(recommended action)

数据集规模

属性
总记录数 64
语言数 2
运营AI模块数 8
唯一设备ID数 8
是否为合成数据集

该数据集刻意保持较小规模,主要适用于:

  • AI组合实验
  • 多语言RAG原型开发
  • 指令微调实验
  • LoRA / PEFT 微调实验
  • 语义检索
  • 双语企业AI演示

注意: 该数据集不应视为生产级工业安全数据集。


AEGIS AI 模块

数据集涵盖以下运营模块:

英文 阿拉伯文
Worker Safety سلامة العاملين
Predictive Maintenance الصيانة التنبؤية
Robot Monitoring مراقبة الروبوتات
Vision Inspection الفحص البصري
AI Alerts تنبيهات الذكاء الاصطناعي
Workflow Automation أتمتة سير العمل
Document Assistant مساعد المستندات
Factory Status حالة المصنع

工业领域

数据集中的记录覆盖以下工业场景:

  • 制造业(Manufacturing)
  • 石油与天然气(Oil & Gas)
  • 仓储与物流(Warehousing and Logistics)
  • 机器人技术(Robotics)

示例运营资产包括:

text AGV-34 CONV-02 DOCK-24 ROBOT-ARM-04 SORTER-22 TANK-14 VALVE-12 VISION-32


许可证

该数据集采用 Apache 2.0 许可证。

搜集汇总
数据集介绍
aegis-bilingual-industrial-ai-dataset 数据集图片
构建方式
在工业人工智能向多语言环境拓展的背景下,该数据集采用合成方式构建,以原始AEGIS AI工业数据集为基础,引入阿拉伯语与英语平行表达。构建过程保留工业设备标识符及关键技术术语,确保双语记录在模块、行业、严重程度、标题、操作背景、问题与建议措施等维度上语义对齐。数据集共涵盖64条工业运营记录,分布在8个AI模块与制造业、油气、仓储物流及机器人等多个工业场景中,每条记录均以英阿双语形式呈现,形成结构化平行语料,为多语言企业级AI实验提供基础资源。
特点
该数据集的核心特征在于其双语平行性与工业场景专用性。64条记录覆盖八个操作模块,包括工人安全、预测性维护、机器人监控、视觉检测、AI警报、工作流自动化、文档助手与工厂状态,并涉及制造业、油气、仓储物流及机器人等领域。设备标识符如AGV-34、CONV-02、ROBOT-ARM-04等在双语版本中保持一致,技术术语得以保留。数据集规模虽小,但结构清晰,适用于多语言检索增强生成、指令微调、LoRA/PEFT实验及语义检索等研究,且明确声明不适用于生产级工业安全场景。
使用方法
该数据集主要用于多语言企业AI系统的实验与原型验证。使用者可将其加载至检索增强生成流程中,构建英阿双语问答与文档智能应用,或用于语义搜索及AI工作流自动化演示。在模型训练方面,该数据集适合指令微调、LoRA与PEFT等参数高效微调实验,亦可作为多语言RAG原型与工业AI作品集的实验素材。使用时应遵循Apache-2.0许可协议,并注意其合成数据性质,不宜将其视为生产级工业安全数据集,而应作为研究探索与概念验证的基准资源。
背景与挑战
背景概述
在工业4.0与人工智能深度融合的浪潮中,多语言企业级AI系统的研发成为全球制造业智能化转型的关键议题。2025年,AEGIS AI团队发布双语工业运营数据集,旨在弥合阿拉伯语与英语在工业AI应用中的资源鸿沟。该数据集聚焦于工业问答、文档智能与语义检索等核心任务,通过合成64条涵盖8大AI模块的运营记录,为多语言检索增强生成及指令微调提供了实验基准。其核心研究问题在于如何在双语低资源条件下保持工业术语与设备标识的一致性,进而推动中东地区工业AI生态的发展,对跨语言工业智能研究具有先导性意义。
当前挑战
该数据集所应对的领域问题在于工业场景下多语言语义理解与知识检索的精准性,尤其是在安全关键型任务中,双语对齐的准确性直接影响决策可靠性。构建过程中的主要挑战包括:确保阿拉伯语与英语在工业术语、设备标识符及操作规范上的严格对等,避免语义漂移;合成数据需兼顾语言多样性、领域覆盖度与真实性,同时规避隐私与安全风险;64条记录的小规模特性虽利于快速实验,却限制了模型泛化能力,难以支撑鲁棒性评估;此外,工业领域固有的术语歧义与语境依赖对语义检索和生成任务构成持续挑战。
常用场景
经典使用场景
在工业智能化与多语言企业系统交汇的背景下,该数据集最经典的使用场景是面向阿拉伯语与英语双语环境的检索增强生成(RAG)原型开发与工业问答系统验证。每条记录围绕设备标识、工业场景、严重程度、操作语境、问题及建议措施构建英阿平行语义单元,使研究者能够直接测试跨语言语义对齐、双语指令微调以及基于工业知识库的生成式问答。其八类运营模块与多行业覆盖为多语言文档智能和语义检索提供结构化试验场,尤其适合在低资源条件下评估模型在技术术语保留和双语上下文一致性方面的表现。
实际应用
在产业实践中,该数据集可用于构建面向制造、油气、仓储物流与机器人场景的双语智能助手,支持现场工作人员以阿拉伯语或英语查询设备状态、接收安全告警、获取维护建议与自动化流程指引。其结构化的模块、行业、严重程度与推荐行动字段,便于企业快速搭建语义搜索、文档智能解析和AI工作流自动化的演示系统。同时,它也可服务于跨国工业企业的员工培训、多语言知识库问答以及轻量级预测性维护和视觉检测场景的原型验证。
衍生相关工作
该数据集在原始AEGIS AI工业数据集基础上扩展出阿拉伯语与英语平行表示,衍生出一系列面向双语企业AI的实验性工作。相关经典方向包括多语言RAG流程验证、阿拉伯语工业指令微调实验、LoRA与PEFT参数高效适应、工业语义检索基线构建以及双语文档智能演示系统。这些工作共同推动了工业AI从英语单语向多语言可迁移架构的演进,并为后续研究者在低资源工业领域开展跨语言问答、术语保持与工作流自动化实验提供了可引用的起点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务