环卫安全培训问数垂类大模型语料数据
收藏资源简介:
数据来源于公司环卫业务全部安全培训数据,涵盖培训类型、演练场景、参与人数、覆盖率、培训时长、发现问题数、整改完成数、事故发生率目标、实际事故发生率等核心字段。 通过构建自然语言问数解析模型与SQL生成校验机制,将安全管理人员的自然语言查询转化为可执行的标准SQL语句并输出精确结果,覆盖培训统计、演练评估、覆盖率分析、整改追踪等核心安全管理场景。 解决环卫行业安全培训覆盖率低导致人员安全意识不足、培训效果缺乏量化评估难以优化内容、隐患整改闭环管理不到位等核心痛点。 该数据集可为环卫安全管理领域的垂类大模型提供结构化训练样本,推动行业从"人工台账统计"向"自然语言问数+AI自动生成"演进,同时可横向复用至建筑施工、物流运输、制造业等安全培训管理场景。 1.数据清洗与标准化:按"问数需求+记录日期"去重,剔除重复语料;通过逻辑校验删除矛盾数据(如"整改完成数>发现问题数""覆盖率>100%");保留"结果输出=无匹配数据"样本,清洗后有效率≥98%。格式统一:统一时间格式、培训类型命名、覆盖率格式;对"培训类型"字段补全关联分类,补全率100%。 2.问题分类与结构化:按"培训统计类"(如"统计消防培训的参与人数")"演练评估类"(如"查询应急演练的整改完成率")"覆盖率分析类"(如"统计覆盖率低于80%的培训")"整改追踪类"(如"查询未整改问题数超过5的培训")分类,标注"培训类型""查询维度"标签,覆盖安全培训管理90%以上核心问数需求,构建基础语料库。 3.核心算法建模:(1)语义解析与要素提取:采用预训练模型,通过NER提取"[培训类型]"为培训分类、"[演练场景]"为场景标识等专属要素,准确率≥96%;(2)SQL生成与初步验证:基于"安全术语-字段名"映射规则,简单问数调用预设模板,复杂问数用Seq2Seq生成多条件SQL,语法正确率≥94%;(3)异常值检测:IsolationForest检测"覆盖率>100""整改率<0"等异常SQL,结合企业安全生产标准化基本规范核验培训指标合规性,过滤率≥99%;(4)逻辑核验:结合现场知识对三元组最终核验。 4.语料库迭代优化:构建闭环迭代机制。新产生的业务问题及经核验的SQL定期注入语料库,通过分析反馈定位薄弱环节并针对性补充,形成"训练-反馈-优化"良性循环,持续提升覆盖度和质量。 独立登记必要性说明:安全培训管理在数据结构(培训/演练/事故记录)、查询意图(覆盖率达标/整改时限/演练评估)、核验标准三个维度与垃圾清运、车辆运维、道路保洁等运营类问数语料差异显著。合并登记将模糊安全培训领域专属业务逻辑,导致该场景下SQL生成准确性下降。本语料独立构建,可深度适配安全培训术语体系与核验规则,支撑安全培训问数模型的精准训练与跨行业复用。




