工贸业质量追溯智能问数垂类大模型语料数据
收藏资源简介:
数据来源于质量检测数据,涵盖IQC来料检验、FQC过程检验、OQC出货检验等多阶别质量数据,包含检验阶别、元器件类型、焊盘尺寸、焊点面积、缺陷类型、风险等级等多维度核心字段。 通过对数据进行清洗、脱敏、结构化处理,构建"自然语言问数需求-SQL语句生成-执行结果输出"三元组语料体系,将质量管控人员的业务问句精准转换为可执行的SQL查询语句,覆盖缺陷统计、趋势分析、阈值判断、占比计算等核心问数场景。 该数据集解决工贸业企业质量管控中质量分析依赖专业SQL技能导致普通质检人员无法自主查询、多检验阶别(IQC/FQC/OQC)数据分散导致跨阶别对比困难、缺陷追溯与趋势分析响应慢影响异常及时处置等核心痛点,帮助质量管理人员从"依赖技术人员编写SQL"转向"自然语言自主查询"。 同时,该数据集可为工贸业领域的垂类大模型NL2SQL能力训练提供结构化语料支撑,推动行业从"人工编写SQL查询"向"自然语言智能问数"演进。该语料体系可横向复用至PCBA加工、半导体封装、汽车零部件制造等领域的质量管控场景。 1.数据清洗与标准化:按"问数需求+检验阶别+元器件类型"去重,剔除重复语料;通过逻辑校验删除矛盾数据;统一时间格式、检验阶别命名(IQC/FQC/OQC)、缺陷类型命名(少锡/多锡/冷焊/偏移/立碑/桥连/空洞/焊球/正常)、元器件类型命名(0402/0603/0805/1206/SOP8/SOP16),清洗后数据有效率≥98%。 2.问题分类与结构化:按"缺陷统计类""趋势分析类""阈值判断类""对比分析类"等场景分类,标注"检验阶别""缺陷类型""元器件类型"标签,确保覆盖工贸业质量管控90%以上核心问数需求。 3.核心算法建模:(1)语义解析与要素提取:采用BERT-SMT预训练模型进行命名实体识别,提取检验阶别、时间范围、统计指标等关键要素,要素提取准确率≥95%;(2)SQL生成与语法验证:基于"业务术语-字段名"映射规则生成标准SQL语句,SQL语法正确率≥93%;(3)异常值检测:采用规则引擎过滤包含企业专有ID、内部编码的异常问句,异常语料过滤率≥99%;(4)逻辑核验与业务对齐:由资深质量工程师对"问数需求-SQL语句-结果输出"三元组进行最终核验,人工核对正确率100%。 4.语料库迭代优化:构建"应用-反馈-优化"闭环迭代机制。




