遇见数据集

工贸业生产排程优化智能问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

数据来源于工单生产与制令单执行数据,涵盖车间名称、产线编号、工单状态、生产状态、计划数量、投入数量、产出数量、创建日期等多维度核心字段。通过对数据进行清洗、脱敏、结构化处理,构建“自然语言问数需求-SQL语句生成-执行结果输出”三元组语料体系,覆盖车间计划总量查询、产线投入产出统计、生产状态工单数统计、工单状态分布分析、计划数量超阈值日期查询、投入产出超阈值日期查询、计划完成率计算及超阈值日期查询等核心问数场景。该数据集解决工贸业企业生产排程管理中计划执行进度依赖人工汇总效率低、多车间多产线数据分散导致跨线排程对比困难、计划完成率与超产/欠产分析响应慢等核心痛点,帮助生产计划人员从“依赖技术人员编写SQL”转向“自然语言自主查询”。同时,该数据集可为工贸业领域的垂类大模型NL2SQL能力训练提供结构化语料支撑,推动行业从“人工编写SQL查询”向“自然语言智能问数”演进。该语料体系可横向复用至电子制造、汽车零部件、新能源等行业的生产排程管理场景。1.数据清洗与标准化 数据清洗:按“问数需求+车间名称+产线编号+时间维度”去重,剔除重复语料;通过逻辑校验删除矛盾数据(如“投入数量>计划数量”“产出数量>投入数量”“计划完成率>100%”);保留“结果输出=无匹配数据”的样本,增强模型对数据缺失场景的处理能力,清洗后数据有效率≥98%。 2.问题分类与结构化 从工贸业企业生产管理系统(如MES生产模块、APS高级排程系统)收集问数需求,按“计划总量类”(如“查询SMT车间的计划生产总量是多少”)“投入产出类”(如“查询SMTL1产线的投入数量和产出数量分别是多少”)“状态统计类”(如“查询生产状态为投产的工单数量是多少”)“完成率类”(如“查询测试车间的计划完成率是多少”)“阈值日期类”(如“查询SMT车间计划数量超过5000的日期”)“批次查询类”(如“查询产线SMTL2在2025-11-15的计划数量是多少”)等场景分类,构建基础语料库。 3.核心算法建模 (1)语义解析与要素提取:采用“生产排程预训练模型(BERT-APS)”,对问数需求进行语义切分;通过命名实体识别提取专属要素(如“SMT车间”为“车间名称”,“SMTL1”为“产线编号”,“计划数量”为“统计指标”,“超过5000”为“阈值条件”),要素提取准确率≥96%;(2)SQL生成与初步验证:基于“业务术语-字段名”映射规则,对简单问数调用预设SQL模板,对复杂问数用Seq2Seq模型生成多表关联SQL;生成后通过关联表结构校验,SQL语法正确率≥94%;(3)异常值检测:采用IsolationForest算法检测“计划数量<0”“产出数量为负数”等异常SQL,结合生产管理标准(如GB/T 19001-2016质量管理体系、APQP先期产品质量策划)核验“排程参数是否在合规范围”,异常语料过滤率≥99%;(4)逻辑核验与业务对齐:由资深生产计划工程师对生成的问题-SQL-结果三元组进行最终核验。 4.语料库迭代优化 构建语料库的闭环迭代机制。新产生的业务问题及其经核验的SQL语句会定期注入语料库。同时,通过分析大语言模型在实际应用中的反馈(如查询失败、语义理解错误),定位语料库的薄弱环节并进行针对性补充,形成“应用-反馈-优化”的良性循环,持续提升语料库的覆盖度和质量。

创建时间:
2026-07-02
搜集汇总
数据集介绍
工贸业生产排程优化智能问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集来源于工单生产与制令单执行数据,包含车间、产线、工单状态、生产状态、计划/投入/产出数量等核心字段,经过清洗、脱敏和结构化处理,构建了“自然语言问数-SQL生成-结果输出”的三元组语料体系,覆盖计划总量、投入产出、状态统计、完成率及阈值查询等场景。这解决了工贸业生产排程中计划进度人工汇总效率低、跨线对比困难、完成率分析响应慢等问题,支撑生产人员以自然语言自主查询,并为垂类大模型NL2SQL训练提供语料。该语料库通过清洗、问题分类、基于BERT-APS的语义解析、SQL生成与验证(借助模板、Seq2Seq模型及隔离森林检测),并经工程师核验,形成高准确率、高覆盖度的语料,可通过闭环迭代持续优化,可复用于电子制造、汽车零部件等领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务