遇见数据集

工贸业仓储物流全景智能问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

数据来源于仓储物流数据,涵盖物料入库、物料出库、生产领料、采购入库及库存统计等多维度核心字段,包含仓库类型、仓库名称、批次号、出入库数量、库存余量、生产分类等。 通过对数据进行清洗、脱敏、结构化处理,构建"自然语言问数需求-SQL语句生成-执行结果输出"三元组语料体系,覆盖出入库统计、库存查询、批次追溯、生产领料分析、采购入库核对等核心问数场景。 该数据集解决工贸业企业仓储物流管理中出入库数据分散导致跨仓查询困难、库存余量与领料需求匹配依赖人工核对、批次追溯效率低等核心痛点,帮助仓储管理人员从"依赖技术人员编写SQL"转向"自然语言自主查询"。 同时,该数据集可为工贸业领域的垂类大模型NL2SQL能力训练提供结构化语料支撑,推动行业从"人工编写SQL查询"向"自然语言智能问数"演进。该语料体系可横向复用至电子制造、汽车零部件、新能源等行业的仓储物流管理场景。 原始数据来源于工贸业企业仓储物流管理系统中的库存统计、物料出库、物料入库、生产领料、采购入库等业务表。 数据清洗与标准化:按"问数需求+仓库名称+指标名称"去重,剔除重复语料;逻辑校验删除矛盾数据(如"入库数量<0""出库数量大于库存数量");统一SQL语法规范、时间格式、仓库命名及批次号格式;企业名称脱敏;清洗后数据有效率≥98%。 问题分类与结构化:按"库存统计类""仓库分布类""生产分类分析类""批次追溯类""占比计算类""出入库分析类"场景分类,标注"仓库类型""统计维度""业务类型"标签。 核心算法建模:(1)语义解析与要素提取:基于开源预训练模型进行语义理解,提取查询目标、筛选条件、聚合维度等要素;以分词切分问句,提取仓库名称、库区、库位、生产分类、批次号等实体标签;经业务规则引擎将实体与数据表字段映射。要素提取准确率≥96%为语料入选门槛的过程校验值,不落为样例字段,仅判定语料是否通过筛选。(2)SQL生成与验证:基于"业务术语—字段名"映射规则与"查询类型—SQL模板"匹配生成标准SQL,单条件调用预设模板,多条件由规则引擎拼接WHERE、GROUP BY、ORDER BY子句。SQL语法正确率≥94%同为过程门槛。(3)异常值检测:采用检测"库存数量<0"等异常语料并剔除,异常语料过滤率≥99%亦为过程值,通过者纳入数据集。(4)正确率生成与核验:每条语料经自动化校验比对"自然语言问数—SQL—执行结果"三者一致性后记录"结果核验正确率"(如0.97),再人工抽样核对。 语料库迭代优化:构建"应用—反馈—优化"闭环,收集实际仓储问数场景错误案例,针对性补全语料并调整映射规则与模板库。 不合并训练优势:仓储物流涉及"库区""库位""电子原材料仓""生产分类""批次号"等独有概念及仓库、库位、生产分类间的多级字段映射,与MES运营、交付质量等场景在实体类型、SQL模板、字段语义上差异显著。独立语料可针对性训练模型识别仓储专属术语并生成精准SQL,避免多场景混训造成的语义混淆与字段映射偏差,提升库存问数准确率。

创建时间:
2026-07-02
搜集汇总
数据集介绍
工贸业仓储物流全景智能问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集是工贸业仓储物流领域的垂类大模型语料数据,来源于库存统计、物料出入库、生产领料、采购入库等业务表,经清洗脱敏后构建为“自然语言问数-SQL生成-结果输出”三元组体系,规模1022条,覆盖出入库统计、库存查询、批次追溯等核心场景。它旨在解决跨仓查询困难、人工核对低效等痛点,并可为NL2SQL能力训练提供结构化语料,且可横向复用至电子制造、汽车零部件、新能源等行业。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务