遇见数据集

工业软件项目交付质量问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

本数据来源于工业软件项目交付管理系统,以工业软件项目交付质量统计为核心,涵盖项目周期、系统活跃度、质量缺陷、测试覆盖率、客户满意度、交付状态、交付质量等级等指标为基础,生成"自然语言问数需求—SQL 语句生成—结果输出"三元组 Text-to-SQL 语料,交付质量等级字段(优质/标准/风险)为问数提供筛选与分组维度。 该 语 料 库 覆 盖 统 计 查 询 ( COUNT/AVG/SUM ) 、 分 组 聚 合 ( GROUP BY ) 、 条 件 筛 选 (WHERE)、排序分析(ORDER BY)、复合查询(多条件组合)五类 SQL 模式,每条约语料包含完整的自然语言问句、对应的标准 SQL 语句及执行结果。 该数据集解决工业软件行业项目交付质量数据查询依赖技术人员编写 SQL、问数与数据字段对应关系不透明、多条件组合查询门槛高等痛点,为 Text-to-SQL 模型训练提供结构化语料支撑,使非技术用户可通过自然语言直接查询项目交付质量数据,降低数据获取门槛。 该语料体系可横向复用至 ERP、MES、SCM 等企业软件项目交付质量问数场景。原始数据来源于工业软件项目交付质量数据,涵盖行业、区域、开发周期、项目金额、缺陷数、交付状态、测试覆盖率、客户满意度等业务字段。 数据清洗与标准化:按"问数需求+指标名称"去重,剔除重复语料;逻辑校验删除矛盾数据(如"开发周期<0""满意度评分<1或>5");统一SQL语法规范、时间格式YYYY-MM-DD、金额单位万元、评分标准1-5分;客户企业名称脱敏;清洗后数据有效率≥98%。 问题分类与结构化:按"交付质量等级统计类""分组聚合类""条件筛选类""复合分析类""排名对比类"等场景归类处理,场景信息通过"表中文名称"与"指标名称"隐式体现,交付质量等级(优质/标准/风险)作为筛选分组维度。 核心算法建模:(1)语义解析与要素提取:基于开源中文预训练模型进行语义理解,提取查询目标、筛选条件、聚合维度等要素;采用分词对问句切分,提取行业、区域、交付状态等实体标签;通过业务规则引擎将提取的实体与数据表字段建立映射关系,要素提取准确率≥96%。(2)SQL生成与验证:基于"业务术语—字段名"映射规则库和"查询类型—SQL模板"匹配规则生成标准SQL语句,单条件查询调用预设模板,多条件组合查询由规则引擎拼接WHERE、GROUP BY、ORDER BY子句;SQL语法正确率≥94%。(3)异常值检测:采用IsolationForest算法,n_estimators=100,max_samples=256,contamination=0.05,检测"满意度评分>5"等异常语料,异常语料过滤率≥99%。(4)逻辑核验:对"问数需求—SQL语句—结果输出"三元组逐条核验,人工核对正确率100%。 语料库迭代优化:构建"应用—反馈—优化"闭环,定期收集查询错误案例,针对性补充语料并调整映射规则。 不合并训练优势:交付质量场景涉及"交付质量等级""交付状态""测试覆盖率""客户满意度"等独有概念及行业、区域、等级间的多级字段映射,与客户运营、库存预警等场景在实体类型、SQL模板、字段语义上差异显著。独立语料可针对性训练模型识别"优质交付""风险交付"等专属术语并生成精准SQL,避免多场景混训导致的语义混淆与字段映射偏差。

创建时间:
2026-07-02
搜集汇总
数据集介绍
工业软件项目交付质量问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集是来源于工业软件项目交付管理系统的Text-to-SQL语料库,共1018条,以自然语言问句、标准SQL语句及执行结果三元组形式覆盖统计查询、分组聚合、条件筛选、排序分析和复合查询五类SQL模式。数据集经过清洗标准化、语义解析与SQL生成建模等处理,要素提取准确率≥96%,SQL语法正确率≥94%,旨在降低非技术用户查询项目交付质量数据的门槛,并支持横向复用至ERP、MES、SCM等企业软件交付质量问数场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务