遇见数据集

建筑企业需求意图识别垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据可用于训练建筑企业需求意图识别垂类大语言模型,使其能够深度理解建筑企业在项目合作、采购寻源、资质服务、融资需求等业务场景中提交的自然语言需求描述,并准确转化为对应的SQL查询语句,从而实现需求数据的高效检索与意图分类分析。依托建设通平台整合的企业基础信息、需求原文、意图标注、项目类型、预算范围、紧急程度、需求来源等多源数据构建标准化语料体系,模型经训练后可精准理解"施工寻源""材料采购""资质代办""设备租赁""融资需求""政策咨询"等建筑行业特有需求意图,建筑行业企业可基于本语料数据的"指标名称""问题查询"等字段内容,适配自身需求数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据也为建筑行业提供稀缺的、高质量的需求意图识别垂直领域语料库,支撑意图识别、自然语言处理等核心技术的研发与评测,推动建筑行业对于企业需求意图精准识别形成可量化评估的方向发展。同时对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化: 数据清洗:对从平台整合的原始数据进行清洗,剔除重复需求记录、缺失关键字段的数据及存在逻辑矛盾的样本。表格中"结果输出"为"无匹配数据"的样本,作为查询无返回结果的标准语料被保留,增强了模型对数据缺失场景的理解能力。 格式统一:统一意图类别划分标准(施工寻源/材料采购/资质服务/政策咨询等)、紧急程度等级(紧急/较急/一般/不急)、需求状态(待处理/跟进中/已签约/已关闭)和SQL语法风格,确保语料的规范性和一致性。对建表语句进行格式化,统一字段类型和注释风格。 2.问题分类与结构化:按照需求意图识别的特定场景对问题进行归类,主要包括需求意图总览、意图类别筛选、意图子类别筛选、多条件组合筛选及需求原文模糊查询等,确保语料对需求意图识别核心场景的全面覆盖。 3.核心算法建模: (1)语义解析与要素提取:采用基于规则和行业词典的文本分析方法,对自然语言问题进行解析,精准提取关键要素。针对需求意图识别领域的特有表述(如"找施工队""采购建材""代办资质"等),构建需求术语同义词映射表,将口语化表述归一化为标准意图类别和子类别查询条件。同时提取查询对象、筛选条件及聚合维度等关键要素。 (2)SQL语句生成:基于预定义的"需求术语-字段"映射规则和"查询意图-过滤条件"映射规则,自动生成标准化的SQL查询语句。映射规则覆盖多条件组合、排序、分页、聚合函数、分组统计及模糊匹配等SQL语法结构,重点强化多条件组合筛选和需求原文模糊查询的SQL生成能力。 规则补充: (3)异常值检测:对生成的SQL及其执行结果进行双重校验。一方面,利用LOF(局部异常因子)算法检测SQL语句的逻辑异常(如聚合函数缺失GROUP BY、多条件组合存在矛盾、LIKE通配符使用不当等);另一方面,结合IQR(四分位距)统计方法,识别结果中可能存在的异常值(如需求原文长度异常、关键词数量偏离正常范围等),并打标或过滤,确保语料质量。 (4)逻辑核验与业务对齐:对生成的"问题-SQL-结果"三元组进行最终核验。结合需求意图识别业务知识,判断SQL逻辑是否正确,确保语料不仅语法正确,更具备高度的业务适用性和准确性。 4. 语料库的持续迭代 构建语料库的闭环迭代机制。新产生的需求意图识别查询问题及其经核验的SQL语句会定期注入语料库,持续提升语料库对需求意图识别业务场景的覆盖度和数据质量。

创建时间:
2026-05-19
搜集汇总
数据集介绍
建筑企业需求意图识别垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集是为训练建筑企业需求意图识别垂类大语言模型而构建的高质量语料,包含17429条数据,涵盖施工寻源、材料采购、资质服务、融资需求等业务场景,将自然语言需求转化为对应的SQL查询语句。数据经过清洗、标准化、语义解析、SQL生成、异常值检测与逻辑核验等处理,形成“问题-SQL-结果”三元组,支撑文字转SQL功能及意图分类,助力建筑行业需求意图识别的研发与评测。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务