建筑行业拟在建商机智能推荐大模型语料数据
收藏资源简介:
本数据专为训练建筑行业拟在建项目商机推荐领域垂类大语言模型而构建。建筑行业企业在拓展市场、获取项目商机的过程中,高度依赖拟在建项目信息的及时获取与精准匹配。然而传统模式下,建筑企业市场人员需要从各级发改委、住建局、公共资源交易平台等多个渠道手动搜集拟在建项目信息,信息来源分散、更新滞后、字段不统一,难以快速筛选出与企业资质和能力相匹配的目标项目。面对海量项目数据,人工分析项目阶段、投资规模、工程类型、地区分布等多维特征效率低下,导致商机获取的及时性和精准性不足,错失大量潜在业务机会。本数据产品通过Text-to-SQL技术路径,将自然语言问题精准转化为SQL查询语句,覆盖项目阶段筛选、工程类型查询、地区分布查询、多条件组合查询等18种典型业务场景。企业可基于本语料数据的“指标名称”“问题查询”等字段内容,适配自身数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据为建筑行业提供了稀缺的、高质量的垂直领域语料,有力支撑了拟在建商机推荐领域的自然语言处理技术研发、模型训练与评测,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始拟在建项目商机数据进行多维度清洗处理:(1)去重处理:基于record_id和project_name+project_location组合键去除重复记录;(2)格式统一:日期字段统一为YYYY-MM-DD格式,项目阶段标准化为"拟建/在建/竣工/停工"四种取值,项目状态标准化为"审批中/已批复/施工中/已竣工/已暂停"五种取值;(3)脱敏处理:建设单位、设计单位、监理单位、企业名称、项目名称采用特定规则脱敏;(4)保留"无匹配数据"样本,增强模型对数据缺失场景的理解能力。 2. 问题分类与结构化: 将自然语言查询问题按业务场景归类,包括项目基本信息查询、项目阶段筛选、多条件组合查询、商机推荐综合查询等18种类型,每种场景对应特定的SQL查询模式。 3. 核心算法建模: (1)语义解析与要素提取:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对用户自然语言问题进行语义解析,提取查询意图(18分类)、查询实体(项目名称/地区/投资额/日期/工程类型等)和查询条件(等于/范围/比较/组合),采用CRF序列标注模型识别实体边界。 (2)SQL语句生成:基于模板匹配与语法树构建的双路径策略。对于高频固定模式问题,直接匹配SQL模板;对于复杂组合查询,通过构建抽象语法树(AST)生成SQL语句,确保SELECT字段、WHERE条件、聚合函数的正确组合。 规则补充:(3)异常值检测:采用IsolationForest孤立森林算法(n_estimators=100, contamination=0.05, max_samples='auto')对生成的SQL语句进行异常检测,识别语法错误、逻辑矛盾、字段类型不匹配等异常样本,异常语料过滤率>=99%。 (4)逻辑核验与业务对齐:建立SQL字段与结果输出的匹配验证机制,确保SELECT中的每个字段在结果描述中均有对应体现;对聚合查询验证结果输出中包含统计量描述。由资深行业专家进行最终核验,确保业务适用性。 4. 语料库的持续迭代: 建立"应用-反馈-优化"闭环机制:收集用户在实际使用中的查询日志,对查询失败或结果不准确的样本进行人工标注和修正,定期注入新语料,持续提升垂类大模型在拟在建商机推荐领域的自然语言查询理解能力。




