遇见数据集

建筑行业企业综合信息智能检索垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

本数据专为训练建筑行业垂类大语言模型而构建,旨在让模型能够深度理解建筑企业信息检索场景中的自然语言问题,并精准转化为可执行的SQL查询语句,从而实现建筑行业企业数据的即时、高效查询与分析。依托建设通平台积累的全国建筑企业真实经营数据构建标准化语料体系,模型经训练后可精准理解"特级资质""中标综合能力指数""注册建造师""下浮率"等建筑行业特有术语与业务概念。 建筑行业企业可通过本语料数据快速构建自有智能检索系统,替代传统的人工逐条查询模式,实现"用自然语言查企业数据"的智能化升级。例如,招投标人员输入"帮我找浙江省近3年中标金额超过10亿且拥有市政一级资质的施工单位",模型即可自动生成对应查询语句并返回精准结果,大幅提升信息检索效率与决策响应速度。 同时,本语料数据可作为建筑行业知识图谱构建、企业智能推荐、合作伙伴匹配、竞争对手分析等AI应用的基础训练素材,为建筑行业数字化转型与智能化升级提供高质量、稀缺的垂直领域语料支撑,对推动建筑行业数据要素价值释放与AI技术应用落地具有重要意义。1. 数据采集与清洗: 从建设通平台采集过亿级企业综合信息原始数据,涵盖企业基本画像(名称、类型、地区、注册资本)、资质与人员实力(特级/一级/二级资质数量、建造师/造价师/建筑师人数)、中标经营能力(中标数量、金额、综合能力指数、全省排名)及荣誉信息(工法数量、QC奖、优秀项目经理数)等多维度字段。对原始数据进行清洗,去除重复记录、缺失关键字段的数据及逻辑异常数据(如资质总数与分级数量之和不一致、中标金额为负值等),确保数据质量。 2. 问题分类与结构化: 按照建筑行业用户实际查询场景对问题进行归类,包括:(1)定向查询:查询特定企业详细信息;(2)条件筛选:按地区、资质等级、中标金额等多条件组合筛选;(3)排名统计:按指标排序取TOP N;(4)聚合分析:按维度分组统计;(5)关联查询:跨维度联合检索。确保语料对建筑行业核心查询场景的全面覆盖。 3. 核心算法: (1)语义解析与要素提取:采用基于规则和行业词典的文本分析方法,精准提取查询对象、筛选条件、排序指标、聚合维度及数量限制等关键要素,并构建建筑行业专用术语词典提升提取准确率。(2)SQL语句生成:基于"自然语言表述-数据库字段"映射规则和"查询意图-SQL语法结构"映射规则,自动生成标准化SQL,覆盖单表查询、多条件组合、排序、分页、聚合函数、分组统计及多表关联等语法结构。(3)异常值检测:利用LOF算法对SQL及其执行结果进行双重校验,检测SQL逻辑异常及结果异常值并打标过滤。(4)逻辑核验与业务对齐:由资深建筑行业数据分析师对"问题-SQL-结果"三元组进行最终核验,确保语料具备高度的行业业务适用性和准确性。 4. 语料库持续迭代: 构建闭环迭代机制,新产生的用户查询及经核验的SQL定期注入语料库。通过分析大语言模型实际应用反馈,定位薄弱环节并针对性补充,形成"应用-反馈-优化"良性循环,持续提升语料库覆盖度和质量。

创建时间:
2026-04-23
搜集汇总
数据集介绍
建筑行业企业综合信息智能检索垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集专为训练建筑行业垂类大语言模型而构建,旨在让模型理解建筑企业信息检索场景中的自然语言问题,并精准转化为SQL查询语句,实现企业数据的即时查询与分析。数据覆盖企业画像、资质人员、中标经营等多维度字段,支持定向查询、条件筛选、排名统计等场景,可助力建筑企业构建自然语言驱动的智能检索系统,提升信息检索效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务