遇见数据集

建筑行业招标代理机构问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

本数据产品专为训练建筑行业招标代理机构评估领域垂类大语言模型而构建。当前建筑行业招标代理机构数量众多,各机构在资质等级、累计代理项目数、成功率、投诉情况等维度存在显著差异,代理机构评估缺乏数据支撑、选择效率低。 招标人和监管部门在进行代理机构选择和评估时,需要从多个维度综合考量代理机构的综合实力,传统的人工评估方式效率低下且难以实现量化分析。同时,招标代理机构信息分散在多个平台,数据格式不统一,信息获取和整合成本高。本数据产品采用Text-to-SQL(自然语言转SQL)技术路径,覆盖代理机构基本信息查询、资质等级查询、累计项目查询、成功率查询、投诉情况查询、资质升级查询、代理综合评估查询等18种典型评估场景,生成高质量的自然语言问题-SQL语句-叙述式结果三元组训练语料。企业可基于本语料数据的“指标名称”“问题查询”等字段内容,适配自身数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据产品作为稀缺的、高质量的垂直领域语料,对推动建筑行业招标代理机构评估智能化发展提供了有力支撑,对建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化 对原始招标代理机构数据进行多维度清洗处理:(1)脱敏处理:代理机构名称采用"前2字+**+后4字"的脱敏规则,统一社会信用代码采用"****"的脱敏,确保数据可用性的同时保护企业隐私和商业机密;(2)数据标准化:统一日期格式、金额单位等数据表达规范,数值字段保留两位小数精度;(3)异常样本保留:对查询结果为"无匹配数据"的样本予以保留,用于训练模型识别边界查询和空结果场景,提升模型的鲁棒性。 2. 问题分类与结构化 将自然语言问题按招标代理机构评估场景归类为18种类型:代理机构基本信息查询、资质等级查询、业务范围查询、多条件组合查询、代理机构排名、业务范围分布、投诉率查询、资质升级查询、代理综合评估等关键查询。同时按查询复杂度分为单条件查询、范围查询、多条件组合查询和综合分析查询四个维度。 3. 核心算法建模 (1)语义解析:基于预训练语言模型(BERT-base-Chinese)对用户自然语言问题进行深度语义解析,采用CRF序列标注技术提取问题中的关键查询条件(代理机构名称、资质等级、业务范围、注册资本、服务省份、项目数量等),为后续SQL生成提供结构化输入。 (2)SQL生成:采用Text-to-SQL技术将自然语言问题自动转换为可执行的SQL查询语句。基于编码器-解码器(Encoder-Decoder)架构,编码器将自然语言问题和数据库Schema信息编码为语义向量表示,解码器逐Token生成对应的SQL语句,能够准确处理多条件组合、聚合统计、排序排名、比率计算等复杂SQL语法结构。 (3)异常检测:采用IsolationForest孤立森林算法对生成的语料进行异常检测,识别SQL语法错误、语义不一致、结果与问题不匹配等异常样本,异常语料过滤率不低于99%,确保训练语料的质量和可靠性。 (4)逻辑核验:由资深建筑行业招标代理领域专家对生成的语料进行最终核验,重点检查SQL语句的业务逻辑正确性、叙述式结果的信息完整性和表达准确性,确保每条训练样本符合行业实际业务场景。 4. 语料库持续迭代 建立"应用-反馈-优化"闭环迭代机制:对回答不准确或用户不满意的样本进行专家审核和修正,定期更新招标代理机构数据和语料库,持续提升垂类大模型在招标代理机构评估领域的问数能力。

创建时间:
2026-06-11
搜集汇总
数据集介绍
建筑行业招标代理机构问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
本数据集是面向建筑行业招标代理机构评估领域的垂类大语言模型训练语料,通过Text-to-SQL技术构建了自然语言问题、SQL语句与叙述式结果的三元组样本,覆盖代理机构基本信息、资质等级、累计项目、成功率、投诉情况等18种典型评估场景,共含15938条数据。数据集经过脱敏处理、标准化清洗及专家核验,支持企业快速适配自身表结构以启用文字转SQL功能,旨在提升代理机构评估的智能化水平与效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务