遇见数据集

建筑行业招标公告信息问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

当前,建筑行业招标公告数量庞大且分布广泛,涵盖项目名称、项目所在地、工程类型、投标保证金、招标状态等多维度关键信息,公告信息量巨大,施工企业在参与投标竞争时需要从多个维度快速检索和筛选符合自身条件的招标公告,传统的人工浏览方式效率低下且难以实现精准匹配。 同时,招标公告信息分散、数据格式不统一,查询筛选成本高。 本数据采用Text-to-SQL(自然语言转SQL)技术路径,紧密适配招标公告信息表结构,覆盖公告基本信息查询、项目名称查询、项目所在地查询、工程类型查询、招标预算查询、投标截止时间查询、开标时间查询、资质要求查询、保证金查询、招标方式查询、代理机构查询、发布日期查询、招标状态查询、地区公告查询、预算范围筛选、日期范围查询、多条件组合查询、招标公告综合查询等18种典型查询场景,生成高质量的自然语言问题-SQL语句-叙述式结果三元组训练语料。语料数据可直接适配企业自身数据表结构,实现快速复用和部署。作为建筑行业稀缺的、高质量的垂直领域语料,本数据产品为垂类大语言模型的训练和优化提供了有力支撑,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始语料数据进行全面清洗和标准化处理,包括去除重复记录、修正格式异常、统一字段命名规范等。对涉及招标代理机构名称等敏感信息进行脱敏处理,招标代理机构名称采用"前2字+**+后4字"的脱敏规则。项目名称、公告标题等公开信息保持原始格式,投标人资质要求等长文本进行截断处理。同时保留"无匹配数据"样本,确保模型能够正确处理查询无结果的边界情况,提升模型在实际应用中的鲁棒性。 2. 问题分类与结构化: 对生成的自然语言问题进行多维度分类与结构化标注。基于问题语义将问题归类到18种典型查询场景(公告基本信息查询、工程类型查询、招标预算查询、资质要求查询、招标状态查询、招标公告综合查询等),同时通过槽位填充技术提取问题中的关键查询条件,如项目名称、项目所在地、工程类型、招标预算、投标截止时间、开标时间、投标人资质要求、投标保证金、招标方式、招标代理机构、发布日期、招标状态等,为后续SQL生成提供结构化输入。 3. 核心算法建模: 采用BERT-base-Chinese预训练语言模型(12层Transformer,768维隐藏层,110M参数)作为语义理解基础,通过意图识别模块判断用户查询属于18种场景中的哪一类,同时通过槽位填充技术提取关键查询条件。在异常检测环节,引入IsolationForest孤立森林算法(n_estimators=100, contamination=0.01)对生成的SQL语句进行异常检测,过滤语法错误和语义不一致的异常样本,异常过滤率>=99%。所有生成的语料均经过人工专家核验,确保SQL准确率和结果准确率均达到100%。 4. 语料库持续迭代: 建立"生成-评估-优化"闭环迭代机制,从SQL准确率和结果准确率两个维度评估模型输出质量。通过自动化脚本对生成的语料进行质量校验,包括问题与SQL的语义一致性检查、字段覆盖率验证、脱敏合规性审核等。定期收集错误样本进行针对性优化,持续更新训练语料和场景覆盖,不断提升Text-to-SQL模型在建筑行业招标公告信息查询领域的表现。

创建时间:
2026-06-11
搜集汇总
数据集介绍
建筑行业招标公告信息问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集是针对建筑行业招标公告信息查询的垂类大模型训练语料,采用Text-to-SQL技术,涵盖项目名称、所在地、工程类型、预算、保证金、招标状态等关键信息,覆盖18种典型查询场景,生成自然语言问题-SQL语句-叙述式结果三元组。数据经过清洗、标准化、脱敏处理,并通过BERT模型和IsolationForest算法进行语义理解与异常过滤,人工核验确保SQL和结果准确率达到100%,为建筑行业AI应用提供高质量支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务