遇见数据集

建筑行业评标专家回避风险智能识别大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

本数据专为训练建筑行业评标专家回避风险智能识别领域垂类大语言模型而构建。当前,建筑行业评标专家回避制度是保障招投标公平公正的重要机制,要求评标专家在存在利害关系时主动回避,但专家回避关系核查主要依赖人工审核,需要逐一比对专家与投标单位之间是否存在近亲属关系、经济利益关系、任职关系等多种回避情形,核查过程繁琐且遗漏风险高。同时,评标专家信息分散在各级住建部门、公共资源交易中心等多个平台,数据格式不统一,回避风险识别成本高,难以实现全面覆盖。本数据产品采用Text-to-SQL(自然语言转SQL)技术路径,紧密适配评标专家信息表结构,覆盖专家基本信息查询、专业类别查询、专家级别查询、参评次数查询、回避次数查询、回避原因查询、专业分布统计、回避率查询、多条件组合查询、回避风险综合查询等18种典型评估场景,生成高质量的自然语言问题-SQL语句-叙述式结果三元组训练语料。语料数据可直接适配企业自身数据表结构,实现快速复用和部署。作为建筑行业稀缺的、高质量的垂直领域语料,本数据产品为垂类大语言模型的训练和优化提供了有力支撑,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化:对原始评标专家语料数据进行去重、格式统一和脱敏处理。SQL语句统一采用标准MySQL语法,结果输出统一为自然语言描述格式。专家姓名采用姓+*脱敏,企业名称采用前2字+**+后4字脱敏。数据表含10个字段(record_id、expert_name、expert_id、expert_level、specialty、expert_region、eval_count、avoid_count、company_relation、register_date),各字段与算法规则各环节一一对应。2.问题分类与结构化:将自然语言问题按查询意图归为8类——专家人数统计(按条件统计专家数量)、参评次数查询(极值与分布)、回避次数查询(回避次数及关联分析)、等级分布统计(初/中/高级分布)、地区分布统计(按省市统计)、专业分布统计(按擅长专业统计)、关联企业查询(特定企业专家信息)、综合查询(跨维度组合条件)。通过槽位填充提取查询条件,映射到数据表字段:expert_name、expert_level、specialty、expert_region、eval_count、avoid_count、company_relation、register_date。3.核心算法建模:采用BERT-base-Chinese(12层Transformer,768维隐藏层)进行语义编码,通过意图识别判断查询属于上述8类中的哪一类,槽位填充提取条件并映射到对应字段。SQL生成模块覆盖SELECT聚合、WHERE过滤、GROUP BY分组、HAVING阈值筛选等模式。引入IsolationForest(n_estimators=100, contamination=0.01)对SQL进行异常检测,过滤率>=99%。语料经人工抽检核验,准确率100%。4.语料库持续迭代:建立生成-评估-优化闭环,从SQL准确率和结果准确率两维度评估,自动化检查语义一致性、字段覆盖率和脱敏合规性,定期收集错误样本优化,持续提升Text-to-SQL在评标专家回避风险领域的表现。

创建时间:
2026-06-11
搜集汇总
数据集介绍
建筑行业评标专家回避风险智能识别大模型语料数据 数据集图片
背景与挑战
背景概述
本数据产品专为建筑行业评标专家回避风险智能识别大模型的训练而构建,采用Text-to-SQL技术路径,覆盖专家基本信息、专业类别、参评次数、回避次数等18种典型评估场景,生成自然语言问题-SQL语句-叙述式结果三元组语料。数据包含17000条样本,经过去重、格式统一和脱敏处理,并采用BERT-base-Chinese进行语义编码和IsolationForest异常检测,确保高质量,可适配企业自有数据表结构,支持快速部署应用,对推动建筑行业AI落地具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务