遇见数据集

建筑企业荣誉竞争力问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

本数据产品专为训练建筑行业荣誉竞争力分析领域垂类大语言模型而构建。建筑企业在招投标竞争和合作伙伴筛选中,荣誉获奖情况是衡量企业综合实力和工程质量水平的核心指标。然而传统模式下,企业市场人员需要逐个登录中国建筑业协会、各省住建厅等多个平台手动检索荣誉信息,面对鲁班奖、国家优质工程奖、省级优质工程奖等不同级别和类别的荣誉时,信息分散、效率低下、难以系统对比。本数据产品通过Text-to-SQL技术路径,将自然语言问题精准转化为SQL查询语句,覆盖企业荣誉总览、级别筛选、类别分布、颁发机构查询、获奖时间范围、工程类型关联、综合条件组合等18种典型业务场景。企业可基于本语料数据的“指标名称”“问题查询”等字段内容,适配自身数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据为建筑行业提供了稀缺的、高质量的垂直领域语料,有力支撑了荣誉竞争力分析领域的自然语言处理技术研发、模型训练与评测,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始荣誉数据进行多维度清洗处理:(1)去重处理:基于record_id和各字段组合键去除重复记录;(2)格式统一:日期字段统一为YYYY-MM-DD格式,荣誉级别标准化为"国家级/省部级/市地级/行业协会级/企业级"五种取值,荣誉类别标准化为"工程质量类/安全管理类/科技创新类/诚信经营类/综合荣誉类"五种取值;(3)脱敏处理:企业名称采用"前2字+**+后4字"规则脱敏,统一社会信用代码采用"前3位+***********+后4位"规则脱敏,荣誉证书编号采用"前4位+****+后4位"规则脱敏;(4)保留"无匹配数据"样本,增强模型对数据缺失场景的理解能力。 2. 问题分类与结构化: 将自然语言查询问题按业务场景归类为企业荣誉总览查询、综合荣誉条件查询、企业荣誉类别分布查询、荣誉竞争力综合查询等18种类型,每种场景对应特定的SQL查询模式。 3. 核心算法建模: (1)语义解析与要素提取:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对用户自然语言问题进行语义解析,提取查询意图(18分类)、查询实体(企业名称/荣誉名称/级别/日期等)和查询条件(等于/范围/比较/组合),采用CRF序列标注模型识别实体边界。(2)异常值检测:采用IsolationForest孤立森林算法(n_estimators=100, contamination=0.05, max_samples='auto')对生成的SQL语句进行异常检测,识别语法错误、逻辑矛盾、字段类型不匹配等异常样本,异常语料过滤率>=99%。 (3)逻辑核验与业务对齐:建立SQL字段与结果输出的匹配验证机制,确保SELECT中的每个字段在结果描述中均有对应体现;对聚合查询(COUNT/AVG/SUM)验证结果输出中包含统计量描述。由资深行业专家进行最终核验,确保业务适用性。 4. 语料库的持续迭代: 建立"应用-反馈-优化"闭环机制:收集用户在实际使用中的查询日志,对查询失败或结果不准确的样本进行人工标注和修正,定期注入新语料,持续提升垂类大模型在荣誉竞争力分析领域的自然语言查询理解能力。

创建时间:
2026-05-19
搜集汇总
数据集介绍
建筑企业荣誉竞争力问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
本数据产品是专为建筑企业荣誉竞争力分析领域垂类大语言模型训练而构建的高质量语料,通过Text-to-SQL技术将自然语言查询精准转化为SQL语句,覆盖企业荣誉总览、级别筛选、类别分布、颁发机构查询、获奖时间范围等18种典型业务场景。数据集包含11000条结构化记录,字段涵盖企业名称、荣誉名称、荣誉级别、荣誉类别、颁发机构、荣誉日期等,并经过多维度清洗(去重、格式统一、脱敏)和严格的质量校验,支持模型训练、评测及建筑行业数据要素价值释放。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务