建筑企业信用修复知识问答对大模型训练数据
收藏资源简介:
本数据产品专为训练建筑行业信用修复领域垂类大语言模型而构建。建筑企业在经营过程中,因行政处罚、司法失信、拖欠工资、安全事故等多种原因可能被记入不良信用记录,严重影响企业招投标资格和商业信誉。然而传统模式下,企业法务和信用管理人员需要逐个查阅《信用修复管理办法》《保障农民工工资支付条例》等多部法律法规,面对行政处罚修复、司法失信修复、经营异常移出、严重失信主体修复等不同场景时,政策条文分散、适用条件复杂、流程要求各异,难以快速获取准确的修复指导。本数据产品采用知识问答对(QA)技术路径,覆盖行政处罚、司法失信、经营异常、严重失信、拖欠工资、工程质量、安全事故、环保违规、税务失信、招投标违规、资质暂停、合同履约、拖欠工程款、虚假宣传、知识产权、社保缴纳、贷款逾期、行业禁入等18种典型信用修复场景。企业可基于本语料数据的问答对内容,适配自身信用管理知识体系,快速构建信用修复智能问答系统进行复用。本数据为建筑行业提供了稀缺的、高质量的垂直领域语料,有力支撑了信用修复领域的自然语言处理技术研发、模型训练与评测,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化:对原始信用修复知识数据进行多维度清洗处理。去重处理:基于问题文本的语义相似度(余弦相似度阈值0.95)去除重复或高度相似的问答对。格式统一:答案文本统一采用'条件+流程+材料+法律依据+注意事项'的结构化格式。关键词标准化:每条问答对的关键词字段提取3-5个核心关键词,采用行业术语标准词表进行统一。数据表包含10个字段:序号、问题、答案、关键词、问题类型、专业度、清晰度、实用性、聚焦度、准确性,各字段与算法规则各环节一一对应。2.问题分类与结构化:将问答对按问题类型字段归为6类——政策咨询型(查询法规条文与政策解读)、流程指导型(指导修复操作步骤与办理程序)、条件查询型(查询修复适用条件与资格要求)、案例分析型(结合具体企业违规案例进行分析)、对比分析型(比较不同地区或不同违规类型的修复差异)、材料清单型(列举修复所需申请材料与证明文件)。同时按关键词字段覆盖的信用修复主题域划分为行政处罚、工程质量、安全生产、环保违规、税务失信、招投标违规、经营异常、严重失信等多个业务子类,确保问题分类在问题类型和关键词两个字段上均有准确体现。3.核心算法建模:采用BERT-base-Chinese预训练模型对问题进行语义编码,通过TextCNN分类器识别问题类型字段对应的6种分类意图。基于TF-IDF+BM25混合检索策略,从问答语料库中召回Top-K条匹配结果,再由Cross-Encoder语义重排序模型精排后输出答案。五维质量评分字段(专业度、清晰度、实用性、聚焦度、准确性,各1-5分)采用IsolationForest异常检测过滤低质量样本,确保入库语料各维度评分均不低于4分。4.语料库持续迭代:建立应用-反馈-优化闭环机制,收集用户使用日志中的问答记录,对低满意度样本进行专家审核修正后注入新语料,持续提升模型在信用修复领域的问答能力。




