建筑行业企业证照关键信息智能提取大模型训练数据
收藏资源简介:
本数据集作为建筑行业企业证 照关键信息智能提 取大模型的核心训 练语料,用于RoBERTa-wwm-ext 预训练语言模型的领域微调,以及 BiLSTM-CRF 序列标注模型的训练,使模型能够准确识别证照中的企业名称、统一社会信用代码、法定代表人、注册资本、资质等级、有效期等 23 种关键实体。同时,数据集可支撑模型在 23 种提取场景下的端到端准确率评测、LOF 异常检测算法验证及置信度校准。基于提取结果,可构建建筑行业证照要素知识图谱,积累资质等级、发证机关等行业基准数据,并为智能证照管理、资质审核、人员注册核查等下游业务系统提供结构化数据支撑,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化:基于file_name和extract_field去重;OCR结果字符级置信度验证(阈值0.85);提取结果与标准答案一致性校验;企业名称"首字++末四字"脱敏,信用代码"前6位++后4位"脱敏,姓名"姓+*"脱敏;保留提取失败样本增强鲁棒性。 2.问题分类与结构化:按证照类型分为4大类28种场景——营业执照类8种、资质证书类6种、安全生产许可证类6种、人员注册证书类8种,每种场景对应特定提取方法组合。 3.核心算法建模: (1)OCR识别:Tesseract 5.x(--psm 6,--oem 3,chi_sim+eng),识别准确率>=98%; (2)语义解析与实体提取:RoBERTa-wwm-ext(12层Transformer,768维)+ BiLSTM-CRF + TextCNN分类器,结合正则表达式和规则引擎双路径策略; (3)异常检测:LOF算法(n_neighbors=20,contamination=0.05),过滤率>=99%; (4)逻辑核验:OCR置信度+文本相似度+字段类型匹配+证照类型逻辑一致性,专家最终核验。 4.语料库持续迭代:建立"应用-反馈-优化"闭环,统计提取正确率和置信度分布,定向优化OCR参数和提取规则,定期注入新语料。




