遇见数据集

建筑行业行政处罚文书智能提取大模型训练数据

收藏
浙江省数据知识产权登记平台2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

本数据产品专为训练建筑行业行政处罚文书信息提取领域垂类大语言模型而构建。建筑行业行政处罚文书包含处罚机关、被处罚企业、违法行为类型、处罚类别、罚款金额、整改要求等大量关键信息,但文书格式差异大、表述方式多样,信息分散在不同段落中,人工逐份提取耗时耗力且容易遗漏。传统模式下,建筑企业法务人员需要反复阅读大量处罚文书,手动摘录各项关键信息用于企业风险排查、合规审查和信用评估,效率低下且出错率较高。不同地区、不同类型的处罚文书(处罚决定书、责令改正通知、行政处罚告知书、听证告知书)格式和表述方式差异较大,信息结构化程度低,给自动化处理带来挑战。本数据产品采用信息提取(Information Extraction)技术路径,覆盖处罚机关提取、信用代码提取、罚款金额提取、处罚日期提取、整改要求提取、文书编号提取、文书类型提取、处罚依据提取、处罚期限提取、项目关联提取、人员关联提取、金额计算提取、综合信息提取等18种典型信息提取场景。本数据产品作为稀缺的、高质量的垂直领域语料,对推动建筑行业行政处罚文书信息提取智能化发展提供了有力支撑,对建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化:对采集的行政处罚文书原始文本进行数据清洗和标准化处理:(1)去除文档中的页眉页脚、水印等无关信息,统一不同地区处罚文书的格式差异,将处罚决定书、责令改正通知、行政处罚告知书、听证告知书四种文书类型进行结构化标注;(2)脱敏处理:企业名称执行"前2字+**+后4字"脱敏规则,法定代表人姓名执行"姓+*"脱敏规则,统一社会信用代码执行"前3位+***********+后4位"脱敏规则;(3)统一日期格式、金额单位等数据表达规范;(4)异常样本保留:对提取结果为"无匹配数据"的样本予以保留,用于训练模型识别边界场景和空结果场景,提升模型的鲁棒性。2.问题分类与结构化:基于行政处罚文书信息提取的业务需求,将提取任务划分为18种典型场景:处罚机关提取、被处罚企业提取、金额计算提取、综合信息提取。每个场景对应特定的目标字段、提取方法和问题模板。3.核心算法建模:(1)语义解析:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对处罚文书进行深度语义解析,通过语义角色标注识别文本中的论元结构,采用CRF序列标注技术提取关键实体。(2)信息提取:采用BiLSTM-CRF序列标注模型对处罚文书文本进行实体抽取,构建了包含行政机关名称、企业名称、人名、统一社会信用代码、日期时间、金额、法规条款、项目名称等实体类型的行业专属标注体系。针对结构化程度较高的信息(如文书编号、信用代码、罚款金额、日期时间等),设计专门的正则表达式模式进行精确匹配提取。(3)异常检测:采用IsolationForest(n_estimators=100,contamination=0.05)孤立森林算法对提取结果进行异常检测,识别实体边界错误、上下文歧义、规则覆盖不足等异常样本,异常语料过滤率不低于99%,确保训练语料的质量和可靠性。(4)逻辑核验:对提取结果进行最终核验,重点检查提取信息的业务逻辑正确性、实体边界的准确性、法规条款引用的规范性,确保每条训练样本符合行业实际业务场景。4.语料库持续迭代:建立"应用-反馈-优化"闭环迭代机制:收集提取结果与人工标注标准答案的对比数据,统计各场景的提取正确率和置信度分布;针对错误样本进行原因分析,定向优化模型和规则;定期更新训练语料和规则库,持续提升信息提取的准确率和覆盖面。

创建时间:
2026-05-19
搜集汇总
数据集介绍
建筑行业行政处罚文书智能提取大模型训练数据 数据集图片
背景与挑战
背景概述
该数据集是用于训练建筑行业行政处罚文书信息提取领域垂类大语言模型的垂直领域语料,包含13081条数据。它针对处罚文书格式差异大、信息分散及人工提取效率低等问题,覆盖处罚机关、罚款金额、整改要求等18种典型信息提取场景。数据产品采用信息提取技术路径,通过数据清洗、结构化标注、语义解析与异常检测等流程,确保语料质量,旨在推动建筑行业行政处罚文书信息提取智能化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务