建筑行业行政处罚文书智能提取大模型训练数据
收藏官方服务:
资源简介:
本数据产品专为训练建筑行业行政处罚文书信息提取领域垂类大语言模型而构建。建筑行业行政处罚文书包含处罚机关、被处罚企业、违法行为类型、处罚类别、罚款金额、整改要求等大量关键信息,但文书格式差异大、表述方式多样,信息分散在不同段落中,人工逐份提取耗时耗力且容易遗漏。传统模式下,建筑企业法务人员需要反复阅读大量处罚文书,手动摘录各项关键信息用于企业风险排查、合规审查和信用评估,效率低下且出错率较高。不同地区、不同类型的处罚文书(处罚决定书、责令改正通知、行政处罚告知书、听证告知书)格式和表述方式差异较大,信息结构化程度低,给自动化处理带来挑战。本数据产品采用信息提取(Information Extraction)技术路径,覆盖处罚机关提取、信用代码提取、罚款金额提取、处罚日期提取、整改要求提取、文书编号提取、文书类型提取、处罚依据提取、处罚期限提取、项目关联提取、人员关联提取、金额计算提取、综合信息提取等18种典型信息提取场景。本数据产品作为稀缺的、高质量的垂直领域语料,对推动建筑行业行政处罚文书信息提取智能化发展提供了有力支撑,对建筑行业数据要素价值释放和AI技术应用落地具有重要意义。
提供机构:
杭州筑龙信息技术股份有限公司创建时间:
2026-07-30
搜集汇总
数据集介绍

背景与挑战
背景概述
本数据集专为训练建筑行业行政处罚文书信息提取领域的垂类大语言模型而构建,覆盖处罚机关、罚款金额、整改要求等18种典型信息提取场景。通过信息提取技术路径,解决文书格式差异大、表述多样、信息分散等导致的自动化处理难题,为建筑行业行政处罚文书智能化处理提供高质量语料支撑。
以上内容由遇见数据集搜集并总结生成



