建筑行业招标文件关键信息智能提取大模型训练数据
收藏资源简介:
本数据产品专为训练建筑行业招标文件信息提取领域垂类大语言模型而构建。建筑行业招标文件通常包含招标人信息、项目概况、资质要求、工期要求、技术参数、评标方法、合同条款等大量关键信息,这些信息分散在数十页乃至上百页的文档中,人工逐条提取耗时耗力且容易遗漏。传统招投标业务中,企业投标人员需要反复阅读招标文件,手动摘录各项关键信息用于编制投标文件和合规审查,效率低下且出错率较高。同时,不同招标文件的格式和表述方式差异较大,信息结构化程度低,给自动化处理带来挑战。本数据产品采用信息提取(Information Extraction)技术路径,覆盖招标人名称提取、项目金额提取、投标截止时间提取、资质要求提取、技术参数提取、评标方法提取、中标人信息提取等18种典型信息提取场景。企业可基于本语料数据的提取方法和标准答案字段内容,适配自身招标文件格式特点,快速构建招标文件关键信息智能提取系统进行复用。本数据为建筑行业提供了稀缺的、高质量的垂直领域语料,有力支撑了招标文件信息提取领域的自然语言处理技术研发、模型训练与评测,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始招标文件提取数据进行多维度清洗处理:(1)去重处理:基于text_id和original_text+target_field_name组合键去除重复记录;(2)格式统一:文本类型字段标准化为"招标公告/招标文件/中标公示/补充通知"四种取值,字段数据类型标准化为"字符串/日期时间/金额/文本段落"四种取值;(3)脱敏处理:企业名称采用"前2字+**+后4字"规则脱敏,电话号码采用"前3位+****+后4位"规则脱敏,地址信息保留省市信息其余替换为"***";(4)保留"提取失败"样本,增强模型对复杂文本的鲁棒性。 2. 问题分类与结构化: 将信息提取场景按目标字段归类为18种类型:招标人名称提取、质量标准提取、项目经理要求提取、技术参数提取等核心场景。每种场景对应特定的提取方法组合。 3. 核心算法建模: (1)语义解析与要素提取:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对招标文件原始文本进行深度语义解析,通过语义角色标注(SRL)识别文本中的论元结构,明确关键语义关系,为信息提取提供结构化语义基础。 (2)信息提取与匹配:采用命名实体识别(BiLSTM-CRF序列标注模型)结合正则表达式和领域规则引擎的双路径策略。针对结构化程度较高的信息(如电话号码、金额),设计专门的正则表达式模式进行匹配提取;针对半结构化信息(如资质要求、合同条款),基于关键词触发和上下文窗口规则进行提取。规则补充:(3)异常值检测:采用IsolationForest孤立森林算法(n_estimators=100, contamination=0.05, max_samples='auto')对提取结果进行异常检测,识别提取结果与标准答案不匹配、置信度异常偏低、字段类型错误等样本,异常语料过滤率>=99%。 (4)逻辑核验与业务对齐:建立提取结果与标准答案的匹配验证机制,综合考量实体边界置信度、上下文匹配度、规则匹配强度等多维特征。进行最终核验确保业务适用性。 4. 语料库的持续迭代: 建立"应用-反馈-优化"闭环机制:收集提取结果与人工标注标准答案的对比数据,统计各场景的提取正确率和置信度分布;针对错误样本进行原因分析,定向优化模型和规则;定期注入新语料,持续提升信息提取的覆盖度和数据质量。




