遇见数据集

保函合同条款解析训练语料数据

收藏
浙江省数据知识产权登记平台2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

本数据来源于保函中介业务合同档案的条款文本采集,涵盖工程保函、履约保函、预付款保函等7类保函合同的金额、期限、责任、担保、索赔、终止等条款类别。 通过对原始合同条款进行清洗切分、关键要素实体标注、条款分类标注与三人交叉质检,构建覆盖7类保函合同×7类条款×28种关键要素的结构化训练语料集,形成条款原文-要素标注-分类标签三元组数据。 该数据集解决保函中介行业合同条款人工解析效率低导致业务办理周期长、条款要素提取缺乏标准化标注体系制约智能化审核、多类型保函合同条款差异大导致模型泛化能力不足、缺乏高质量训练语料制约条款解析大模型落地等核心痛点。 同时,该数据集经标准化处理后可为保函领域的条款解析NER模型与文本分类模型提供结构化训练样本,并可横向复用至招标合同条款解析、保险保单条款解析、融资租赁合同条款解析等场景。 1.数据采集:采集保函合同条款原始文本,来源为保函中介业务合同档案库,涵盖工程保函、履约保函、预付款保函、农民工工资保函、投标保函、质量保函、支付保函共7类保函合同的金额条款、期限条款、责任条款、担保条款、索赔条款、终止条款、其他条款共7类条款类别。 2.数据预处理:对原始合同文本进行格式清洗(去除页眉页脚及特殊字符)、条款切分(按"第X条"标记分割)、文本去重(基于条款内容哈希值);统一条款编号格式、金额格式(万元)、日期格式(YYYY-MM-DD);通过正则表达式提取保函金额、有效期、费率等结构化要素,预处理后数据有效率≥98%。 3.数据标注:采用"模型预标注+人工校验"双轨方式,对条款原文进行关键要素实体标注(如"保函金额500万元"中"500万元"标注为金额实体)、条款分类标注、要素数据类型标注;标注字段包括关键要素名称、要素值、要素数据类型、标注标签、标注置信度;经三人交叉质检,质检通过率≥95%。 4.模型训练:采用"保函合同预训练模型(BERT-Guarantee)",基于BERT-Base-Chinese在保函合同语料上继续预训练;设置学习率2e-5、批大小16、训练轮次30,使用PyTorch框架;模型任务包括命名实体识别(NER)用于要素提取和文本分类用于条款分类。 5.模型评估:计算NER任务的实体级F1值≥90%、文本分类准确率≥92%、要素值提取准确率≥88%;使用独立测试集评估模型泛化能力,确保模型在未见过的合同类型上仍保持稳定性能。

创建时间:
2026-07-06
搜集汇总
数据集介绍
保函合同条款解析训练语料数据 数据集图片
背景与挑战
背景概述
该数据集基于保函中介业务合同档案构建,涵盖工程保函、履约保函等7类保函合同的金额、期限、责任等7类条款,经过文本清洗切分、关键要素实体标注与分类标注,并经过三人交叉质检,形成条款原文-要素标注-分类标签三元组的结构化训练语料,共1126条。该语料可支撑保函领域条款解析的NER模型与文本分类模型训练,并缓解人工解析效率低、标注体系缺失及模型泛化不足等痛点,同时可扩展应用于招标合同、保险保单等类似条款解析场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务