遇见数据集

保函风控知识图谱构建垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

本数据来源于保函中介业务的保函合同、资质审查报告、风险评估报告、保后管理记录等4类业务文档的文本采集,采集范围涵盖客户企业资质、保函类型、合作机构、反担保方式、风险等级、保函状态等多维度核心数据。 通过对原始文档进行滑动窗口分块、元数据标注、三元组抽取与语义标注,构建覆盖8类实体×14种关系的保函风控知识图谱语料集,形成分块文本-头实体-关系-尾实体四元组数据。 该数据集解决保函中介行业风控知识碎片化导致风险关联分析困难、缺乏结构化知识图谱制约智能风控应用、保函风险因素跨文档追溯效率低、保后风险预警缺乏知识推理能力等核心痛点。 同时,该数据集经标准化处理后可为工程担保领域的知识图谱构建与大模型知识注入提供结构化训练样本,并可横向复用至招标代理、工程保险、供应链金融等场景。 1.文档分块:按段落对原始文档进行滑动窗口切分(窗口 512 Token、步长 64 Token、重叠率 12.5%),生成块标识字段,切分所得内容填充至分块文本字段,经去重、去噪等清洗处理,确保分块文本完整性与清洁度后形成有效语料。 2.元数据标注:对每个分块提取文档级元数据,将块标识、文档类型、服务年份等字段逐一标注,标识数据来源与属性。 3.实体识别与三元组抽取:采用"保函风控预训练模型(BERT-GuarKG)"(在通用 BERT-base 基础上利用行业专属语料进行领域适配预训练),结构为 12 层 Transformer 编码器、隐藏层768 维、12 头注意力,输出层 Softmax 分类。特征工程处理包括中文分词、实体边界标注、关系类别 one-hot 编码、位置嵌入与段嵌入构造。模型抽取关系三元组(头实体-关系-尾实体),覆盖15 类关键内容的实体,及14 种关联关系;经网格搜索调优(学习率 2e-5、批次大小 16、训练轮数 10 轮)确定最优参数, 通过领域适配训练使三元组抽取与实体识别达到行业可用的抽取精度,并以实际评测结果为准。 4.知识图谱构建与存储:以三元组为基础构建保函风控知识图谱,按训练集:验证集:测试集=8:1:1 划分,存储实体节点与关系边,供推理阶段注入大语言模型注意力层,支持保函风控智能问答与风险推理。

创建时间:
2026-07-06
搜集汇总
数据集介绍
保函风控知识图谱构建垂类大模型语料数据 数据集图片
背景与挑战
背景概述
本数据集基于保函中介业务的多类文档,通过分块、元数据标注和三元组抽取构建了保函风控知识图谱语料,形成结构化四元组数据。该数据集旨在解决风控知识碎片化等问题,并为工程担保等领域的知识图谱构建与大模型知识注入提供训练样本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务