遇见数据集

企业信用评估问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

本数据来源于企业信用评估业务管理系统中信用评估全流程数据采集,涵盖企业信用评分、信用等级、不良信息类型、不良信息来源、处理状态、处理周期、风险等级等多维度数据。 通过对原始问数语料进行清洗去重、问题分类与结构化标注,构建覆盖参数校验、业务统计、对比分析、趋势分析、阈值判断五大场景的问数语料库,形成问题-SQL-结果三元组标注数据集。 该数据集解决信用服务行业依赖专业SQL技能导致业务人员无法自主查询、多维度信用数据分散导致跨等级对比困难、不良信息处理趋势分析响应慢影响风险决策、缺乏标准化问数语料制约智能化转型等核心痛点。 同时,该数据集经标准化处理后可为信用服务领域的Text-to-SQL垂类大模型提供结构化训练样本,并可横向复用至融资租赁信用问数、保险投保风险评估问数、供应链金融授信问数等场景。 1.数据清洗与标准化:按"问数需求+信用等级"去重,剔除重复语料;通过逻辑校验删除矛盾数据(如"信用评分<0""处理周期>180天""已修复数量>不良信息数量");保留"结果输出=无匹配数据"的样本,增强模型对数据缺失场景的处理能力,清洗后数据有效率≥98%。格式统一:统一时间格式(如"2025")、信用等级名称("AAA")、SQL语法;对"不良信息类型"字段补全(如"骚扰标注"自动关联"低风险"),补全率100%。 2.问题分类与结构化:从信用服务企业业务管理系统(如CRM、信用评估模块)收集问数需求,按"参数校验类"(如"查询信用评分是否超80分")"业务统计类"(如"统计各信用等级数量分布")"对比分析类"(如"对比不同行业信用评分差异")"趋势分析类"(如"统计各年度不良信息数量趋势")"阈值判断类"(如"查询处理周期超30天的信用评估业务")等场景分类,标注"信用等级""风险等级"标签,确保覆盖信用评估90%以上核心问数需求,构建基础语料库。 3.核心算法建模:(1)语义解析与要素提取:采用"信用评估预训练模型(BERT-Credit)",对问数需求进行语义切分;通过命名实体识别提取专属要素(如"AAA"为"信用等级","建筑工程"为"企业所属行业"),要素提取准确率≥96%;(2)SQL生成与初步验证:基于"业务术语-字段名"映射规则,对简单问数调用预设SQL模板,对复杂问数用Seq2Seq模型生成多表关联SQL;生成后通过关联表结构校验,SQL语法正确率≥94%;(3)异常值检测:采用IsolationForest算法检测"信用评分<0""处理周期<0"等异常SQL,结合信用评估行业标准(如GB/T 22116-2008)核验"信用评分是否在合规范围",异常语料过滤率≥99%;(4)逻辑核验与业务对齐:由资深信用评估师对生成的问题-SQL-结果三元组进行最终核验。业务人员结合现场业务知识,判断SQL逻辑是否正确,确保语料不仅语法正确,更具备高度的业务适用性和准确性。 4.语料库迭代优化:构建语料库的闭环迭代机制。新产生的业务问题及其经核验的SQL语句会定期注入语料库。同时,通过分析大语言模型在实际应用中的反馈(如查询失败、语义理解错误),定位语料库的薄弱环节并进行针对性补充,形成"应用-反馈-优化"的良性循环,持续提升语料库的覆盖度和质量。

创建时间:
2026-07-06
搜集汇总
数据集介绍
企业信用评估问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集源自企业信用评估业务系统,涵盖信用评分、信用等级、不良信息等多维度数据,经过清洗去重、问题分类和结构化标注,构建了覆盖参数校验、业务统计、对比分析、趋势分析、阈值判断五大场景的问题-SQL-结果三元组语料库。数据集采用预训练模型、Seq2Seq和异常检测等算法保证高质量,并支持信用服务领域Text-to-SQL大模型的训练,可应用于融资租赁、保险投保、供应链金融等信用问数场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务